初始上下文

产品/团队
Gumloop / AI Agent 平台
功能
Agent Chat Evaluations — 对话完成后自动按自定义标准评分,快速发现质量问题和改进空间
版本起源
v10.0.0 "Burlington" (2026-06-16)
描述
Evaluations 是 Agent 对话的自动化质量保证系统。每次对话完成后,AI 评估器分析完整对话记录(transcript),按用户定义的评估标准(criteria)、标签(tags)、数据点(data points)和情感分析(sentiment)产出结构化评估报告。等级采用三档制(Pass / Warning / Critical),由确定性算法计算(非 LLM 判断)。Critical 等级自动通过 Slack DM 提醒 Agent 所有者(无需额外配置,只要 Slack 已连接)。按 AI credits 计费("AI Utilities" 类别),每次评估是一次 LLM 调用
解决的问题
Agent每次对话都是独特的,传统软件测试方法(assert expected output)完全不适用,PM和管理者缺乏自动化手段批量评估Agent对话质量
战略动机
如果 Agent 是未来的软件,那么评估 Agent 对话质量的标准就是未来的测试框架。此前 Scorer 节点是 Workflow 中的手动组件——不是平台级能力。v10.0.0 将 Evaluations 提升为 Agent 配置的一等公民——对话完成后自动评分。这暗示 Gumloop 认为 Agent 可观测性是一个平台级需求
目标用户与痛点
(1) PM/Agent 管理者——需批量了解 Agent 对话质量 (2) Agent Builder——需评估不同配置/提示词的效果差异 (3) 合规/质量审计——需确认 Agent 对话符合公司标准
平台范围
Web 端。评估结果在 Dashboard 中查看,Critical 通知通过 Slack DM 发送
关键成功指标
Evaluations 启用率、评估触发数/日、Critical 等级占比、评估驱动的配置修改率

1. 概览

背景

Agent 产品面临一个根本性的质量挑战:Agent 的每次对话都是独特的——没有固定的输入/输出对可以写单元测试。传统软件的测试方法(assert output == expected)在 Agent 场景中几乎不适用。

Evaluations 用 AI 评估 AI 的方式解决这个问题——不检查「输出是否精确匹配预期」,而是检查「行为是否满足质量标准」:Agent 完成任务了吗?回答准确吗?态度友好吗?

在 v10.0.0 之前,Gumloop 有 Scorer 节点(Workflow 评分工具)和 Reflections(Agent 自我审查)。Evaluations 与它们的关系:

┌──────────────────────────────────────────────────────────────────────┐
│               Gumloop Agent 质量体系                                   │
├──────────────────┬───────────────────┬───────────────────────────────┤
│  实时评分         │  自动评测           │  自主学习                      │
│  (Scorer Node)   │  (Evaluations)     │  (Reflections)               │
├──────────────────┼───────────────────┼───────────────────────────────┤
│  用于 Workflow   │  用于 Agent 对话    │  用于 Agent 自我进化          │
│  手动调用        │  自动触发           │  定时运行                      │
│  评分维度+权重   │  标准+标签+数据点   │  五步流程                      │
│                  │  +情感+等级        │  四种改进类型                  │
│  "构建评分流程"   │  "监控对话质量"     │  "发现改进机会"               │
└──────────────────┴───────────────────┴───────────────────────────────┘

目标

  1. 自动化质量度量:对话完成后无需人工介入即可获得结构化评估报告
  2. 快速发现问题:Critical 等级即时通知 Agent 所有者——不等用户投诉
  3. 可配置的质量标准:不同 Agent 有不同的质量定义——客服关心友好度,数据 Agent 关心准确性
  4. 结构化数据提取:从非结构化对话中提取标签和数据点——便于筛选、分析和趋势追踪

2. 核心机制 [文档已验证]

四大评估构建块

┌──────────────────────────────────────────────────────────────────────┐
│                    Evaluations 构建块                                  │
├──────────────────────────────────────────────────────────────────────┤
│                                                                      │
│   Quality Rules (Criteria)        Labels (Tags)                      │
│   ┌─────────────────────────┐     ┌─────────────────────────┐       │
│   │ "Agent 是否正确完成任务?" │     │ "bug_report"             │       │
│   │ "回答是否引用了数据源?"   │     │ "feature_request"        │       │
│   │ "是否避免了幻觉?"        │     │ "refund_inquiry"         │       │
│   │                          │     │ "technical_question"     │       │
│   │ Yes/No 判断 + 理由        │     │                          │       │
│   └─────────────────────────┘     └─────────────────────────┘       │
│                                                                      │
│   Structured Values (Data Points)  Sentiment Analysis                │
│   ┌─────────────────────────┐     ┌─────────────────────────┐       │
│   │ "客户 ID: 12345"         │     │ 😊 Positive              │       │
│   │ "订单金额: $2,500"       │     │ 😐 Neutral               │       │
│   │ "涉及产品: Widget Pro"   │     │ 😟 Negative              │       │
│   │                          │     │                          │       │
│   │ 从对话中提取结构化字段     │     │ 可选影响整体等级          │       │
│   └─────────────────────────┘     └─────────────────────────┘       │
└──────────────────────────────────────────────────────────────────────┘

评测流程

┌──────────┐    ┌──────────┐    ┌──────────┐    ┌──────────┐    ┌──────────┐
│  Step 1  │───▶│  Step 2  │───▶│  Step 3  │───▶│  Step 4  │───▶│  Step 5  │
│ 对话完成  │    │ 构建记录  │    │ AI 分析   │    │ 计算等级  │    │ 持久化+   │
│          │    │          │    │          │    │          │    │ 通知      │
└──────────┘    └──────────┘    └──────────┘    └──────────┘    └──────────┘
     │               │               │               │               │
     ▼               ▼               ▼               ▼               ▼
  Agent 达到      构建角色标注    单个结构化     基于标准失败    Critical →
 "completed"      的完整对话      LLM 调用      数+优先级+      Slack DM
  状态           记录            分析所有       情感+操作      提醒所有者
 (Incognito                       构建块         失败次数
  除外)                                          确定等级

等级体系(三档制)

等级API 值含义触发条件
Passpass满足所有标准无标准失败、对话非失败、情感非负面
Warningneeds_review需人工复核Warning 优先级标准失败,对话结果 "failure",负面情感影响等级
Criticalneeds_attention需立即处理Critical 优先级标准失败,交互期间工具/操作失败

等级计算逻辑(确定性,非 LLM 判断)

等级在 LLM 返回结果后由确定性算法计算(不由评估 LLM 主观判定),严格按以下顺序短路求值:

┌──────────────────────────────────────────────────────────────────────┐
│  评估 LLM 返回各标准 pass/fail + 数据点 + 情感后,按顺序判断:   │
│                                                                  │
│  ① 有 action failure(工具错误)?        ── 是 ──▶ Critical    │
│                                            │                      │
│  ② 任何 Critical 优先级标准失败?          ── 是 ──▶ Critical    │
│                                            │                      │
│  ③ 任何 Warning 优先级标准失败?          ── 是 ──▶ Warning     │
│                                            │                      │
│  ④ 整体 call outcome == "failure"?        ── 是 ──▶ Warning     │
│                                            │                      │
│  ⑤ 情感为负面 且 配置了影响等级?          ── 是 ──▶ Warning     │
│                                            │                      │
│  ⑥ 以上都不满足                            ──────▶ Pass          │
└──────────────────────────────────────────────────────────────────┘

关键含义:工具执行失败 = 自动 Critical——比标准失败更严重的信号,意味着 Agent 的工具链出问题而非"只是"行为不达标。

标准的优先级与类型

优先级(仅 2 档,非传统三档):Warning(失败→降为 Warning,适用质量标准如语气/轻微跑题);Critical(失败→降为 Critical + 触发 Slack DM,适用红线规则如数据泄露/合规违规/未授权折扣)。

类型(4 种分类):Prohibited action(不得做某事)、Prohibited words(不得说某些内容)、Voice & tone(特定风格)、Other(其他,如保持主题/准确信息)。

标签系统与数据点提取

用户定义受控标签词汇(如 "bug_report", "feature_request"),评估器从对话中识别并标记。限制:每 Agent 最多 50 个标签,标签名最长 100 字符,描述最长 500 字符。数据点从对话中提取结构化字段(如客户 ID、订单号),4 种类型:Text / Boolean / Integer / Number。限制:每 Agent 最多 40 个数据点。

重新评估与手动触发

评估后继续对话 → 新消息扩展记录 → 再次 completed → 自动运行新评估 → 新评估替换旧结果(非追加)。全自动。此外可在 Chats 页手动触发评测(单条或批量多选),用于回填历史对话、修改配置后重评、失败重试、按需抽检。

3. 功能需求

模块 A — 标准化配置

ID触发场景系统行为优先级
A1用户进入 Evaluations 设置展示标准、标签、数据点、情感四个配置区。支持 Enable/DisableP0
A2用户创建 Quality Rule定义 Yes/No 标准(plain English),设置类型(Prohibited action / Prohibited words / Voice & tone / Other)和优先级(Warning / Critical)P0
A3用户定义标签词汇创建受控标签列表。可开启「自动建议标签」P0
A4用户定义数据点创建结构化字段定义(名称+类型+描述)P1

模块 B — 自动评测执行

ID触发场景系统行为优先级
B1对话达到 "completed" 状态自动触发评测(Incognito 和系统交互除外)。构建角色标注的完整对话记录P0
B2对话记录过长自动裁剪,保留最近消息 + 关键上下文P1
B3LLM 分析对话单次结构化调用分析对话,对照所有构建块P0
B4确定性计算等级严格按 6 步顺序短路求值(action failure → Critical 标准失败 → Warning 标准失败 → call failure → 负面情感 → Pass),产出 Pass / Warning / CriticalP0

模块 C — 结果展示与通知

ID触发场景系统行为优先级
C1用户查看 Dashboard展示所有对话评估结果列表。可按等级、日期、Agent、标签筛选P0
C2用户点击某条评估展开完整详情:各标准通过/失败+理由、标签、数据点、情感P0
C3评估结果为 CriticalAgent 所有者立即收到 Slack DM(含摘要和直达链接)P0
C4评估后继续对话再次 completed 时自动重新评估,新结果替换旧结果P0
C5用户在 Chats 页手动触发单条或批量多选触发评测(回填历史对话 / 修改配置后重评 / 抽检)P0

模块 D — 配额、计费与 API

ID触发场景系统行为优先级
D1创建标准/标签/数据点校验配额上限(Criteria 30 / Tags 50 / Data points 40)P0
D2运行评估前检查 AI credits 是否充足,不足则静默跳过(不阻塞对话)P0
D3评估完成计入 AI credits("AI Utilities" 类别),用量在 Usage & Limits 可查P0
D4调用 Evaluations API提供 List / Retrieve / Metrics 端点,支持 grade 筛选 + 游标分页P1

4. 用户场景

场景 1 — PM 批量评估客服 Agent 对话质量

作为 PM,我希望为每个客服 Agent 设定评估标准(准确性、完整性、友好度、任务完成度),对话完成后自动评分。每天早上打开 Dashboard 查看 Critical 和 Warning 的对话。

用户画像:王芳,30 岁,产品经理。负责 5 个客服 Agent,每个每天处理 50-100 次对话。无法手动检查所有对话。

验收标准:

  • 设置 4 条 Quality Rules:准确性、完整性、友好度、任务完成度
  • 每条对话完成后自动评分并打标签("refund", "bug", "feature_request")
  • Dashboard 按日期展示,Critical/Warning 优先排前面
  • 点击某条对话看到具体原因:「标准『语气友好』失败——Agent 使用了技术术语但用户表示不理解」
  • 王芳据此更新 Agent 的 Instructions。一周后该标准通过率从 78% → 94%

场景 2 — Agent Builder:A/B 测试不同配置

作为 Agent Builder,我希望对两个 Agent 开启相同的 Evaluations 标准,运行一周后对比评分分布——用数据而非直觉决定哪个配置更好。

用户画像:刘强,28 岁,Agent Builder。设计了两个客服 Agent——一个用长指令(80 条规则),一个用短指令+Skills(20 条规则+Skills)。

验收标准:

  • 两个 Agent 配置相同的 4 条标准
  • 一周后 Dashboard 分别筛选两个 Agent,对比评分分布
  • 对比 Pass 率分布:长指令 Agent Pass 率 82%,短指令+Skills Agent Pass 率 94%
  • 数据驱动决策——采用短指令+Skills 方案

5. 竞争分析

竞品功能/行为优势劣势
LangSmith (LangChain)LLM 应用评估和追踪平台完整评测管线(数据集+实验+对比)需 SDK 集成——不是 Agent 内置功能。开发者工具——PM 无法使用
BraintrustAI 产品评估和实验平台强大的 A/B 测试和评分器系统需代码集成。不是平台 native 功能——需额外部署
Gumloop Scorer NodeWorkflow 中可配置的评分节点灵活——自定义维度+权重+AI 理由手动节点——需在 Workflow 中调用。不是自动评测
Gumloop ReflectionsAgent 自主审查历史工作并提议改进Agent 自主发现改进机会关注「改进」而非「度量」——不产生结构化质量评分

关键洞察

  1. 零配置是核心差异化:LangSmith 和 Braintrust 需 SDK 集成和代码。Gumloop Evaluations 在 Agent 设置中配置——不需要代码、不需要部署。这让评测从「工程师的领域」进入「PM 的领域」
  2. Agent 生命周期集成是正确位置:评测不应是独立系统——应与 Agent 运行生命周期绑定。对话完成 → 自动评分 → Dashboard → Critical 告警——这个闭环只有平台内部才能实现
  3. 与 Reflections 互补是质量飞轮的关键:Evaluations 度量(人类视角)+ Reflections 改进(Agent 视角)= 完整的 Agent 质量飞轮。当前两者分离——未来可能联动:评估数据 Feed 到 Reflections
  4. 数据点提取是低调但有价值的能力:从对话中结构化提取客户 ID、订单号——本质上是「对话挖掘」。这些数据可输入 Analytics Agent 做深入分析

6. 遥测

漏斗阶段事件名称触发条件指标/KPI优先级
采用evaluations_enabled为 Agent 开启 Evaluations启用率P0
采用evaluation_criteria_created创建评估标准标准数/AgentP1
执行evaluation_run_completed对话完成触发评测评测次数/日P0
质量evaluation_grade_distribution每次评测产出等级Pass / Warning / Critical 分布P0
质量evaluation_criterion_failed某条标准失败各标准失败率排名P0
使用evaluation_detail_viewed用户展开查看详情详情查看率P1
告警evaluation_critical_alert_sentCritical 触发 Slack DM告警数/日P1
影响agent_config_changed_after_eval评估后修改 Agent 配置评估驱动的修改率P0

7. 未来演进方向

阶段时间线里程碑状态
Phase 1 — 核心评测v10.0.0标准(4 类型+2 优先级)+标签+数据点+情感+三档等级(确定性计算)+手动评测+Slack 告警+API已发布
Phase 2 — 趋势与分析v10.x趋势图表(周/月对比)、跨 Agent 评分排行榜、标准失败热力图规划中
Phase 3 — 主动优化v11.x评估数据 Feed 到 Reflections——自动发现系统性质量问题并提议修复。A/B 对比面板探索中
Phase 4 — 合规审计远期行业合规模板(HIPAA、SOC2、GDPR)、自动合规报告、评估数据导出到 SIEM探索中

关键演进判断

  1. 评估驱动的优化闭环是终极目标:当前 Evaluations 是「发现问题」。真正的价值在「解决问题」——评估结果自动触发 Reflections 生成改进提案。Evaluations → Reflections → 改进 → 再评估验证——这才是完整的 Agent 质量飞轮
  2. 评估标准的社区共享是网络效应入口:如果未来支持「评估标准模板市场」——客服/数据分析 Agent 标准模板——新用户一键导入行业最佳实践。这是网络效应
  3. 评估数据本身就是训练数据:高质量的评估数据可用于训练更准确的评估模型——甚至 fine-tune Agent 本身。这是数据飞轮的潜在方向
📚 源文档参考

gumloop-docs_evaluations.md — Evaluations 官方帮助文档完整存档(docs.gumloop.com/core-concepts/evaluations,2026-07-06 二次验证重抓)