[文档已验证] Human in the Loop 让用户定义 Agent 何时需要暂停请求批准。三层控制体系:
| 层级 | 机制 | 控制粒度 |
|---|---|---|
| App 级 | Approval Settings | Always allow / Ask each time / Ask for writes/deletes / Custom |
| 工具级 | Per-Tool 控制 | Always allow / Ask each time / Never allow(每个工具独立设置) |
| 参数条件级 | App Rules (CEL 表达式) | 如"收件人不在公司域则需要审批" |
Ask Human 能力:与工具审批不同,Agent 可在执行过程中主动暂停提问(含预设选项),用户选择后 Agent 从暂停处继续。支持三种审批渠道:App 内通知、Slack DM、聊天线程内。Agent 被拒绝后会调整方法而非强行执行。
评分:10/13(战略2 护城河2 用户2 复杂度2 创新2)[初始11→质疑-1→最终10]。HITL 将 Agent 从全自动推入人机协同范式,是 demo 到 production 的关键门禁。CEL 条件规则 + Ask Human + 多渠道审批是差异化亮点。
[推断] Agent 评测系统允许为 Agent 设定评估标准,对话自动按自定义标准打分。这与已有的 Scorer 节点(0-100 分、自定义评分维度+权重+AI 理由)在能力上呼应,但 v10.0.0 将其提升为 Agent 配置的一等公民功能——不再是手动在 Workflow 中调用 Scorer 节点,而是 Agent 配置的一部分,对话完成后自动评分。
| 维度 | 说明 |
|---|---|
| 评估标准 | 用户自定义评分维度(如准确性、完整性、友好度) |
| 自动评分 | 对话完成后自动按标准打分 |
| 结果发现 | 快速定位质量好/差的对话 |
| 与 Scorer 节点关系 | Scorer 是 Workflow 级工具,Evaluations 是 Agent 级系统功能 |
评分:7/13(战略1 护城河1 用户2 复杂度1 创新2)[初始8→质疑-1→最终7]。Agent 质量度量是平台级需求,内置为一等公民是差异化方向。
[推断] Agent 聊天输入框重构:支持 @ 提及 Agent/Skills/Apps(类似 Slack 体验)、三种附件方式(上传/从已有文件选择/拖拽)。与此前 v9.9.0 Cmd+K 导航形成递进——Composer 从"文本输入"升级为"上下文聚合器"。
评分:6/13(战略1 护城河1 用户2 复杂度1 创新1)。显著 UX 提升但有参考对象(Slack @ 语法),非范式创新。
[文档已验证] Code Sandbox 是每个 Agent 的持久化安全云 VM,跨对话保持已安装包和缓存。v10.0.0 优化了冷启动时间并延长生命周期,使 Agent 在单次对话中能更长时间迭代代码和数据处理。80+ Python 包预装(pandas, numpy, matplotlib, openai, playwright 等),用户可通过 pip install 扩展。
[文档已验证] Organization Analytics Agent 自 v9.0.0 引入以来持续扩展。v10.0.0 新增三个查询领域:triggers(哪些 Agent 有活跃触发器)、skills(Skill 使用排行)、文件产出(Agent 生成了什么文件)。分析 Agent 从"用量仪表盘"进化为"组织 Agent 全景分析师"。
评分:4/13(战略1 护城河1 用户1 复杂度1 创新0)。持续扩展方向正确但无壁垒。
新增 MiniMax M3(多模态)和 Kimi K2.7 Code(代码生成)两个开源模型。Gumloop 持续扩展模型覆盖范围。
评分:2/13(战略1 护城河0 用户1 复杂度0 创新0)。例行模型添加。
v10.0.0 "Burlington" 是一个里程碑版本——不只是版本号跃进(9.x → 10.0),更代表 Gumloop 从"自动执行"到"人机协同"的范式升级。
1. Human-in-the-Loop 是 Agent 从 demo 到 production 的最后一块拼图。在此之前 Agent 是全自动的——在 demo 时很酷,但生产环境中删错数据、发错邮件、创建了不该创建的 repo 是致命的。HITL 通过三层控制(App 级 → 工具级 → 参数条件级)解决了信任问题。
2. Agent Evaluations 开启了"Agent 质量度量"时代。如果 Agent 是未来的软件,那么评估 Agent 对话质量的标准就是未来的测试框架。将 Evals 内置为 Agent 一等公民功能,暗示 Gumloop 认为 Agent 可观测性是一个平台级需求。
3. 从量变到质变。Composer 重构 + Analytics 扩展 + Sandbox 优化——这些说明 Gumloop 在功能广度积累后进入深度打磨阶段。
HITL 是任何面向企业 Agent 产品的必备能力。Gumloop 的三层控制(App/工具/参数条件)设计精细——比简单的 approve/reject 更细粒度。同时支持 Slack 和 In-App 双审批渠道。如果我方有 Agent 产品,HITL 的细粒度权限模型值得对标。
Agent Evaluations 是一个被低估的能力。大量 Agent 产品在"建 Agent"但没人能"量化 Agent 表现"。Gumloop 将评估内置为平台能力,如果执行得好,会形成"评估 → 优化 → 评估"的飞轮——用户越用评估,Agent 质量越高,迁移成本越高。
HITL 信任基础设施 + Agent 质量度量 + 平台体验深度打磨
Human-in-the-Loop — 信任基础设施的最后一公里。v10.0.0 之前 Gumloop 已经建好了 Agent 的所有能力(工具调用、子代理、MCP 生态、Skills),但企业凭什么信任 Agent 自主执行?HITL 用三层控制回答了这个问题。"Ask for writes/deletes"是一个绝妙的默认设置:读操作自由,写操作审批。这让 Agent 既不被过度束缚,又不会闯祸。更高级的是 App Rules(CEL 条件表达式),让审批从"这个工具需要审批"升级为"当参数满足条件X时才需要审批"——这是从信任到精细化信任的跨越。
Agent Chat Evaluations — Agent 质量的基础设施。自评估不是新概念(LangSmith、Braintrust 都在做),但内置到 Agent 平台与 Agent 生命周期集成是正确的位置。可以预见后续演进:评估结果自动触发 Agent 优化(与 Reflections 联动?)、A/B 测试 Agent 配置、评估数据作为 Skills 质量信号。如果 Gumloop 执行到位,这会成为数据飞轮的关键组件。