功能详情

1. Human-in-the-Loop for Agents(人机协同) 已有深度分析 →

新功能
💡 消除企业对 Agent 自主执行写操作的信任恐惧——Agent 从"全自动黑盒"变成"人机协同白盒",让 Agent 从 demo 走向 production
"Agents can now loop you in mid-task. They can pause to ask for approval before running a tool, or ask a question with options to choose from, then pick up right where they left off once you respond. Available in agent chats and Slack."

[文档已验证] Human in the Loop 让用户定义 Agent 何时需要暂停请求批准。三层控制体系:

层级机制控制粒度
App 级Approval SettingsAlways allow / Ask each time / Ask for writes/deletes / Custom
工具级Per-Tool 控制Always allow / Ask each time / Never allow(每个工具独立设置)
参数条件级App Rules (CEL 表达式)如"收件人不在公司域则需要审批"

Ask Human 能力:与工具审批不同,Agent 可在执行过程中主动暂停提问(含预设选项),用户选择后 Agent 从暂停处继续。支持三种审批渠道:App 内通知、Slack DM、聊天线程内。Agent 被拒绝后会调整方法而非强行执行。

评分:10/13(战略2 护城河2 用户2 复杂度2 创新2)[初始11→质疑-1→最终10]。HITL 将 Agent 从全自动推入人机协同范式,是 demo 到 production 的关键门禁。CEL 条件规则 + Ask Human + 多渠道审批是差异化亮点。

应用场景:(1) Agent 发客户邮件前请求审批 (2) 删除数据库记录前确认 (3) Agent 遇到歧义时主动暂停提供选项

2. Agent Chat Evaluations(Agent 对话评测) 已有深度分析 →

新功能
💡 解决 Agent 对话质量无法系统化度量的问题——团队不知道哪些 Agent 表现好、哪些需要优化,Agent 迭代全靠直觉
"Set evaluation criteria for an agent and have its chats automatically graded against them, so you can quickly spot which conversations went well and which need a closer look."

[推断] Agent 评测系统允许为 Agent 设定评估标准,对话自动按自定义标准打分。这与已有的 Scorer 节点(0-100 分、自定义评分维度+权重+AI 理由)在能力上呼应,但 v10.0.0 将其提升为 Agent 配置的一等公民功能——不再是手动在 Workflow 中调用 Scorer 节点,而是 Agent 配置的一部分,对话完成后自动评分。

维度说明
评估标准用户自定义评分维度(如准确性、完整性、友好度)
自动评分对话完成后自动按标准打分
结果发现快速定位质量好/差的对话
与 Scorer 节点关系Scorer 是 Workflow 级工具,Evaluations 是 Agent 级系统功能

评分:7/13(战略1 护城河1 用户2 复杂度1 创新2)[初始8→质疑-1→最终7]。Agent 质量度量是平台级需求,内置为一等公民是差异化方向。

应用场景:(1) PM 批量评估 Agent 对话质量 (2) 对比不同 Agent 配置效果差异 (3) 合规审计确认 Agent 对话符合标准

3. Revamped Agent Composer(重构 Agent 输入框) 已有深度分析 →

新功能
💡 解决 Agent 聊天输入框过于简陋——添加上下文(文件、引用其他 Agent/Skill)需要多步操作,打断思维流
"The agent chat composer has been rebuilt to make adding context easier. Mention your agents, skills, and apps with @, and attach files by uploading, picking an existing Gumloop file, or dragging and dropping them in."

[推断] Agent 聊天输入框重构:支持 @ 提及 Agent/Skills/Apps(类似 Slack 体验)、三种附件方式(上传/从已有文件选择/拖拽)。与此前 v9.9.0 Cmd+K 导航形成递进——Composer 从"文本输入"升级为"上下文聚合器"。

评分:6/13(战略1 护城河1 用户2 复杂度1 创新1)。显著 UX 提升但有参考对象(Slack @ 语法),非范式创新。

应用场景:所有 Agent 用户日常交互,快速添加文件、引用其他 Agent/Skill 作为上下文

4. Faster Agent Code Sandboxes(沙箱性能优化)

改进
💡 解决代码沙箱冷启动慢、生命周期短导致 Agent 代码迭代频繁中断的问题
"Code sandboxes now boot-up faster and have a longer lifespan so agents can iterate on code and data within a conversation more easily."

[文档已验证] Code Sandbox 是每个 Agent 的持久化安全云 VM,跨对话保持已安装包和缓存。v10.0.0 优化了冷启动时间并延长生命周期,使 Agent 在单次对话中能更长时间迭代代码和数据处理。80+ Python 包预装(pandas, numpy, matplotlib, openai, playwright 等),用户可通过 pip install 扩展。

应用场景:数据分析、代码生成类 Agent 用户,沙箱启动更快、持续更久

5. More Data in the Analytics Agent(分析 Agent 扩展)

改进
💡 解决管理员只能查看用量数据而无法了解 Agent 生态全貌——不知道哪个 Skill 最活跃、哪些触发器是僵尸、Agent 产出了什么文件
"The analytics agent can now answer questions about your triggers, skills, and the files your agents produce — like which agents have active triggers, which skills get used most, and what has been generated."

[文档已验证] Organization Analytics Agent 自 v9.0.0 引入以来持续扩展。v10.0.0 新增三个查询领域:triggers(哪些 Agent 有活跃触发器)、skills(Skill 使用排行)、文件产出(Agent 生成了什么文件)。分析 Agent 从"用量仪表盘"进化为"组织 Agent 全景分析师"。

评分:4/13(战略1 护城河1 用户1 复杂度1 创新0)。持续扩展方向正确但无壁垒。

应用场景:管理员发现最活跃 Skill 并推广、排查僵尸触发器、追踪产出文件量

6. MiniMax M3 and Kimi K2.7 Code(新模型支持)

新功能
💡 解决用户在不同任务场景下缺少最适合的模型选择——代码生成需要专用代码模型、多模态任务需要多模态模型
"Added new open-source models to the agents."

新增 MiniMax M3(多模态)和 Kimi K2.7 Code(代码生成)两个开源模型。Gumloop 持续扩展模型覆盖范围。

评分:2/13(战略1 护城河0 用户1 复杂度0 创新0)。例行模型添加。

应用场景:特定模型能力需求或成本优化的用户
其他更新
  • 平台改进 × 1 — 组织设置中可直接复制 Organization ID
  • MCP 改进 × 2 — Outlook:修复 archive/move 操作静默失败;HubSpot:修复私有文件空下载
  • Bug 修复 × 4 — 多文件 Artifact 显示修复;页面刷新前消息丢失修复;App Activity 数据导出完整性修复;Agent 编辑 Skill 静默丢失修复
竞品分析

战略方向判断

v10.0.0 "Burlington" 是一个里程碑版本——不只是版本号跃进(9.x → 10.0),更代表 Gumloop 从"自动执行"到"人机协同"的范式升级。

1. Human-in-the-Loop 是 Agent 从 demo 到 production 的最后一块拼图。在此之前 Agent 是全自动的——在 demo 时很酷,但生产环境中删错数据、发错邮件、创建了不该创建的 repo 是致命的。HITL 通过三层控制(App 级 → 工具级 → 参数条件级)解决了信任问题。

2. Agent Evaluations 开启了"Agent 质量度量"时代。如果 Agent 是未来的软件,那么评估 Agent 对话质量的标准就是未来的测试框架。将 Evals 内置为 Agent 一等公民功能,暗示 Gumloop 认为 Agent 可观测性是一个平台级需求。

3. 从量变到质变。Composer 重构 + Analytics 扩展 + Sandbox 优化——这些说明 Gumloop 在功能广度积累后进入深度打磨阶段。

与我方对比

HITL 是任何面向企业 Agent 产品的必备能力。Gumloop 的三层控制(App/工具/参数条件)设计精细——比简单的 approve/reject 更细粒度。同时支持 Slack 和 In-App 双审批渠道。如果我方有 Agent 产品,HITL 的细粒度权限模型值得对标。

Agent Evaluations 是一个被低估的能力。大量 Agent 产品在"建 Agent"但没人能"量化 Agent 表现"。Gumloop 将评估内置为平台能力,如果执行得好,会形成"评估 → 优化 → 评估"的飞轮——用户越用评估,Agent 质量越高,迁移成本越高。

★★★★★

HITL 信任基础设施 + Agent 质量度量 + 平台体验深度打磨

关键功能深度点评

Human-in-the-Loop — 信任基础设施的最后一公里。v10.0.0 之前 Gumloop 已经建好了 Agent 的所有能力(工具调用、子代理、MCP 生态、Skills),但企业凭什么信任 Agent 自主执行?HITL 用三层控制回答了这个问题。"Ask for writes/deletes"是一个绝妙的默认设置:读操作自由,写操作审批。这让 Agent 既不被过度束缚,又不会闯祸。更高级的是 App Rules(CEL 条件表达式),让审批从"这个工具需要审批"升级为"当参数满足条件X时才需要审批"——这是从信任到精细化信任的跨越。

Agent Chat Evaluations — Agent 质量的基础设施。自评估不是新概念(LangSmith、Braintrust 都在做),但内置到 Agent 平台与 Agent 生命周期集成是正确的位置。可以预见后续演进:评估结果自动触发 Agent 优化(与 Reflections 联动?)、A/B 测试 Agent 配置、评估数据作为 Skills 质量信号。如果 Gumloop 执行到位,这会成为数据飞轮的关键组件。