功能详情
💡 eval 标准会随业务漂移——用户发现"agent 总在 X 上失败"后,得自己钻进配置页手改 criteria、再手动回填重跑历史对话,质量回路是断的:发现问题的对话和修标准的地方不在一处,维护成本全压在人身上
"Turn on the Manage Evaluations ability and you can ask an agent to edit its own evaluation criteria or re-run evaluations on past chats. It checks with you before changing anything."

[文档已验证] evaluations.md 新增「Letting the agent manage its own evaluations」章节完整语义:

  • 能力开关——开启 Manage Evaluations ability 后,任何能编辑该 agent 的人都可在 chat 中要求 review 结果、增改 criteria、重跑历史 chats
  • 读写分离——读操作立即执行("What's failing?" 读 rubric + 按 criterion 失败率汇总,默认近 30 天、最长回看 1 年,无需审批);写操作一律先出 approval card,列明将变更什么
  • 设置补丁语义——只 patch 点名的项(开关/频率/分析模型/语言/情感/通知/自动标签),其余不动
  • 批量重跑——≤200 条 finished chats,按当前配置计费,已在评估中的跳过;30-criteria 上限仍适用
  • 可见性守卫——agent 只看你可见的 chats;不能评估它正在与你进行的当前对话
应用场景:(1) "最近哪条 criterion 失败最多?"——拉失败率汇总看薄弱项 (2) "给'引用来源'加条更严的标准"——agent 起草措辞、审批卡确认后保存 (3) 改完标准把上月重点对话重跑——新旧标准效果对比
价值评分 8/13(战略2 护城河2 用户2 复杂度2 创新1→0)[初始9→质疑-1→最终8] — SPEC 候选,经 spec_agent-chat-evaluations v2.2 承载
💡 Daily Chew 每天推的东西不对——漏了你在意的、塞了无关的——用户只能默默关掉或忍着;简报没有反馈通道,错一次明天还错,个性化永远停在"初始 Instructions 写得好不好"
"Open a Daily Chew as a chat and tell Gumball what it missed, and it remembers for next time. In Slack, hit Needs work on a brief to do the same in a thread. Works for Meeting Prep too."

[文档已验证] gumball.md 新增「Telling Gumball a Report Needs Work」章节完整语义:

  • 双通道——Slack DM 交付的 brief 带 Needs work / Open in Gumloop 双按钮(对话框必填文字);Gumloop 内可把 Daily Chew 直接作为 chat 打开再说
  • 线程化回应——反馈作为 thread 发在该 brief 下,Gumball 在线程回复,brief 上下文自带
  • standing rule 语义(设计关键)——反馈泛化为"该产品的一般指令"而非针对单期简报的备注,下次运行即不同——教一次,长期变
  • 定向落点——反馈简报有错 → 改该产品 Instructions;反馈 Smart Inbox → 改对应 label 或 drafting preferences;schedule/sources/delivery 非请不动
  • 权限守卫——仅 brief 接收者本人可用 Needs work(Gumball 是个人的)
应用场景:(1) "别再塞竞争对手的营销动态"——下期起消失 (2) "Linear 的 issue 变更对我重要"——教一次以后每期纳入 (3) 会议简报漏了关键与会者背景——一句话补上,此后都带上
价值评分 7/13(战略2 护城河2 用户2 复杂度1 创新1→0)[初始8→质疑-1→最终7] — SPEC 候选,经 spec_gumball v1.2 承载

3. GPT-6 Astra(OpenAI 最强模型)⭐文档已验证

新功能
💡 长、多步的编码/研究/文档起草需要 OpenAI 侧最强模型;且模型会在指令歧义时追问而非瞎猜——长任务跑偏的前置止血
"OpenAI's most capable model is now available. It's a big step up on long, multi-step work like coding, research, and drafting documents, and it asks instead of guessing when your instructions are ambiguous."

[文档已验证] ai_models.md 模型表已收录(OpenAI provider,Vision/Tool calling 均支持)。走 ZDR 体系——30-day retention 例外仍只有 Claude Fable 家族,无治理新课题;"歧义时追问"是模型自身行为非平台工程。价值评分 3/13——对照判例 Gemini 3.8 Flash 3/13。

应用场景:(1) 深度研究/复杂编码的最强 OpenAI 选项 (2) 指令含糊时主动澄清——对"怕 agent 自作主张"的用户是信任点

4. Effort and Speed Controls(推理力度与速度控制)⭐文档已验证

新功能
💡 同一个 agent 既有"随手问问"又有"深度研究",但推理深度此前锁在 Agent 配置页——chat 里想临时调"这一趟跑多深/多快"做不到
"Set reasoning effort and speed right in the model picker."

[文档已验证] agents.md Agent Preferences 已有 "Reasoning / thinking" 参数(OpenAI Reasoning Effort / Claude Extended Thinking token 预算 / Gemini Thinking Level 三家语义映射)+ 模型卡 Speed / Intelligence 相对评级。本次将 effort/speed 控制前置到 chat 模型选择器。价值评分 4/13——ChatGPT/Claude.ai 已有同类档位,跟进而非首创。

应用场景:(1) 简单问题切低 effort——省钱提速 (2) 深研究前切高 effort——榨满推理

5. Quo MCP(商务电话系统)

集成
💡 通话记录(打给谁、说了什么、答应了什么)是企业沟通的第三种模态,此前 agent 数据面只有邮件(Gmail)和 IM(Slack),语音/电话一片空白
"Agents can now pull calls, texts, contacts, and call transcripts from Quo, your business phone system."

[无独立文档] /nodes/mcp/quo 返回 404。可拉取:calls、texts、contacts、call transcripts——通话转录是价值密度最高的部分(语音内容首次可检索)。与 Gmail(邮件)/ Slack(IM)拼成通信三模态。

应用场景:(1) "上周和客户通话里答应了什么"——从转录取原文 (2) Meeting Prep 自动纳入最近通话 (3) 销售 agent 会前拉该联系人全部往来

6-8. Request Access to Restricted Models / Quote Part of a Reply / Drag to Reorder Agents

改进 ×3
💡 受限模型灰掉无申请通道(要离开 chat 找 admin);长回复只有一段要追问(复述指涉精度丢失);高频 agent 沉在侧栏深处
  • Request Access to Restricted Models——受限模型在 picker 里带 Request 按钮,chat 内就地发起申请;承接 connectors/Brain 既有 Request Access 模式(spec_request-access-*)扩展到模型域
  • Quote Part of a Reply——选中 agent 回复的任意文字,引用到下一条消息精确追问;ChatGPT/Claude.ai 已有同款(跟进)
  • Drag to Reorder Agents——侧栏拖拽排序,Cmd+K 检索顺序同步——两套入口一套心智
应用场景:治理资源从"灰掉"变"可申请";追问精确到段;工作台个人化

9. Platform Improvements(性能 + Fable 下放 + 监督 UX 收尾)

平台改进
💡 chat 启动慢/长对话卡顿;后台 subagent 占屏难总览;Pro 个人用户用不上 1M 上下文 Fable;Brain 源 setup 黑盒失败无重试
  • Agent chats 启动/打开更快,长对话多文件仍流畅(运行时性能投资)
  • 后台 subagent 显示为单卡片:状态 + 停止按钮 + 结果落地(v10.26 监督权的 UX 收尾)
  • Claude Fable 5/5.1 上 Pro 计划(此前 org admin 治理域专属)——治理与商业化的平衡术
  • Cmd+K 文件搜索大幅提速;Gumball chat 头部(返回/重命名/复制链接/分享/删除)
  • chat 历史筛选多选(类型/触发器/人/频道/状态组合)
  • connector 作 Brain 源显示 setup 进度 + 失败重试;API 与 CLI 可重命名 chats
应用场景:(1) Pro 个人用户直接用上 1M 上下文 Fable,不再等组织放行 (2) 后台 subagent 一屏总览,跑偏即刻叫停
其他更新
  • MCP 改进 × 2(组织管理权) — Slack 全面写权:加入公共频道、定时/编辑消息、书签/提醒/已保存项、状态与 DND、用户组管理、文件操作;自有 app on Enterprise Grid 获管理员工具(workspaces/channels/emoji/app 审批)。GitHub 组织管理:org members 与 invitations、teams 及仓库权限、blocked users、Copilot seats——MCP 权限半径从"用户数据读写"跨入"IT 管理员域",AI 工具的采购分配本身被另一个 AI 平台的 agent 管理
  • Bug 修复 × 10 — 修复部分模型 chat 中途静默停止;修复大 skill 小编辑耗时数分钟;修复 agent 偶发丢失 workspace 文件;修复 Daily Chew catch-up 重复已看条目(Teach 功能的体验前置);修复 Smart Inbox 草稿截断转发邮件;修复 Brain issue 计数不一致;修复个人 Linear Brain 源不显示文档;修复共享 agent 页卡登录屏;修复 SCIM 跳过 email 与 IdP 不同的用户 + 组更新只应用第一个成员(企业身份同步的典型深水区)
竞品分析

战略方向判断

v10.27.0 "Sachs Harbour"(西北领地因纽特社区,加拿大最北定居点之一)的主线只有一个词:闭环。

1. 质量回路双闭环——"反馈→记忆→改进"铺成平台级模式。梳理时间线:v9.7 Reflections(agent 从历史学习)→ v10.18 Gumball(个人 agent 三大主动特性)→ v10.23 Situations(简报→行动)→ 本次两记落子:横向,agent 在 chat 里自管自己的 evals(发现问题的对话和修标准的地方终于在一处);纵向,Daily Chew 变得可教养(standing rule:反馈泛化为产品级指令,教一次长期变)。同一范式三次落地后,"可被反馈改进"已是平台默认假设而非单点功能——产品哲学层面的复利。

2. Fable 下放 Pro——治理与商业化的平衡术。v10.26 用最严治理引入非 ZDR 的 Fable 家族,仅隔一版就下放 Pro 个人计划。企业侧采纳信号积极,付费墙向个人倾斜;且治理框架经受住了下放——个人用户得到的仍是"显式权衡"而非"默认暴露"。"先建护栏、再放宽"的模型治理次序值得记录。

3. MCP 权限半径进入 IT 管理员域。Slack Enterprise Grid 管理员工具 + GitHub 组织管理(成员/权限/Copilot 席位)——MCP 集成从"替你读写你的数据"跨入"替 IT 管组织"。配合 v10.25 Salesforce 权限继承、v10.26 SCIM 修复,Gumloop 在把 agent 从"个人效率工具"推进到"组织运营设施"。

4. 节奏观察。9 月第二周单版双 SPEC 候选(8+7)延续重版节奏;两版均为"既有范式的深化落地"而非新范式开题——Gumloop 处于 10.x 中后段收敛期,把上半年铺开的平台件(evals/Gumball/监督权)逐一闭环。

与我方对比

"Agent 改自己的评分标准 + 审批卡"是 agent 自治理的可抄模板。四条守则:读操作立即执行(低风险高价值)、写操作审批卡列明变更(agent 提议、人批准)、可见性守卫(agent 只看你可见的数据)、边界排除(不能评估进行中的当前对话)。任何做 agent 自配置/自改进的产品都需要这四条,缺一条就是事故。

Standing rule 语义是简报类产品反馈设计的标杆。对比 thumbs up/down(信号弱,平台自己猜怎么改)vs Gumloop 的"必填文字 → 泛化为产品级指令"(信号强,直接落到 Instructions/label/drafting preferences 的正确层级)。定向落点设计避免了"一句话改塌整套配置"的风险。我方任何有"推送/生成"性质的功能都该内嵌这个反馈环。

通信三模态补齐的路线图意义。Quo(通话转录)+ Gmail(邮件)+ Slack(IM)——agent 对"组织沟通全记录"的检索面补上最后一块。通话转录是价值密度最高的盲区:口头承诺无文档、无检索。我方知识库类产品应把"通信记录入检索"列为路线图项。

★★★★

质量回路双闭环 + Fable 下放 Pro + MCP 入 IT 治理域三线并进;扣一星在两项 SPEC 均为既有范式的延伸落地,无新范式开题

关键功能深度点评

Agents Manage Their Own Evaluations — 8/13 的"质量回路最后一块"。evals v10.0 上线时回路是断的:发现失败在 chat 里,修标准在配置页,验证改进要手动回填——三处分离让 evals 的实际维护成本远高于表面。本次把回路末端接上:发现→(就地)改标准→(就地)重跑验证,全程不出对话。8 分而非 9 的原因写进质疑记录:受益面限于启用 evals 的 Pro/Enterprise custom agent,且"agent 改自身配置"范式在 Gumloop 内已第三次使用。但它对 evals 启用率有杠杆作用——维护成本是质量工具被弃用的头号原因,降一个量级可能改变 evals 从"尝鲜"到"日常"的渗透曲线。

Teach Your Daily Chew — 7/13 的"教养权"。standing rule 是全部设计含量所在:如果反馈只影响单期简报,那是纠错(error correction);泛化为产品级一般指令,才是教养(teaching)。反馈摩擦压到一次点击 + 一句话(Slack Needs work),信息量比星级评分高一个量级。Daily Chew 是 Gumball 用户唯一的每日必经触点——飞轮转速最高的地方先装飞轮,顺序正确。

Fable 下放 Pro — 组评分内的战略信号。单项不评分,但"最严治理引入 → 一版后下放个人计划"的节奏演示了"先建护栏、再放宽"的模型治理次序。对照"新模型默认全量开放"的做法,这个次序在企业市场是信任差。