[文档已验证] evaluations.md 新增「Letting the agent manage its own evaluations」章节完整语义:
[文档已验证] gumball.md 新增「Telling Gumball a Report Needs Work」章节完整语义:
[文档已验证] ai_models.md 模型表已收录(OpenAI provider,Vision/Tool calling 均支持)。走 ZDR 体系——30-day retention 例外仍只有 Claude Fable 家族,无治理新课题;"歧义时追问"是模型自身行为非平台工程。价值评分 3/13——对照判例 Gemini 3.8 Flash 3/13。
[文档已验证] agents.md Agent Preferences 已有 "Reasoning / thinking" 参数(OpenAI Reasoning Effort / Claude Extended Thinking token 预算 / Gemini Thinking Level 三家语义映射)+ 模型卡 Speed / Intelligence 相对评级。本次将 effort/speed 控制前置到 chat 模型选择器。价值评分 4/13——ChatGPT/Claude.ai 已有同类档位,跟进而非首创。
[无独立文档] /nodes/mcp/quo 返回 404。可拉取:calls、texts、contacts、call transcripts——通话转录是价值密度最高的部分(语音内容首次可检索)。与 Gmail(邮件)/ Slack(IM)拼成通信三模态。
v10.27.0 "Sachs Harbour"(西北领地因纽特社区,加拿大最北定居点之一)的主线只有一个词:闭环。
1. 质量回路双闭环——"反馈→记忆→改进"铺成平台级模式。梳理时间线:v9.7 Reflections(agent 从历史学习)→ v10.18 Gumball(个人 agent 三大主动特性)→ v10.23 Situations(简报→行动)→ 本次两记落子:横向,agent 在 chat 里自管自己的 evals(发现问题的对话和修标准的地方终于在一处);纵向,Daily Chew 变得可教养(standing rule:反馈泛化为产品级指令,教一次长期变)。同一范式三次落地后,"可被反馈改进"已是平台默认假设而非单点功能——产品哲学层面的复利。
2. Fable 下放 Pro——治理与商业化的平衡术。v10.26 用最严治理引入非 ZDR 的 Fable 家族,仅隔一版就下放 Pro 个人计划。企业侧采纳信号积极,付费墙向个人倾斜;且治理框架经受住了下放——个人用户得到的仍是"显式权衡"而非"默认暴露"。"先建护栏、再放宽"的模型治理次序值得记录。
3. MCP 权限半径进入 IT 管理员域。Slack Enterprise Grid 管理员工具 + GitHub 组织管理(成员/权限/Copilot 席位)——MCP 集成从"替你读写你的数据"跨入"替 IT 管组织"。配合 v10.25 Salesforce 权限继承、v10.26 SCIM 修复,Gumloop 在把 agent 从"个人效率工具"推进到"组织运营设施"。
4. 节奏观察。9 月第二周单版双 SPEC 候选(8+7)延续重版节奏;两版均为"既有范式的深化落地"而非新范式开题——Gumloop 处于 10.x 中后段收敛期,把上半年铺开的平台件(evals/Gumball/监督权)逐一闭环。
"Agent 改自己的评分标准 + 审批卡"是 agent 自治理的可抄模板。四条守则:读操作立即执行(低风险高价值)、写操作审批卡列明变更(agent 提议、人批准)、可见性守卫(agent 只看你可见的数据)、边界排除(不能评估进行中的当前对话)。任何做 agent 自配置/自改进的产品都需要这四条,缺一条就是事故。
Standing rule 语义是简报类产品反馈设计的标杆。对比 thumbs up/down(信号弱,平台自己猜怎么改)vs Gumloop 的"必填文字 → 泛化为产品级指令"(信号强,直接落到 Instructions/label/drafting preferences 的正确层级)。定向落点设计避免了"一句话改塌整套配置"的风险。我方任何有"推送/生成"性质的功能都该内嵌这个反馈环。
通信三模态补齐的路线图意义。Quo(通话转录)+ Gmail(邮件)+ Slack(IM)——agent 对"组织沟通全记录"的检索面补上最后一块。通话转录是价值密度最高的盲区:口头承诺无文档、无检索。我方知识库类产品应把"通信记录入检索"列为路线图项。
质量回路双闭环 + Fable 下放 Pro + MCP 入 IT 治理域三线并进;扣一星在两项 SPEC 均为既有范式的延伸落地,无新范式开题
Agents Manage Their Own Evaluations — 8/13 的"质量回路最后一块"。evals v10.0 上线时回路是断的:发现失败在 chat 里,修标准在配置页,验证改进要手动回填——三处分离让 evals 的实际维护成本远高于表面。本次把回路末端接上:发现→(就地)改标准→(就地)重跑验证,全程不出对话。8 分而非 9 的原因写进质疑记录:受益面限于启用 evals 的 Pro/Enterprise custom agent,且"agent 改自身配置"范式在 Gumloop 内已第三次使用。但它对 evals 启用率有杠杆作用——维护成本是质量工具被弃用的头号原因,降一个量级可能改变 evals 从"尝鲜"到"日常"的渗透曲线。
Teach Your Daily Chew — 7/13 的"教养权"。standing rule 是全部设计含量所在:如果反馈只影响单期简报,那是纠错(error correction);泛化为产品级一般指令,才是教养(teaching)。反馈摩擦压到一次点击 + 一句话(Slack Needs work),信息量比星级评分高一个量级。Daily Chew 是 Gumball 用户唯一的每日必经触点——飞轮转速最高的地方先装飞轮,顺序正确。
Fable 下放 Pro — 组评分内的战略信号。单项不评分,但"最严治理引入 → 一版后下放个人计划"的节奏演示了"先建护栏、再放宽"的模型治理次序。对照"新模型默认全量开放"的做法,这个次序在企业市场是信任差。