┌──────────────────────────────────────────────────────────────────────┐ │ 组织级告警 (v9.x) 单对话级阈值 (v10.5.0) │ │ ┌──────────────┐ ┌──────────────┐ │ │ │ 用量达 75%/90%│ │ 单对话达 5000 │ │ │ │ → 发邮件通知 │ │ → Agent 暂停 │ │ │ │ (被动告知) │ │ → HITL 审批 │ │ │ │ │ │ → 批准才继续 │ │ │ └──────────────┘ └──────────────┘ │ │ "事后惊讶账单" "事中决策点" │ └──────────────────────────────────────────────────────────────────────┘
官方文档:Admins and Security role holders can set per-chat credit warnings through Custom Roles。阈值不是全局开关,而是绑定到企业角色。不同角色可设不同阈值——"实习生角色" 1000 credits、"工程师角色" 10000 credits。
┌─────────────────────────────────────────────────────────────────┐ │ Agent 对话执行中 → 每次工具调用/AI 推理后累计本对话 credit 消耗 │ │ │ │ │ ▼ < 阈值 ──────────> 继续执行 │ │ ▼ ≥ 阈值(如 5000) │ │ ┌─────────────────┐ │ │ │ Agent 暂停 │ ──> 走 v10.0.0 HITL 审批流 │ │ │ 创建 Action │ 渠道:App 内通知 / Slack DM / 聊天线程 │ │ │ Request │ │ │ └─────────────────┘ │ │ │ │ │ ▼ 用户响应 │ │ 批准 → 继续 | 拒绝 → 终止 │ └─────────────────────────────────────────────────────────────────┘
Credit Warnings 复用 v10.0.0 Human-in-the-Loop 全套基础设施:Action Request 创建、多渠道送达(App/Slack/聊天线程)、暂停/恢复机制、拒绝行为(Agent 调整方法或终止)。
单对话消耗完整计入:AI 推理 + 工具调用 + 后台动作(Reflections enrichment、Evaluations)。配合 v10.6.0 workflow 也按 token 计费,阈值精确反映真实成本。
| ID | 触发场景 | 系统行为 | 优先级 |
|---|---|---|---|
| A1 | Admin/Security 编辑 Custom Role | 新增"per-chat credit warning"配置项 | P0 |
| A2 | 配置阈值 | 校验正整数,建议档位(1000/5000/10000/自定义) | P0 |
| A3 | 不同角色配不同阈值 | 按角色差异化(实习生 1000、工程师 10000) | P0 |
| ID | 触发场景 | 系统行为 | 优先级 |
|---|---|---|---|
| B1 | 对话累计消耗跨过阈值 | Agent 立即暂停,保留当前状态 | P0 |
| B2 | 达阈值 | 创建 Action Request(含已消耗量、阈值、任务摘要) | P0 |
| B3 | Action Request 创建 | 走 v10.0.0 HITL 多渠道送达 | P0 |
| ID | 触发场景 | 系统行为 | 优先级 |
|---|---|---|---|
| C1 | 用户批准 | Agent 从暂停处恢复执行 | P0 |
| C2 | 用户拒绝 | Agent 终止当前任务,返回未完成说明 | P0 |
| C3 | 用户无响应 | 保持暂停(不自动继续) | P1 |
| C4 | 同对话多次达阈值 | 每次触发新 Action Request(防批准后失控) | P1 |
作为 IT admin,我希望给实习生角色设单对话 1000 credits 阈值——这样即使实习生误启了跑偏的代码生成任务,最多烧 1000 credits 就暂停问我,而不是无限制烧下去。
画像:王磊,企业 IT admin。团队在试验代码生成 Agent,担心长链推理 + sandbox 调用意外烧信用。
验收标准:
| 竞品 | 优势 | 劣势 |
|---|---|---|
| 传统硬性限额 | 简单、确定 | 误杀有价值的长任务 |
| OpenAI/Anthropic spend limits | 组织级可控 | 粒度粗,无单会话控制 |
| LangChain tracing | 事后分析 | 事后,非事中阻断 |
| 漏斗阶段 | 事件名称 | 指标/KPI | 优先级 |
|---|---|---|---|
| 采用 | credit_warning_role_configured | 配置率(多少企业启用) | P0 |
| 触发 | credit_warning_action_request_created | 单对话超限触发率 | P0 |
| 决策 | credit_warning_approved | 批准率(高说明阈值合理) | P0 |
| 决策 | credit_warning_denied | 拒绝率(高说明 Agent 在烧钱做无用功) | P0 |
| 影响 | credit_warning_cost_saved | 拒绝终止省下的预计信用 | P1 |
| 阶段 | 时间线 | 里程碑 | 状态 |
|---|---|---|---|
| Phase 1 — 单对话阈值 | v10.5.0 | per-chat warning + HITL 暂停审批 | 已发布 |
| Phase 2 — 智能动态阈值 | v10.x | Agent 历史消耗学习,动态建议阈值 | 规划中 |
| Phase 3 — 预测式告警 | v11.x | 任务开始时预测总成本,提前告警 | 探索中 |
| Phase 4 — Agent 级预算池 | 远期 | 每个 Agent 独立预算池,跨对话共享 | 探索中 |
docs.gumloop.com/core-concepts/credits.md(Per-Chat Credit Warnings 章节,已验证)