初始上下文

产品/团队
Gumloop / AI Agent 平台(企业版组织治理方向)
功能
Insights Dashboard — 组织级 credit 用量拆解、单次运行成本归因、用量预测
版本起源
v10.2.0 "Revelstoke" (2026-06-22)
描述
Insights 是位于组织设置(Organization Settings)中的独立仪表盘,从总览、按模型拆分、单次运行下钻(Credit Explorer)、用量预测(Forecasts)四个层级展示整个组织的 credit 消耗。把"事后惊讶账单"升级为"事前可预测、事后可归因"的成本治理能力
解决的问题
企业管理员面对 Agent 用量黑洞的焦虑——钱在烧但不知道烧在哪个模型、哪次运行、哪个 Agent,更无法预测月底账单,预算管理全靠事后补救
战略动机
Agent 产品的成本结构与传统 SaaS 截然不同——按用量(credit)计费,单次复杂任务可能消耗数十到数百 credit,成本曲线陡峭且不可预测。这是企业不敢大规模采用 Agent 的核心心理障碍。Gumloop 自 v9.0.0 起持续扩展企业可观测性,Insights 是这条线的"成本可观测性"封顶之作
目标用户与痛点
(1) CFO/IT 负责人——需预测月底开销、提前调预算 (2) 平台/运营管理员——需定位成本失控的 Agent、异常运行峰值 (3) 采购决策者——需量化 AI Agent 投资的 ROI 和成本趋势
平台范围
Web 端组织设置。数据由平台后端聚合,无需额外部署
关键成功指标
Insights 页访问率(MAU/活跃组织)、Forecasts 查看率、下钻后采取优化动作的频率、预测准确度
重点关注领域
成本可观测性、企业计费透明度、用量预测准确性、权限与数据安全
🔶 关于评分
该功能经五维评分得 6/13(战略1 护城河1 用户2 复杂度1 创新1),低于 7 分 SPEC 候选阈值。但用户判断其值得生成 Spec——成本可观测性是企业买家的真实痛点(CFO 敢不敢批预算的关键),且 Forecasts 预测性成本分析在 Agent 平台中较新。故提级生成。

1. 概览

背景

Agent 产品的计费模型有一个根本性的"可预测性"问题:传统 SaaS 按席位定价,月费固定;Agent 按 credit 计费,而 credit 消耗受 模型选型 × 对话长度 × 上下文累积 × 工具数量 × 多步操作 五重因素驱动,单次复杂任务可能从 2 credit 飙升到 200+ credit。同一个 Agent换个模型预设或接更多 MCP 工具,月度成本可能翻几倍。

在这种结构下,企业管理员的体验是:月底收到账单才知道花了多少,且不知道钱花在哪。这是阻碍企业从"试点 1 个 Agent"走向"全组织部署"的关键心理障碍——不是功能不够,而是"不敢放开用"。

v10.2.0 之前,Gumloop 已有零散的成本可见性(Credit Logs、Account Dashboard、History 页 per-run 显示),但碎片化、事后、聚合不足。Insights 把这些统一为组织级、可下钻、可预测的仪表盘。

┌──────────────────────────────────────────────────────────────────────┐
│               Gumloop 成本可观测性演进                                  │
├──────────────────┬───────────────────┬───────────────────────────────┤
│  事后审计         │  实时归因           │  事前预测                      │
│  (Credit Logs)   │  (Insights)        │  (Insights Forecasts)        │
├──────────────────┼───────────────────┼───────────────────────────────┤
│  v7.7.0          │  v10.2.0           │  v10.2.0                      │
│  按用户/任务      │  按模型 + 单次运行   │  预测未来用量走向              │
│  看历史消费记录   │  下钻 Credit        │  从"事后惊讶"到               │
│                  │  Explorer          │  "事前可控"                   │
│  "钱花哪了"      │  "哪次跑炸了"       │  "接下来会花多少"             │
└──────────────────┴───────────────────┴───────────────────────────────┘

目标

  1. 成本可归因:把组织 credit 消耗拆解到模型维度和单次运行维度
  2. 用量可预测:基于历史趋势预测未来用量,把企业从"事后惊讶账单"拉到"事前可控预算"
  3. 成本可行动:直接定位成本失控的 Agent/模型/运行并采取行动(切换 Org Model Presets)
  4. 降低采购心理摩擦:让"不知道会烧多少钱"不再是大规模采用 Agent 的障碍

2. 核心机制 [部分文档已验证 / 部分推断]

四层仪表盘架构

┌──────────────────────────────────────────────────────────────────────┐
│                    Insights 仪表盘四层视图                              │
├──────────────────────────────────────────────────────────────────────┤
│                                                                      │
│   Layer 1 — Overview(总览)                                          │
│   ┌─────────────────────────────────────────────────────────┐       │
│   │  全组织 credit 总用量 · 趋势曲线 · 同比/环比              │       │
│   │  本月已用 / 预算上限 · 健康度指示                         │       │
│   └─────────────────────────────────────────────────────────┘       │
│                          │ 下钻                                       │
│                          ▼                                            │
│   Layer 2 — Per-model View(按模型拆分)                              │
│   ┌─────────────────────────────────────────────────────────┐       │
│   │  每个模型的 credit 消耗 + 美元成本                       │       │
│   │  Expert (30-200) vs Advanced (15-25) vs Budget (2-4)    │       │
│   │  发现"哪个模型最烧钱"                                    │       │
│   └─────────────────────────────────────────────────────────┘       │
│                          │ 下钻                                       │
│                          ▼                                            │
│   Layer 3 — Credit Explorer(单次运行下钻)                           │
│   ┌─────────────────────────────────────────────────────────┐       │
│   │  定位到具体的一次 Agent 运行 / Workflow 执行             │       │
│   │  完整 credit 分解:AI 推理 + 工具调用 + 后台动作          │       │
│   │  "哪一次跑炸了"                                          │       │
│   └─────────────────────────────────────────────────────────┘       │
│                          │ 历史趋势外推                                │
│                          ▼                                            │
│   Layer 4 — Forecasts(预测)                                         │
│   ┌─────────────────────────────────────────────────────────┐       │
│   │  基于历史用量趋势预测未来支出走向                         │       │
│   │  按当前速率预计月底用量 · 置信区间                       │       │
│   │  "接下来会花多少"                                        │       │
│   └─────────────────────────────────────────────────────────┘       │
└──────────────────────────────────────────────────────────────────────┘

成本归因数据流

┌──────────┐    ┌──────────┐    ┌──────────┐    ┌──────────┐    ┌──────────┐
│  Agent/   │───▶│  Credit  │───▶│  模型维度 │───▶│  运行维度 │───▶│  趋势     │
│  Workflow │    │  计费    │    │  聚合     │    │  下钻     │    │  预测     │
│  运行     │    │  引擎    │    │          │    │          │    │          │
└──────────┘    └──────────┘    └──────────┘    └──────────┘    └──────────┘
     │               │               │               │               │
     ▼               ▼               ▼               ▼               ▼
  每次交互          按 message/      按 provider     每次运行         历史时序
  产生 credit       model/agent      (Anthropic/     的完整 credit    数据 +
  记录              归因             OpenAI/         拆解(含后台      滑动窗口
                   (含 AI 推理 +    Google等)        动作)           外推 +
                   工具调用)        分层聚合                          置信区间

成本构成(基于 ai_models 文档验证)

成本来源说明v10.2.0 前状态
AI 推理(token 成本)按 message length × model tier 计算✅ 已计入
对话历史累积第 10 条消息比第 1 条贵 ~40%✅ 已计入
工具可用性开销15+ 工具使 system prompt +30-40%✅ 已计入
Loop 模式 Agentloop 中每条 item 的 Agent 调用⚠️ v10.2.0 修正归因
后台动作self-improvement enrichment、chat evaluations⚠️ v10.2.0 新增计入

3. 功能需求

模块 A — 总览层(Overview)

ID触发场景系统行为优先级
A1管理员进入 Org Settings > Insights展示当前周期 credit 总用量、趋势曲线(日/周/月可切换)、环比同比P0
A2组织有月度预算上限配置展示"已用/上限"进度条 + 健康度指示(绿/黄/红)P1
A3管理员切换时间范围总览与所有下钻视图联动刷新P0

模块 B — 按模型拆分层(Per-model View)

ID触发场景系统行为优先级
B1查看 per-model 视图列出所有产生 credit 消耗的模型,每个显示 credit 量 + 美元成本 + 占比P0
B2按模型排序/筛选支持按 credit 量降序、按 provider 分组(Anthropic/OpenAI/Google/Z.ai 等)P1
B3某 Expert 模型占比异常高提供直达"Org Model Presets"配置入口,引导切换预设P1

模块 C — 单次运行下钻层(Credit Explorer)

ID触发场景系统行为优先级
C1点击高消耗记录或进入 Credit Explorer展示该次 Agent 运行/Workflow 执行的完整 credit 分解P0
C2运行含 AI 推理 + 工具调用 + 后台动作分别列出各部分成本(AI 推理、工具调用、self-improvement enrichment、chat evaluations)P0
C3查看 loop 模式下的 Agent 调用正确归因 loop 中每条 item 的独立 credit 成本(v10.2.0 修正点)P1
C4跳转到该运行详情提供直达 Agent 对话/Workflow 运行日志的链接P2

模块 D — 预测层(Forecasts)

ID触发场景系统行为优先级
D1查看 Forecasts基于历史用量趋势(滑动窗口)预测当前周期结束时的预计用量和成本P0
D2预测有不确定性展示置信区间/范围,标注假设("按当前速率")P1
D3预测将超出预算上限提前预警(红色指示 + 通知),建议优化动作P1

模块 E — 权限与数据范围

ID触发场景系统行为优先级
E1非 Admin/Security 角色访问限制访问——成本数据为组织级敏感信息P0
E2多团队组织支持按团队/工作区筛选成本归因(组织级 + 团队级视图)P2

4. 用户场景

场景 1 — CFO 预测月底 AI Agent 开销,提前调预算

用户画像:陈伟,42 岁,一家 800 人科技公司 CFO。公司部署了 15 个 Gumloop Agent(客服、数据分析、运营报告)。财务团队反馈"AI 这块每月费用波动很大,下个月要批多少预算心里没底"。

作为 CFO,我希望在月中就能看到 Insights 的 Forecasts,预测本月 Agent 总用量和成本,如果预测超预算就提前协调——而不是月底被账单打 surprise。

验收标准:

  • 进入 Insights,Forecasts 显示"按当前速率,预计本月消耗 X credits / 约 $Y",置信区间 ±15%
  • 预测值超出 IT 团队月度预算 110% → 红色预警
  • 下钻发现 60% 预测成本来自 3 个数据分析 Agent 用 Expert 模型跑长对话
  • 陈伟向 IT 负责人建议:把这几个 Agent 切到 Recommended 预设,或本月预算加 $Z

场景 2 — IT 管理员定位成本失控的 Agent

用户画像:林娜,35 岁,平台运营管理员。财务问"为什么这个月 credit 消耗比上月多了 40%?"她需要用数据回答。

作为 IT 管理员,我希望通过 per-model view 和 Credit Explorer 定位成本上涨根源——是某个 Agent 改用了更贵的模型,还是某次异常运行烧了大量 credit。

验收标准:

  • per-model 视图对比本月/上月:Claude 4.x Opus(Expert)从 8k → 14k credits 涨幅最大
  • 下钻发现新上线的"市场研究 Agent"贡献了 6k
  • Credit Explorer 找到该 Agent 一次消耗 180 credits 的运行(长对话 + 多工具调用)
  • 反馈给 Agent 所有者调整模型预设,两周后 per-model 趋势回归正常

5. 竞争分析

竞品功能/行为优势劣势洞察/机会
ZapierUsage dashboard + 按任务计费成熟的成本仪表盘,清晰的 task 计费Workflow 计费简单透明反而可预测性强;缺 Agent 场景的"单次运行多因子"归因Zapier 计费简单到不需 Forecasts;Agent 的复杂性才让 Insights 有价值
n8nExecution analytics + 自托管成本自托管让成本可控(自有基础设施)缺预测;计费不如 Gumloop 细粒度自托管是另一种"成本可预测"路径——基础设施固定 vs 用量预测
LangSmith / LangFuseLLM 可观测性 + per-request 成本追踪极细粒度 token 级成本追踪,开发者友好需 SDK 集成,工程师工具;不面向 CFO 做预算预测LangSmith 解决"每次调用花多少",Insights 解决"整个组织会花多少"
AWS Cost Explorer成本拆解 + 预测 + 预算告警业界标杆,Forecast + Budget Alert 体系成熟云资源成本远比 Agent credit 可预测云厂商的 Budget Alert + Forecast 模式是 Insights 的直接参照系

关键洞察

6. 遥测

漏斗阶段事件名称触发条件指标/KPI优先级
采用insights_viewedAdmin 进入 Insights 页活跃组织中访问比例(MAU)P0
使用insights_layer_explored进入 per-model / Credit Explorer / Forecasts各层级下钻率P1
价值forecast_viewed查看 ForecastsForecast 查看率(企业组织)P0
行动optimization_action_after_insights查看后切换 Org Model Presets / 调整 Agent 配置Insights 驱动的优化动作率P0
结果budget_forecast_accuracy周期结束预测 vs 实际偏差预测准确度(理想 < 15%)P0
留存org_retention_with_insights使用 Insights 的组织次年续费率vs 未使用组织的续费率差值P1

7. 未来演进方向

阶段时间线里程碑状态
Phase 1 — 四层仪表盘v10.2.0Overview + Per-model + Credit Explorer + Forecasts✅ 已发布
Phase 2 — 预算与告警闭环v10.x可配置月度预算上限、超支自动告警、成本异常自动检测⬜ 规划中
Phase 3 — 智能成本优化v11.xAI 主动建议成本优化("3 个 Agent 可降级到 Budget 模型,月省 X")、Org Model Presets 联动一键优化⬜ 探索中
Phase 4 — 成本归因到业务价值远期credit 成本与 Agent 产出业务价值关联(ROI 仪表盘)⬜ 探索中

关键演进判断