- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年9月20日 18:23
- 状态
- 单一信源
发生了什么
一篇 arXiv 论文提出 Total Cost of Agency(TCA),把多智能体 LLM 工作流成本拆分为基础提示、推理、记忆注入、未命中惩罚和上下文累积五部分,并用两遍非计费 token 计数直接测量注入 token。在 200 个企业任务基准上对真实模型 API 测试显示,记忆注入约占完整计费成本的 12%,可优化变量成本的 13.6%,且占比随工作流深度从 1 层的零升至 6 层的 27.6%。
为什么重要
此前生产可观测工具只报告总 token 成本,不区分节点自身生成与外部注入的 token,导致这部分账单对付费团队不可见。该研究把不可见的记忆注入成本显式归因,并给出随深度增长的比例数据,使成本拆分从估算变为可测量。
底层逻辑
多智能体工作流中每个节点都从记忆检索上下文并注入提示,这些 token 按输入 token 的同一单价计费。现有工具无法区分生成 token 与被交付的 token,因此需要两遍、非计费的方式直接计数注入 token,而不是用词数代理估算。
产品与商业机会
对多智能体产品团队而言,成本核算需要新增记忆注入这一维度;优化检索窗口规模可在固定模型层级下降低注入 token 约 28.7%,且准确率变化处于种子级波动内,这为成本控制提供了可操作旋钮。
- 在多智能体可观测或计费工具中加入记忆注入 token 的独立计量与展示
- 将检索窗口容量作为可配置成本参数,按任务深度动态调整
- 在编译期优化器中加入基于注入 token 占比的成本归因模块
仍待确认
- 13.6% 和 12% 的具体口径差异是否足以影响优化优先级判断
- 深度超过六层后注入 token 的线性增长是否仍成立
- 降低检索窗口容量对准确率的长期影响是否在更大任务集上稳定
- 论文中图重写变换的具体效果与适用边界尚未在摘要中说明