- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年9月24日 02:00
- 状态
- 单一信源
发生了什么
这篇论文指出,企业部署 AI 编程 agent 的规模已从几百席试点扩展到上万席,且多采购 Anthropic 的 Claude Code 或 OpenAI 的 Codex 等商业 harness。harness 默认决定了模型选择、读取内容、prompt cache 用法和 subagent 调度,直接决定采购成本。作者构建了可自定义路由器 Jev,按自带分类法标注请求,并只在会话开始、侧路和 subagent 启动时切换,避免缓存重建。重定价约 1 万个真实会话后,在 1 万席模拟企业中可回收 14% 至 21% 的模型支出,按 2026 年 9 月 21 日 Anthropic 标价折合每年 330 万至 500 万美元。
为什么重要
此前企业的 AI 编程成本讨论多围绕席位采购或模型单价,而这项研究把焦点转向 harness 本身的默认配置,将其视为可被路由和治理的成本杠杆,并给出了在真实价格表下的量化回收区间和供应商依赖定价方法。
底层逻辑
harness 决定了每次请求由哪个模型回答、读取什么上下文、如何使用 prompt cache 以及启动哪些 subagent,因此它在价目表上同时决定单价与用量。由于一个用户轮次会在同一模型的缓存上产生多个请求,任务中途切换模型会迫使缓存重建,所以路由器只选择会话开始、侧路和 subagent 启动这三类不破坏缓存的位置进行分流。论文还推导出任务中途切换的回本条件,并发现长工具调用密集会话中最高价模型反而比次一档便宜。
产品与商业机会
对采购或自建 harness 的企业,默认配置会直接放大或压缩模型账单,需要把路由能力纳入 AI 编程平台评估清单。产品团队需要在会话边界、父子 agent 边界暴露切换点,并保留分类与缓存策略的可配置性,否则成本治理只能在采购层面被动接受供应商定价。
- 在自研或采购的 AI 编程平台上接入按自带分类法标注请求的路由层,并优先在会话开始、侧路和 subagent 启动处执行模型切换。
- 建立面向长工具调用会话的模型成本对比面板,验证最高价模型是否反而低于次一档,并据此调整默认模型档位。
- 对二十种 harness 的默认配置做成本与风险审计,输出可对比的默认值清单供采购决策使用。
仍待确认
- 论文所述 14% 至 21% 的节省是否在企业真实混合负载下同样成立,尚未被独立复现。
- 二十种 harness 的具体风险地图和控制策略细节在给定证据中未展开。
- Jev 分类器的校准概率在超出公开数据集分布的企业请求上表现如何,证据未说明。
- 从公开数据集重定价得到的约 1 万个会话是否覆盖足够多的企业场景,证据未给出采样与验证方式。