- 类型
- 模型
- 来源
- AIHOT · X / 公众号精选
- 发布
- 2026年10月2日 00:17
- 状态
- 单一信源
发生了什么
Artificial Analysis 发布 Coding Agent Index 榜单。Claude Sonnet 5.5 (max) 在 Claude Code 中以 68 分居首,同时其每任务成本最高达 $14.19。GPT-6.1 Sol 与 Gemini 4 Argon 也进入榜单头部,但各模型之间的每任务成本差异较大。
为什么重要
Coding Agent 的评测开始同时呈现能力分数与每任务成本,而不是只比单一的模型能力。榜首模型虽然得分最高,但成本也最高,说明“最强”与“最划算”可能不是同一个选择,选型维度从分数转向性价比。
底层逻辑
Coding Agent Index 以任务为单位评测,每任务成本直接受 token 消耗、推理步数和 agent 循环次数影响。Claude Sonnet 5.5 (max) 在 Claude Code 中取得最高分,可能与其更长的推理或更多工具调用有关,因此单任务成本被推高;其他模型分数接近但成本结构不同。
产品与商业机会
团队在搭建 Coding Agent 时,需要把每任务成本纳入模型路由与预算设计,而不再只看榜单排名。高分但高成本的模型更适合复杂任务,简单任务可交给成本更低的模型,产品侧也需要向用户展示任务级成本或额度消耗。
- 在多模型 Coding Agent 中按任务复杂度做路由,把高成本模型限定给高价值任务
- 为团队提供每任务成本看板,按模型与任务类型对比花费
- 围绕低成本模型设计包月或按任务计价的开发者套餐
- 在选型评估中加入“每分成本”指标,替代单纯看榜单排名
仍待确认
- 榜单中各模型的具体分数和每任务成本分别是多少
- 每任务成本的口径是否包含重试与失败任务的开销
- GPT-6.1 Sol 与 Gemini 4 Argon 分别运行在哪些 agent 产品中
- 榜单是否覆盖非 max 配置或不同推理预算下的结果