- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年9月29日 16:36
- 状态
- 单一信源
发生了什么
arXiv 论文 SelfSearch 提出一种无需下游奖励信号的自改进搜索流程:agent 利用此前自改进记录中的推理、工具动作与结果来修改自身。在六个模型—基准组合上,群体平均成功率均高于初始 agent,单个 agent 在 Terminal-Bench 2.1 上最多提升 11.2 个百分点;在 SWE-bench Multilingual 上提升 5.0 个百分点,同时已解任务执行成本降低 38.5%。搜索成本 4.03 美元时,在公开九种 harness 比较设置下用 DeepSeek V4 Flash 解决 82.0% 的 Terminal-Bench 2.1 任务。
为什么重要
此前的 agent 自改进依赖重复下游评估来筛选,成本高且搜索绑定了被评估任务。SelfSearch 改为复用自改进过程记录作为经验,让搜索与具体评估任务解耦,并在多个模型—基准组合上验证,同时给出可比的成本数据。
底层逻辑
其机制是把每次自我修改的推理、工具调用与结果存成记录,作为后续修改的可复用经验,使 agent 同时改进任务求解与自我修改能力。由于搜索阶段不消耗下游奖励信号,省去了反复评估的开销,因此能以更低搜索成本获得与评估引导式搜索相近的任务成功率。
产品与商业机会
对研发而言,agent 能力迭代可以不再依赖高频跑基准,降低算力与评估成本,4.03 美元量级的搜索成本使小团队也能复现 harness 优化。产品侧可在无标注环境下持续积累自改进记录,形成可迁移的能力提升路径,但需评估记录存储与质量控制成本。
- 在内部 agent 开发流程中引入自改进记录沉淀机制,把每次指令、工具和流程修改的推理与结果结构化保存,作为后续搜索的经验输入。
- 针对自身业务的高频基准构建无奖励搜索流水线,先用小成本验证能否逼近评估引导式搜索的成功率。
- 把 SWE-bench Multilingual 上 38.5% 的执行成本下降作为参考,在已解任务上测试自改进后的 agent 是否可降低推理与工具调用开销。
仍待确认
- 论文所提六个模型—基准组合具体包含哪些模型与基准,证据中未完整列出。
- 公开九种 harness 比较的具体设置与其它 harness 表现未在证据中给出。
- 自改进记录在不同模型之间是否可迁移,证据未说明。
- 4.03 美元搜索成本对应的搜索规模与硬件条件未被披露。