- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年9月29日 13:45
- 状态
- 单一信源
发生了什么
arXiv 论文提出 FOCUS,一种面向 LLM agents 的免训练上下文压缩框架。它把压缩问题重新定义为离散交互单元上的因果决策保留问题,完全在测试时运行,无需离线数据采集或微调,可作为模块化压缩层接入任意闭源 API 前沿模型。在 API 与工具调用、QA、web 及多轮对话等 agentic 基准上,该方法削减峰值上下文最多 48%、依赖度 73%,任务成功率比未压缩执行提升最多 8.9 个百分点。
为什么重要
既有上下文压缩方法依赖离线对比优化、蒸馏压缩器或训练压缩策略,成本高且策略在测试前固定,无法随实际轨迹动态调整。FOCUS 把选择依据从“学什么该丢”转为“哪些历史因果影响未来决策”,并把压缩能力从模型训练环节移到测试时,且不绑定具体架构。
底层逻辑
LLM agents 的交互历史随任务长度线性增长,带来二次方推理成本,并因注意力稀释导致性能下降。FOCUS 将上下文压缩表述为离散交互单元上的因果决策保留问题:判断哪些历史交互在因果上塑造了 agent 的未来决策,从而在测试时动态保留关键交互、丢弃其余部分,无需离线采集数据或微调模型权重,因此可加装在闭源 API 模型之外。
产品与商业机会
对使用闭源 API 模型构建 agent 的产品团队,这提供了一条不重新训练模型即可控制上下文长度与推理成本的路径,并可能缓解长任务中的注意力稀释导致的成功率下降。模块化压缩层的形式意味着可独立接入现有 agent 循环,研发改动集中在上下文管理而非模型层,但实际收益仍取决于自身任务分布与基准是否一致。
- 在现有 agent 框架的上下文管理模块中试点接入 FOCUS 类免训练压缩层,对比长任务下的 token 成本与任务成功率。
- 针对工具调用与多轮对话场景设计 A/B 实验,验证峰值上下文削减是否转化为单位任务成本下降。
- 将压缩层作为可插拔组件封装,使团队可在不同闭源 API 模型间切换而无需重建压缩策略。
- 对长链路 agent 任务记录压缩前后被保留的交互单元,用于排查失败是否源于关键历史被丢弃。
仍待确认
- FOCUS 在论文所述基准之外的真实业务长任务上是否同样保持成功率提升?
- 峰值上下文削减 48% 与依赖度下降 73% 的具体定义与测量口径是什么?
- 作为模块化层接入闭源 API 模型时,是否引入额外调用延迟或实现复杂度?
- 与已有的训练式压缩方法相比,在极端长上下文下的相对表现如何?