- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月26日 08:33
- 状态
- 单一信源
发生了什么
论文提出TOPAS,一种面向多智能体LLM服务的任务导向前缀感知调度器,它在共享KV缓存预算下联合决定保留哪些代理前缀和执行哪些请求,以平衡前缀缓存与批处理并发的权衡。在SGLang框架中实现,相比最佳基线,在合成工作负载上平均/第99百分位JCT最多降低39.8%/49.4%,在MetaGPT软件工作流上平均JCT降低9.8%至22.0%,p99降低26.6%。
为什么重要
现有调度器在多阶段工作流中往往只优化局部前缀局部性或整体进度,导致任务级完成时间延长。TOPAS首次联合优化前缀缓存保留和请求调度,通过任务级老化机制防止饥饿,在真实软件工作流中显著降低平均和尾延迟,为多智能体LLM服务的效率提升提供了新思路。
底层逻辑
TOPAS对候选决策状态评分,权衡每个任务最长剩余服务路径的预期缩减与下游前缀复用的近期收益,同时考虑前缀迁移和抢占成本。它通过任务级老化机制防止饥饿,在共享KV缓存预算下实现前缀缓存和并发批处理的平衡,从而降低任务完成时间。
产品与商业机会
对于提供多智能体LLM服务的平台,采用TOPAS可降低任务完成时间和尾延迟,提升系统吞吐量和用户体验。由于减少了前缀抢占和迁移,GPU内存使用更高效,可能降低基础设施成本。开发团队需在SGLang等框架中集成调度算法,评估工作流拓扑对性能的影响。
- 在SGLang框架中集成TOPAS调度器,评估对现有多智能体工作流的JCT改进效果。
- 基于TOPAS的任务级老化机制,设计针对长尾任务的优先级策略,提升服务稳定性。
- 借鉴TOPAS的评分函数,开发动态缓存预留策略,优化GPU内存利用率。
- 将TOPAS应用于MetaGPT等开源工作流,验证其在真实场景中的收益并商业化推广。
仍待确认
- TOPAS在不同硬件配置和更大规模工作负载下的性能表现如何?
- TOPAS的计算开销是否影响实际训练和推理延迟?
- TOPAS是否兼容除SGLang外的其他推理框架?
- 实际应用中如何确定最优的工作流感知参数(如老化因子)?