arXiv AI1
AgentJudgeBench 是首个系统研究 LLM 在代理工具调用工作流 DAG 上作为评判者可靠性的基准,包含 3808 个实例、六种拓扑和三个难度级别。研究显示,法官对齐度随任务难度单调下降,无真实答案时下降速度快 1.5 倍;硬查询时所有法官表现集中在 77-82%,表明存在结构性上限。
为什么值得看此前 LLM-as-a-judge 的研究多集中于开放式文本或偏好评估,未深入依赖关系驱动的工作流。本基准首次系统关注代理工具调用场景,揭示了任务难度主导的评估上限,且规模无法解决,提示构建可靠代理评估系统需超越模型扩展。
arXiv AI1
arXiv AI 发布研究,比较多智能体管理器-工人架构与单模型在九个模型上的 LiveCodeBench 表现。结果显示效果因模型而异,对部分模型有显著提升,对另一些则无效或负面。管理器模式下 Opus-5 达最高分 91%,但 token 消耗约增三倍。
为什么值得看此前多智能体系统声称优于单模型,但证据混杂且对比受干扰。该研究通过严格对照,揭示提升条件性存在,并量化了成本效益,为理智选用多智能体架构提供依据。
arXiv AI1
论文提出AI Control Scientist(AICS),一个由大语言模型驱动的智能体系统,能根据语言设计需求自动生成优化控制器。AICS包含任务建模、控制器设计和参数调优三个智能体。实验显示,AICS可自动生成多种代表性控制系统,在设计成功率和优化效率上均优于现有自动化基线。
为什么值得看传统控制设计依赖专家知识和大量手动调参,效率低、扩展性差。AICS首次实现由语言需求直接生成优化控制器,将控制设计从人工驱动转变为智能体驱动,有望提升工业控制系统的开发效率与可扩展性。
arXiv AI1
论文提出TOPAS,一种面向多智能体LLM服务的任务导向前缀感知调度器,它在共享KV缓存预算下联合决定保留哪些代理前缀和执行哪些请求,以平衡前缀缓存与批处理并发的权衡。在SGLang框架中实现,相比最佳基线,在合成工作负载上平均/第99百分位JCT最多降低39.8%/49.4%,在MetaGPT软件工作流上平均JCT降低9.8%至22.0%,p99降低26.6%。
为什么值得看现有调度器在多阶段工作流中往往只优化局部前缀局部性或整体进度,导致任务级完成时间延长。TOPAS首次联合优化前缀缓存保留和请求调度,通过任务级老化机制防止饥饿,在真实软件工作流中显著降低平均和尾延迟,为多智能体LLM服务的效率提升提供了新思路。
arXiv AI1
FaulT-Bench是一个针对网络故障诊断LLM智能体的新基准,包含200个场景,涵盖真实故障、错误报告等。测试发现现有智能体在准确工单上表现饱和,但在健康网络和错误工单下性能剧降。工单措辞比内容更关键,模糊报告导致性能大幅下降。
为什么值得看现有基准仅在准确工单且假设必有故障的条件下评估,脱离实际。FaulT-Bench引入虚假报告、错误归因等现实场景,揭示智能体在健康网络下的过度诊断问题,推动更贴近实践的评估。