Hugging Face Daily Papers69
AgentJudgeBench 是首个系统研究 LLM 裁判在基于工作流 DAG 的智能体工具调用中可靠性的多难度基准,包含 3808 个实例、六种拓扑和三个难度层,使用五个生成器与六个裁判评估。结果显示裁判一致性随难度增加而单调下降,无真实标签时下降速度快 1.5 倍,且硬查询中所有裁判的一致性集中在 77-82% 区间,表明存在模型规模无法克服的结构性上限。
为什么值得看此前 LLM 裁判的评估多聚焦于开放式文本或偏好判断,而智能体工具调用依赖结构化、有序的 DAG 流程,裁判在此场景的可靠性未被系统验证。该基准首次揭示裁判在复杂任务中存在一致性天花板,且受任务难度主导,为构建可靠的智能体评估体系提供了实证依据。
Hugging Face Daily Papers64
一篇论文提出“agentic data cracking”方法,让LLM代理在回答问题时自适应、推测性地将非结构化数据(如网页、报告、合同)转化为结构化数据,避免重复打开大文档。在FanOutQA基准上,理想预结构化存储使推理成本降低28倍,该方法能以接近RAG的成本保持代理准确性。
为什么值得看此前LLM代理处理非结构化数据时每次提问需重复读取大文档,消耗高达百万token。若预先结构化全部数据则成本过高且不现实。该方法让结构化为推理的副产品,随查询动态生成,使成本降至接近RAG水平,可能改变企业AI处理文档的性价比。
Hugging Face Daily Papers46
一篇论文提出 credit-addressable reasoning 方法,用于多模态几何推理。该方法通过 Code-CoT 将视觉关系表示为可执行代码,并用 CE-GRPO 在事件边界分配学习信号。在九个几何基准上,CE-GRPO 平均准确率达 76.04,分别超过 Qwen3-VL-8B 和轨迹级 GRPO 8.09 和 3.43 个百分点。
为什么值得看此前自由格式推理轨迹难以定位决定答案的关键步骤,且轨迹级强化学习将单一奖赏平均分配到整个响应。该方法将推理单元与优化位置绑定,使学习更精准,并在多步几何推理上显著提升准确率,显示表征与优化协同设计的价值。