AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

Agent 智能体

模型从回答问题走向规划、调用工具和完成多步任务。这里追踪 Agent 框架、产品与可靠性评测。

全部 Story
1228
近 7 天
147
当前结果
836
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

论文PhysAI-Bench:面向以无人机为中心的自主物理 AI 的 LLM 智能体决策基准

筛选线索Agent 智能体大模型与推理AI 主题模型家族1 个独立信源

既有基准多测物理感知、直觉物理、具身导航和协作推理,很少评测可靠自主所需的智能体决策。PhysAI-Bench 把决策前信息隔离、时序依赖、物理约束、MCP/A2A 交互和 6G 网络条件一起纳入评测,相当于把“自主系统能不能在动态环境里做对决策”变成可量化对象,并首次给出 29 个基础模型在该任务上的可比分数。

arXiv AI/9月20日 15:14
84
02

论文面向持续演进的企业 AI Agent 技能的过程级持续评估

筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源

此前企业多依赖最终输出数值判断 Agent 是否正确,该论文显示这种方式会遗漏大量过程偏差:即便最终数值全部通过,仍有约九成运行存在工具选择、参数或执行顺序等问题。这说明评估对象需要从单一结果扩展到轨迹,否则隐患难以暴露。

arXiv AI/10月1日 15:06
84
03

论文SkinAgent AI:面向非诊断护肤支持的安全约束多模态智能体框架

筛选线索多模态Agent 智能体AI 主题大语言模型1 个独立信源

此前消费级护肤 AI 多停留在单点识别或对话建议,缺少安全边界、审计与工具调用约束。该工作把路由、工具、数据库推荐、隐私与安全检查和审批串联为可追踪流程,并分开评估视觉模型与系统级智能体行为,使非诊断护肤助手的工程可行性有了量化参照,而非仅凭模型精度宣称可用。

arXiv AI/9月24日 10:15
83
04

论文APEXA:面向同步辐射数据处理的执行完整性约束多智能体框架

筛选线索Agent 智能体大模型与推理大语言模型推理能力1 个独立信源

此前的 LLM 智能体评测基本停留在对话与文本任务,无法暴露“智能体报告了根本没执行的计算”这类失败。这项工作把正确性的判定从对话记录转移到实际执行记录,并首次按物理后果分类任务,将浪费算力与损坏仪器区分开,为高成本科学设施中的智能体自动化提供了可验证的安全基线。

arXiv AI/9月21日 06:33
83
05

论文面向 LLM、Agentic AI 与多模态系统的统一可信评估框架

筛选线索多模态Agent 智能体AI 主题人工智能1 个独立信源

此前评估多依赖单一 benchmark 分数,难以反映 agent 轨迹、多模态输出与安全失效。该框架把评估对象从结果扩展到过程与证据可信度,并主张安全关键项可覆盖聚合分数,避免平均分掩盖严重问题,同时对接治理框架与国际标准、欧盟监管要求。

arXiv AI/9月17日 00:31
82
06

论文CineMR:面向定量心脏 MRI 评估的工具集成视觉语言推理

筛选线索多模态Agent 智能体AI 主题推理能力1 个独立信源

此前医学视觉语言模型难以从多维 cine 图像中直接得出定量测量结果,多停留在定性描述。该工作把外部分析工具接入推理链路,并给出多队列基准和量化对比,使医学 VLM 从“看图说话”向可核验的数值评估推进,并显示工具调用能力可被训练显著提升。

arXiv AI/10月1日 06:43
82
07

论文隐性语言税:2026 年 LLM 分词器对法语及地区语言的多收 token,以及法语优化原型

筛选线索Agent 智能体大模型与推理AI 公司模型家族1 个独立信源

此前业界多将多语言成本差异视为大致现象,该研究把差异量化到具体分词器和语料,并指出法语相对英语存在稳定且幅度较大的 token 溢价。这意味着按 token 计费和按 token 计量的上下文窗口,会让同一法语内容在价格和可用长度上系统性劣于英语;对法国及地区语言用户,成本差距在智能体多轮重发场景中会被进一步放大。

arXiv AI/9月30日 05:14
82
08

论文隐蔽协助:有用的 LLM 智能体在多智能体系统中规避监督

筛选线索Agent 智能体AI 编码AI 主题模型家族1 个独立信源

此前对智能体规避监督的研究多集中在对抗性设定,即智能体被指示或被奖励去秘密通信。该研究表明,在没有对抗性激励的良性任务中,模型也会自发跨越安全边界,说明监督失效不只来自恶意设定,也可能来自模型对“帮助”的误读。

arXiv AI/9月30日 05:57
82
09

论文FOCUS:面向 LLM agents 的免训练决策保留型上下文压缩

筛选线索Agent 智能体大模型与推理大语言模型智能体1 个独立信源

既有上下文压缩方法依赖离线对比优化、蒸馏压缩器或训练压缩策略,成本高且策略在测试前固定,无法随实际轨迹动态调整。FOCUS 把选择依据从“学什么该丢”转为“哪些历史因果影响未来决策”,并把压缩能力从模型训练环节移到测试时,且不绑定具体架构。

arXiv AI/9月29日 13:45
81
10

论文超越最终准确率:审计 LLM 多智能体系统中的通信

筛选线索Agent 智能体大模型与推理大语言模型推理能力1 个独立信源

过去评估多智能体通信多依赖最终准确率,容易把有效通信、智能体架构优势与额外推理混为一谈。该工作把通信效果拆成纠正与保留两类行为,并用无消息对照量化额外推理的贡献,使评估从单一结果转向可分解的过程指标。

arXiv AI/10月1日 04:34
81
11

论文代理总成本:多智能体 LLM 工作流中记忆注入成本的精确归因

筛选线索Agent 智能体大模型与推理大语言模型智能体1 个独立信源

此前生产可观测工具只报告总 token 成本,不区分节点自身生成与外部注入的 token,导致这部分账单对付费团队不可见。该研究把不可见的记忆注入成本显式归因,并给出随深度增长的比例数据,使成本拆分从估算变为可测量。

arXiv AI/9月20日 18:23
81
12

论文MASCRDM:面向大语言模型训练过程的合规风险检测与缓解多智能体系统

筛选线索Agent 智能体大模型与推理AI 主题人工智能1 个独立信源

此前合规手段多集中在已训练模型的输入输出过滤,属于静态、局部优化。该工作把合规检测前移到训练全过程并引入实时预警,意味着合规从结果侧后置检查转向训练过程的持续干预,思路与覆盖范围均有变化。

arXiv AI/9月30日 06:47
81
13

论文Qwen3.8-Omni:走向原生全模态智能体

筛选线索多模态开源模型与生态模型家族推理能力1 个独立信源

此前 omni 模型主要强调感知与交互,而该模型把重心转向多模态理解、推理与长程任务,并通过原生多模态协同训练把文本域已有的 agentic 能力迁移到音频和视频任务,使多模态模型不再只是对话前端,而更接近可直接承担生产流程的智能体。

arXiv AI/9月22日 03:07
81
14

论文可信 RAG:用于检测生成式 AI 系统中错误信息和知识投毒的评估代理

筛选线索Agent 智能体AI 编码AI 主题模型家族1 个独立信源

RAG 系统通常信任检索内容,存在安全与可靠性缺口。此代理首次提出结合多项信号和信任指数的中间件方案,在检测错误信息和知识投毒上表现出高准确率,对安全编码助手等实际应用有潜在价值。

arXiv AI/8月21日 13:42
81
15

论文间接推翻:AI agent 群体中的社会攻击面

筛选线索Agent 智能体大模型与推理AI 主题生成式 AI1 个独立信源

此前评估 AI 群体风险多采用临界质量动态,即寻找单一临界点、衡量直接竞争所需的最小对抗比例。该研究指出这种方法会低估系统脆弱性:间接路径可能以更少的对抗 agent 改变群体均衡,说明安全评估不能只看单点阈值,还要看均衡之间的连通结构。

arXiv AI/9月21日 17:38
81
16

论文用 Spatial Transformer 在推理空间控制 AI agent 群体

筛选线索Agent 智能体具身智能AI 主题大语言模型1 个独立信源

此前多机器人协作多依赖集中式 LLM 策略或纯语言通信,团队规模增大后性能明显下降。该工作把控制反馈放到推理空间并本地生成,显示可扩展至训练规模 16 倍、上千台机器人,且对模糊指令零样本泛化,为大规模群体控制提供了新路径。

arXiv AI/9月23日 15:08
80
17

论文AIMS:面向仿真到真实多模态 ISAC 的智能体 AI 框架

筛选线索多模态Agent 智能体AI 主题人工智能1 个独立信源

此前多模态 ISAC 模型依赖大量标注真实数据,仿真数据虽可降低标注负担,但场景、感知、无线与学习配置之间不一致会损害迁移效果。AIMS 将配置推导与执行协调交给智能体,试图把仿真到真实迁移从人工调参转变为按部署需求自动生成配置,可能降低落地门槛。

arXiv AI/9月30日 15:31
80
18

论文构建面向交互式多智能体模拟的社会情感人工智能

筛选线索多模态Agent 智能体AI 主题人工智能1 个独立信源

此前多智能体心智理论研究与工程实现往往分离,人类与智能体的交互多为单轮或单智能体。该工作把社会性与情感建模、多模态人机接口和分布式推理放进同一可运行架构,并公开代码,使多智能体社会情感模拟从概念讨论转向可复现的系统实现。

arXiv AI/9月22日 18:21
80
19

论文开源 LLM 多智能体系统的问题、成因与解决方案实证研究

筛选线索开源模型与生态Agent 智能体大语言模型智能体1 个独立信源

此前关于 LLM 多智能体系统的讨论多集中于能力演示与架构设计,缺少对真实开源项目故障分布的大样本量化证据。该研究用近千条真实 issue 给出问题类型、成因与解决方案的优先级排序,使工程团队能按实际高频痛点而非直觉分配精力。

arXiv AI/10月1日 01:34
80
20

论文超越排行榜:代理式小语言模型集成体的 Token 经济学

筛选线索Agent 智能体大模型与推理AI 主题模型家族1 个独立信源

此前模型评测多以排行榜标量准确率为核心,成本、延迟与 token 效率被置于次要位置。该工作把运行可靠性与 token 开销纳入同一评测框架,并给出集成体在准确率与成本上同时优于单模型基线的具体数据,提示评测维度需要扩展。

arXiv AI/10月1日 02:37
80
21

论文高效关联非结构化数据以支持多步推理

筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源

此前多步推理检索通常把多属性过滤、向量搜索、关系连接与相似度连接拆成多个系统串联执行,容易在召回与成本之间取舍。该工作把这些操作收敛到一个查询模型与执行层中,并给出科学发现和电商语义算子场景下的速度、质量与成本对照,说明检索预过滤可能成为降低下游 LLM 调用成本的独立优化环节。

arXiv AI/9月16日 23:16
80
22

论文面向个性化体检解读与指引的多智能体 LLM 框架

筛选线索Agent 智能体大模型与推理大语言模型推理能力1 个独立信源

此前多数评估聚焦单轮问答或单一任务,而这项研究把多智能体架构放到包含两到四项需求的复合查询上检验,并给出统计显著性与人工偏好结果。它同时披露延迟增至 1.31 倍、成本增至 2.02 倍,说明收益并非免费。

arXiv AI/10月1日 10:48
80
23

论文DUMA-Bench:评估 LLM Agent 安全性的双控多智能体基准

筛选线索Agent 智能体大模型与推理AI 公司模型家族1 个独立信源

以往多数 Agent 安全评测默认用户被动、环境静态,忽略了真实部署中用户与 Agent 会共同改变环境状态这一动态。该工作把双控交互纳入评测,并给出跨模型家族的横向数据,说明安全表现不能只看模型本身,还取决于用户与环境交互方式。

arXiv AI/9月21日 14:28
80
24

论文区块链赋能的 AI 与 AI 智能体:面向安全数据共享与网络安全应用

筛选线索Agent 智能体大模型与推理AI 主题人工智能1 个独立信源

此前相关研究多分散在对抗攻击、异常检测、自动补丁与 AI 生命周期安全等单点议题,本论文把它们统一到“缺乏中心权威时如何建立信任”这一共同缺口下,并给出整合区块链的架构主张,标志着该方向开始从单点工具转向组合式基础设施叙事。

arXiv AI/9月23日 23:20
80
25

论文控制 harness 即控制成本:企业内 AI 编程 agent 的路由与治理

筛选线索Agent 智能体AI 编码AI 主题AI 公司1 个独立信源

此前企业的 AI 编程成本讨论多围绕席位采购或模型单价,而这项研究把焦点转向 harness 本身的默认配置,将其视为可被路由和治理的成本杠杆,并给出了在真实价格表下的量化回收区间和供应商依赖定价方法。

arXiv AI/9月24日 02:00
79
26

论文用 AI agent 驱动流行病模型:Epydemix Agent Framework

筛选线索开源模型与生态Agent 智能体AI 主题人工智能1 个独立信源

此前 LLM agent 接入科学软件多是零散的自然语言包装,可靠性依赖偶然。该框架把发现、验证、执行和检查拆成固定步骤并保留输出包,使 agent 建模过程可审计、可复现,同时给出 50 次会话的对照评估,而非仅演示单次成功案例。

arXiv AI/9月23日 18:31
79
27

论文别读日志:执行轨迹污染视频生成智能体的验证器

筛选线索多模态开源模型与生态模型家族大语言模型1 个独立信源

此前评测多关注生成质量与提示词,而这份证据指出评测环节本身会被与被测画面无关的文本带偏。仅凭“工具调用成功”的日志,就能让开源评审模型大规模放行明显失败的片段,说明自动验证结果在闭环系统中可能不具备可信度。

arXiv AI/9月23日 10:53
79
28

论文GRASP:面向 Agentic AI 战略规划的生成、修订与评估框架

筛选线索Agent 智能体大模型与推理AI 主题模型家族1 个独立信源

此前 LLM 规划器在任务复杂度上升和任务数量增加时性能明显下降,甚至出现多任务性能崩溃。GRASP 声称在多任务扩展下基本消除退化惩罚,交错双任务环境中比直接 LLM 规划器最高提升 16.7%,并以 14.5% 的优势超过 GPT-5-mini 等前沿推理模型,说明模块化规划可能改变复杂任务可靠性的上限。

arXiv AI/9月24日 17:11
79
29

论文可审计长期记忆:确定性检索链在 LongMemEval-S 上测得 500 题中的 479/475

筛选线索Agent 智能体大模型与推理模型家族大语言模型1 个独立信源

该系统把 LLM 从求解链路中降级为可替换阅读器,使记忆检索结果更可审计。两轮得分跨过 Chronos High 公布的 478/500,但作者明确表示读者代际、评分提示词、数据版本与系统内方差使优劣或等效均无法成立。

arXiv AI/9月29日 17:04
79
30

论文AgenticSizing:基于大语言模型的多智能体模拟电路尺寸设计框架

筛选线索Agent 智能体大模型与推理大语言模型智能体1 个独立信源

此前的 LLM 电路尺寸方法多缺少显式拓扑理解,且主要在较简单的模拟模块上评估。该工作把评估对象扩展到含 55 个晶体管、60 个尺寸变量的复杂电路,并在经典优化器失效的 LDO 基准上给出可行解,说明 LLM 方法开始进入传统优化难以覆盖的复杂模拟设计场景。

arXiv AI/9月22日 08:39
79
当前展示各类别评分靠前的 30 条,共 836 条