arXiv AI67
论文提出 Qwen3.8-Omni-Flash,一个原生多模态 agentic 模型,相比以往偏重感知与交互的 omni 模型,显著提升多模态理解、推理和长程智能体任务表现。模型沿用 Qwen3.8-Next 的稀疏 MoE 架构,上下文窗口扩展至一百万 token,并同步开源 Qwen-MM-Plugins 插件框架与 Qwen-Live-Harness 实时多模态框架。
为什么值得看此前 omni 模型主要强调感知与交互,而该模型把重心转向多模态理解、推理与长程任务,并通过原生多模态协同训练把文本域已有的 agentic 能力迁移到音频和视频任务,使多模态模型不再只是对话前端,而更接近可直接承担生产流程的智能体。
arXiv AI66
该论文指出,随着生成式 AI agent 大规模部署,安全性不仅取决于技术防护和单个模型设计,还取决于 agent 群体处理信息、排序行动和应对不确定性的集体均衡。作者通过 LLM agent 群体实验和解析框架,把协调均衡纳入一个有向加权拓扑,发现经由中间“踏脚石”均衡的间接推翻可降低所需对抗 agent 的最小比例,绕过多数门槛,完成直接挑战无法实现的转移。
为什么值得看此前评估 AI 群体风险多采用临界质量动态,即寻找单一临界点、衡量直接竞争所需的最小对抗比例。该研究指出这种方法会低估系统脆弱性:间接路径可能以更少的对抗 agent 改变群体均衡,说明安全评估不能只看单点阈值,还要看均衡之间的连通结构。
arXiv AI66
该论文针对中医诊断依赖望闻问切、主观性强、难以量化对齐现代医学体系的问题,提出多模态数据统一框架 UFMD,将舌象与脉象图像自动转化为结构化、临床标准的描述,并汇总为望闻问切过程的统一数字记录。基于该数据,作者通过监督微调构建了中医专用大模型 LingLan-14B。实验显示诊断准确率相对基线提升 103.5%(62.72% 对 30.82%),F1 最高达 82%。
为什么值得看此前中医诊断的舌象、脉象等核心信息难以量化和标准化,AI 介入缓慢。该工作报告了从多模态图像到结构化临床描述、再到统一数字记录的处理路径,并给出相对基线的显著准确率提升,说明中医诊断的标准化建模在方法层面出现了可测量的进展。
arXiv AI64
研究者提出 DUMA-Bench,一个用于评估 LLM Agent 安全性的基准与评测协议。它在 τ²-bench 基础上扩展出对抗环境,覆盖 RAG 投毒、跨 Agent 操纵和不安全输出处理等八类漏洞,并测试来自 OpenAI、Anthropic、DeepSeek、Qwen、Z.ai 五个模型家族共 14 个模型、八个领域和多种用户行为模式。结果显示,引入双控交互后攻击成功率从 26.9% 升至 41.1%。
为什么值得看以往多数 Agent 安全评测默认用户被动、环境静态,忽略了真实部署中用户与 Agent 会共同改变环境状态这一动态。该工作把双控交互纳入评测,并给出跨模型家族的横向数据,说明安全表现不能只看模型本身,还取决于用户与环境交互方式。
arXiv AI63
该论文提出 AgenticSizing,一个基于 LLM 的多智能体框架,用于复杂模拟电路尺寸设计。框架先分析电路拓扑,将网表拆解为功能模块与子结构,并提取可复用的轻量设计知识;再由规划器协调多个角色专用智能体更新设计变量,达成全局性能指标。方法在八个电路上验证,最大设计含 55 个晶体管和 60 个尺寸变量;在 LDO 基准上以平均 83 次迭代取得 60% 成功率,而经典优化器未能找到可行解。
为什么值得看此前的 LLM 电路尺寸方法多缺少显式拓扑理解,且主要在较简单的模拟模块上评估。该工作把评估对象扩展到含 55 个晶体管、60 个尺寸变量的复杂电路,并在经典优化器失效的 LDO 基准上给出可行解,说明 LLM 方法开始进入传统优化难以覆盖的复杂模拟设计场景。