arXiv AI72
研究团队发布 OmniVCBench,一个以图表为中心、可回溯来源的多模态推理基准,用于评测 AI Virtual Cells 的“解释”环节。基准包含 6,077 条从科学文献图表与实验语境中整理的单图和多子图问答对,并依据 Bloom 分类法设计三类科学推理任务。同时提出 AIVC-Judge 任务条件化评审框架,以及将模型推理错误转为选择题干扰项的 MDHNM 策略。
为什么值得看此前 AIVC 基准主要集中在模拟层,即预测细胞响应,缺少对模型如何解读实验证据、提出生物学假设的评测。该工作把评测重心移到解释层,并提供可追溯来源的图表问答数据与开放式回答评审方法,补上了 AIVC 评测链条中的一环。
arXiv AI66
研究者提出并命名 SPLASH 的服务系统,可在请求持续运行期间切换注意力的并行布局,而非像现有服务引擎那样在启动时固定一种布局。其基础观察是:在 KV head 很少或没有的现代注意力中,请求的 KV cache 所在位置与注意力权重如何分片是解耦的。SPLASH 复用大部分已有状态、在推理后台迁移其余状态,并在 batch 边界完成交接,切换中位开销低于所在 step 的 0.51%。
为什么值得看此前服务引擎在启动时固定并行布局,因为换布局需要排空请求并重启 worker,导致低并发、大量独立请求、长 prompt 以及推理、agentic、RL-rollout 等混合负载无法随负载变化调整。SPLASH 让布局可在同一批请求运行中改变,把原本的停机式切换变为近乎免费的在线操作。
arXiv AI66
研究者提出 VLALight,称其为首个可直接从多视角路侧视频端到端完成交通信号控制的 vision-language-action(VLA)模型。它通过多目标时空交通推理和跨路口拓扑感知协同感知,把视觉观测直接映射为协调信号动作,并采用两阶段监督冷启动加协同式 agentic 强化学习,以及自适应快慢推理模式。在三个城市网络、七个真实交通流数据集上的实验显示,其表现持续优于交通类、RL 类和 LLM/VLM 类基线。
为什么值得看此前交通信号控制多依赖人工设计的交通状态或独立感知模块,视觉观测与控制决策之间存在断层。该工作把多视角路侧视频直接接入控制策略,并用跨路口协同感知覆盖网络级效率,为端到端信号控制提供了可与其他方法在真实数据集上对比的新基线。
arXiv AI65
研究者提出 LazySloth,一种基于树搜索的视频理解加速方法。它让 VLM 判断视频中哪些片段无关,只对这些片段做有界描述,从而减少描述开销。相比现有 agentic 方法,速度提升 2.9 至 8.3 倍;在 Gemma 4 31B 与 Qwen3.6 27B 两个开源基座模型、四个基准上,准确率与专用视频 VLM 及 RAG 方法相当或更好,并缩小了与 GPT-4o 的差距。消融显示,用 CLIP 检索替代 VLM 场景理解会损失 8.8% 至 19.9% 准确率,惰性树构建以更低描述成本达到与激进构建相当的效果。
为什么值得看此前长视频理解多依赖逐帧粗描述或带损嵌入的多模态 RAG,计算开销大且丢失时序与细节;LazySloth 把检索优化问题聚焦到 VLM 自身的查询相关信息筛选上,在不明显损失准确率的前提下大幅提速,并缩小开源模型与闭源模型差距。
arXiv AI65
一篇 arXiv 论文指出,生成式内容正进入新闻生产与传播,使假新闻从人工编造或简单篡改演变为原生内容与生成内容混合的复杂形态。论文认为现有假新闻检测偏重真实性判断、忽视生成性差异对证据可靠性的影响,而 AIGC 检测又无法证明新闻事件本身真假。作者构建 Weibo26 多模态数据集,并提出 GAHR 框架,将全局判断与局部修正结合,让生成性信息参与新闻真实性推理;实验显示其在多个基准和 Weibo26 上取得有竞争力的真实性检测表现,并能有效识别生成内容。
为什么值得看此前多模态假新闻检测与 AIGC 检测基本是两条并行任务:前者判断内容真假,后者判断是否由模型生成,二者在数据和评估上彼此分离。该工作把生成性信息纳入真实性推理,并配套发布面向生成内容场景的数据集,意味着检测目标从单一真假标签转向对证据来源与生成方式的联合刻画。