- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年9月24日 15:05
- 状态
- 单一信源
发生了什么
该论文提出 sPMC 训练框架,针对多模态大语言模型在处理视觉推理时容易产生幻觉、过度依赖语言先验、忽视视觉证据的问题,通过识别对视觉接地敏感的注意力头,并只对这些头的文本到图像注意力进行正则化,以分割得到的空间先验引导概率质量集中到语义相关区域。实验在 6 个多模态基准套件上取得平均 3% 的零样本提升,多个 MLLM 上最高提升 11.3%,且仅正则化 3% 到 15% 的注意力头。
为什么重要
此前改进多模态推理多依赖推理过程监督或推理时策略,而该工作提出一种互补路径:不直接监督推理过程,只通过选择性正则化少量视觉接地相关注意力头来增强隐式视觉 grounding,为提升推理能力提供了更稀疏、更聚焦的训练信号。
底层逻辑
该工作假设注意力头存在功能分工:部分头对视觉证据接地更敏感。sPMC 将视觉 token 上的归一化注意力视为空间概率分布,利用分割导出的空间先验,鼓励概率质量集中在语义相关区域;自适应头选择则把这种引导限制在视觉响应头,其余头保持无约束,以保留其互补功能。
产品与商业机会
对多模态产品研发而言,这意味着无需对整个模型或推理链路做大改,只需在训练阶段识别并正则化少数关键注意力头,就可能降低幻觉、提升视觉问答准确率,且计算与调参成本相对可控,适合作为现有 MLLM 的轻量增强模块。
- 在现有 MLLM 微调流程中增加注意力头筛选与 sPMC 正则化步骤,作为降低视觉幻觉的轻量训练插件。
- 面向视觉问答、图表理解等场景,构建基于分割先验的注意力对齐数据管线,提升任务相关视觉区域的使用率。
- 将自适应头选择机制产品化为模型诊断工具,帮助团队定位对视觉接地贡献最大的注意力头。
仍待确认
- sPMC 在 6 个基准上的具体评测任务、模型规模与基线设置尚未在证据中展开。
- 分割导出的空间先验是否依赖额外标注数据,以及其获取成本与泛化性如何。
- 该方法对通用多模态任务之外的推理场景是否同样有效,尚无证据支持。
- 正则化 3% 到 15% 的注意力头在不同 MLLM 架构间的选择稳定性与迁移性有待确认。