Hugging Face Daily Papers50
研究者提出 NOAH,一个时间感知、任务无关的生成式 transformer 模型,用于表示和预测患者全流程多模态状态。模型基于 MIMIC 数据族中 29.9 万名患者、43.1 万次就诊、超过 5.59 亿条临床事件构建,原生处理医学图像、时间序列与数值信号、类别事件以及结构化和非结构化临床记录,支持带时间控制的自回归预测、零样本分类和反事实干预模拟。
为什么值得看已有纵向患者建模方法多为判别式,只覆盖少数模态,受限于封闭类别词表,并把时间当作单调归纳偏置,预测未来状态的能力有限。NOAH 转向生成式、任务无关路线,并把时间建模改为双向时间整合,试图覆盖不规则时间动态与临床轨迹的随机性。
Hugging Face Daily Papers48
该论文提出 A*-Thought-V2 框架,将 Chain-of-Thought 建模为隐藏状态轨迹,用显式与隐式交错的潜在架构替代硬删除。方法把问题、步骤和解答表示投影到 3D PCA 空间,测量每步局部转移与全局问题到解答方向的对齐程度,对齐步骤保留为显式文本,偏离步骤压缩为连续潜在 token。训练采用 stepwise embedding forcing 与 label forcing。在 Qwen3.5-9B 和 Qwen3.6-27B 上,六个域内外基准平均准确率最高提升 2.6%,响应长度最多减少一半。
为什么值得看此前压缩 CoT 的方法要么通过硬剪枝丢失中间信息,要么缺少连续压缩的原则性判据。该工作把推理步骤的方向角作为可解释指标,既决定哪些步骤保留为文本、哪些转为潜在 token,又通过角度变化刻画探索、收敛与精炼阶段,使推理效率与推理过程结构直接挂钩。
Hugging Face Daily Papers46
研究团队提出 VDiff-Bench,一个面向细粒度图像差异识别的四选一基准,包含 1756 道题,覆盖位置、运动、区域颜色、整体颜色、出现/消失、噪声/分辨率、纹理、替换/尺寸、OCR/文字、光照 10 类变化。每题的干扰项需区分真实变化与相近语义描述,并含有“无差异”选项。测试 11 个开源与闭源 MLLM 显示,模型在语义变化上表现尚可,但在噪声、纹理等低层变化上明显失效,个别模型甚至误判为无变化。
为什么值得看以往多模态评测多聚焦视觉问答等通用理解能力,较少系统检验“对比两张相似图”这一基础能力。该基准用受控负样本和“无差异”干扰项把评测压力集中到细微变化上,暴露出当前模型在低层视觉差异上的稳定缺口,为后续评测与模型改进提供了可复现的对照标准。