- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年10月1日 11:39
- 状态
- 单一信源
发生了什么
该论文提出 OpenMTB-Audit,一个包含 500 个合成非小细胞肺癌病例的开源基准,覆盖五类对抗性错误与四级安全标签。在八种大模型配置上,所有配置在真实部分支持病例中有 83.3% 至 100% 未能保留该标签,通过标签塌缩获得高安全分。作者另建 MTB-AuditAgent,将证据核查、缺失信息检测、安全分类与弃答分离,过度拒答降至 6.7%,准确率 91.2%。
为什么重要
此前对医疗大模型安全的评估多依赖总体分数,容易掩盖模型把复杂边界病例一律归为不支持或信息不足的行为。该研究用带对抗类别和四级标签的基准,把过度拒答量化为可复现指标,并引入两位肿瘤科医生标注,显示分歧集中在信息充分性与治疗优化的边界,说明高分未必等于临床可用的区分能力。
底层逻辑
基准用合成病例制造需要保留中间判断的场景,模型为规避风险倾向输出更保守的单一标签,导致部分支持标签消失,总体安全分因此虚高。MTB-AuditAgent 用七个确定性模块把证据核验、缺失信息识别、安全分级和弃答拆开,减少单步判断中的保守偏好,从而在保留区分度的同时压低过度拒答。
产品与商业机会
对做医疗或高风险领域 AI 产品的团队,评估集需要包含中间标签和对抗性错误类别,不能只看聚合安全分,否则会误判上线条件。研发上可参考模块化拆分管线,把证据核查与弃答策略独立调优;同时需配备临床专家标注来定义边界,否则标签定义和验收标准会持续漂移。
- 将四级安全标签和五类对抗错误纳入医疗大模型内部评测集,替代单一安全分作为版本门禁。
- 参照七个确定性模块,把证据核验、缺失信息检测、弃答拆成可独立测试和回滚的组件。
- 面向分子肿瘤委员会场景,建立由肿瘤科医生标注的边界病例库,用于校准部分支持与信息不足的判定。
- 对外发布安全评估报告时,同时披露过度拒答率和标签分布,便于采购方比较不同模型配置。
仍待确认
- 500 个合成病例在多大程度上代表真实分子肿瘤委员会的病例分布,尚未验证。
- MTB-AuditAgent 的 91.2% 准确率是否在其他癌种或真实临床数据上保持,证据未覆盖。
- 两位肿瘤科医生标注的一致性指标与分歧解决机制未在摘要中给出。
- 该基准与智能体框架的许可证、维护计划和复现成本尚不明确。