- 类型
- 新闻
- 来源
- The Decoder AI News
- 发布
- 2026年9月4日 17:23
- 状态
- 单一信源
01
发生了什么
OpenAI 的 GPT-6 Astra 模型相比前代减少了幻觉,并能拦截 99.99% 的直接提示注入攻击。但当攻击隐藏在 AI 阅读的文档中时,模型在 8.5% 的场景中仍会被攻破,而 Claude Opus 5 的失败率仅为 4.8%。测试结果表明,在真实数据处理场景下,该模型仍存在安全隐患。
02
为什么重要
直接提示注入攻击已基本被有效防御,但文档等间接渠道的注入攻击依然构成威胁,且 GPT-6 Astra 的失败率高于竞品,表明模型在安全性和可靠性上仍有提升空间。
03
底层逻辑
模型对直接输入的指令可以更好地执行安全对齐,但对嵌入文档中的攻击指令难以识别,原因在于模型需要区分指令与数据,而文档中的内容常被当作数据处理,导致攻击者有机会利用这一弱点。
04
产品与商业机会
对于依赖 AI 阅读外部文档并做出决策的产品,需要额外增加文档安全扫描或输入过滤机制,以降低攻击风险。同时,该性能对比可能影响客户在选择模型时的决策,GPT-6 Astra 或需在防止间接注入方面加强。
- 开发文档内容安全预检工具,针对大模型上下文中的文档进行恶意指令检测。
- 为使用 GPT-6 Astra 等模型的产品增加注入攻击的红队测试环节。
- 将可靠性指标(如失败率)纳入模型选型对比,优先选择在此类攻击中表现更优的模型。
- 设计提示词防护层,区分指令与数据,减少被注入的风险。
05
仍待确认
- 测试中使用的具体攻击场景和文档类型未公开,难以评估对真实业务的影响范围。
- GPT-6 Astra 在 8.5% 失败率具体对应哪些攻击方式或目标,未在证据中说明。
- Claude Opus 5 的表现数据是否由同一测试机构在相同条件下测得,尚待确认。
- 是否有防护措施可以进一步降低隐藏提示注入的成功率,尚无具体方案。
原文与媒体展开查看
