- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月21日 13:47
- 状态
- 单一信源
发生了什么
ClawSentry 是一个开源、框架无关的安全监督网关,用于保护自主 LLM 代理。它基于代理风险渐进式威胁模型,在技能导入、调用意图、执行效果和事后影响四个环节设置多层审查。在 SkillInject 测试中,使用 Codex/GPT-5.4 时,上下文攻击成功率从 39.55% 下降。
为什么重要
现有防护通常局限于单一生命周期边界或单次调用,而 ClawSentry 将风险视为渐进式过程,覆盖代理控制循环的四个关键点,并统一应用于 Codex、Claude Code、Kimi CLI 和 Gemini CLI,无需修改代理内部结构,提供了跨框架的安全监督方案。
底层逻辑
ClawSentry 在技能包执行前进行确定性审计,并在运行时采用三层渐进式决策引擎:确定性 L1 层、基于规则的 L2 语义审查和只读 L3 证据寻求代理,按需分配上下文审查资源。此外,会话级反绕过机制识别工具切换和措辞改写,事后路径将高严重性证据非追溯性地纳入后续审查。
产品与商业机会
对于依赖 LLM 代理执行代码或操作外部工具的产品,ClawSentry 可降低数据泄露和权限提升风险,提升安全性。其框架无关特性减少集成成本,但可能引入额外的审查延迟和计算开销。团队需评估其对用户体验和成本的影响。
- 集成 ClawSentry 网关到现有代理产品,提供安全监控功能。
- 为高风险技能包建立预先审查流程,降低恶意技能风险。
- 开发基于 ClawSentry 的可视化安全仪表盘,辅助管理员监控代理行为。
- 提供 ClawSentry 的托管服务,面向中小企业客户。
仍待确认
- ClawSentry 在真实生产环境中的性能开销和延迟数据是多少?
- 其反绕过机制对其他未提及的代理框架是否同样有效?
- 该安全网关是否适用于多代理协作场景?
- 文中提到的攻击成功率下降是否具有统计显著性?