01 · 最新
PuzzleMask:利用普通 prose 作为隐蔽的 AI 攻击载体
2026年9月10日
Prompt InjectionAI 安全闸门Agentic AI防护绕过
核心判断:这不是传统意义上的直接越狱,而是利用“弱安全检查模型 → 强目标模型”的架构差异,把恶意指令藏在看似正常的叙述中。
攻击机制
- 攻击者把违规载荷嵌入一段普通英文 prose,不依赖表情、Base64、不可见字符等明显混淆手段。
- 资源受限的快速检查模型只看到整体语义,把输入判定为 safe。
- 目标模型随后从 prose 中提取隐藏载荷,把它当作新的输入继续处理,甚至执行其中的危险意图。
研究数据
- 研究团队用自动化流程生成并测试了 23 个 crafted prompts。
- 测试的快速检查模型包括 gpt-4o-mini、gpt-oss-safeguard、Claude 3 Haiku 和 Llama Guard 3。
- 在目标模型测试中,配备 Python 代码解释器的 gpt-5-thinking-high 在超过 90% 的试验中成功提取并处理隐藏载荷。
对安全架构的启示
- 不能只检查用户输入是否“看起来安全”,还要观察目标模型实际提取了什么。
- 低成本 gatekeeper 与高推理能力 target 之间存在能力鸿沟时,单层分类容易失效。
- Agent 拥有代码解释器、文件系统或工具权限后,间接注入的后果会明显放大。
建议防护
- 对输入做独立的语义改写/规范化,再交给目标模型。
- 在 gatekeeper 策略中明确要求识别“被包装、转述、引用”的指令载荷。
- 同时监控模型行为、工具调用和输出,不要只看输入分类结果。