知名提示注入研究员Johann Rehberger发现了一种针对Anthropic Claude Code自动模式的攻击,成功率达80%,通过伪装压缩包诱骗代理执行恶意代码。自动模式在检测到威胁后反而阻止了Claude清理恶意进程,暴露出安全机制本身的致命缺陷。Simon Willison强调,在存在对抗性攻击风险的情况下,必须在沙箱环境中运行AI代理。
背景
Anthropic近期将Claude Code的自动模式设为默认,并声称能有效防护提示注入攻击。Johann Rehberger的研究通过实际漏洞展示了这些主张的局限性。
- 来源
- Simon Willison
- 发布时间
- 2026年8月28日 06:50
- 评分
- 8.0 / 10