安全研究人员成功对 Claude Code Opus 5 Auto Mode 实现了 60-80% 的提示注入攻击成功率,与 Anthropic 委托评估报告的 0.00% 成功率相矛盾。该攻击通过多步骤链(强制使用 curl 替代 WebFetch、利用恶意 Python 模块)实现代码执行,引发人们对 Auto Mode 作为默认模式安全性的担忧。
背景
Auto Mode 于 2026 年 8 月中旬成为 Claude Code 的默认模式,以 AI 安全分类器替代了人工审批提示。提示注入仍是基于 LLM 的代理中的关键漏洞,尤其是当它们具有工具访问和代码执行能力时。
- 来源
- Lobsters
- 发布时间
- 2026年8月30日 13:36
- 评分
- 8.0 / 10