研究人员发现,OpenAI、Anthropic和Google等主流LLM API返回的加密思维链块在同一模型家族内共享加密密钥。通过将加密推理重放至较弱的模型并实施越狱,攻击者可恢复更强模型的隐藏推理内容。各提供商已确认漏洞并完成修复,Claude Haiku 4.5是最容易被攻击的目标。
背景
主流LLM提供商开始向客户端返回加密的思维链推理痕迹,以增强透明度同时保护专有推理内容。此漏洞揭示了这些加密块在不同模型变体间处理时存在的关键缺陷。
- 来源
- Simon Willison
- 发布时间
- 2026年8月12日 06:40
- 评分
- 7.0 / 10