一篇研究论文揭示了一种新型攻击方式:攻击者可以从声称隐藏推理过程的闭源LLM API中提取推理链(Chain-of-Thought)令牌。通过精心设计的查询和利用API响应模式,攻击者能够重建模型在复杂查询时的内部推理步骤。
背景
OpenAI和Anthropic等主流AI公司一直在隐藏其API响应中的推理链令牌,以保护知识产权并防止对抗性操纵。该研究证明,通过巧妙的提取技术,这些隐藏的推理过程是可恢复的。
- 来源
- Hacker News (RSS)
- 发布时间
- 2026年8月11日 21:22
- 评分
- 7.0 / 10