Anthropic前沿红队发布评估结果,显示GLM-5.3和Claude Mythos Preview等前沿AI模型已能自主开发二进制漏洞利用攻击,在4%-6%的试验中成功实现完整控制流劫持,而早期模型(如Claude Opus 4.6)完全无法做到。这一发现标志着重要的安全阈值:前沿模型正接近独立策划低级网络攻击的能力。
背景
Anthropic前沿红队对前沿AI模型进行安全关键任务评估,以理解能力边界。该基准测试模型能否自主开发漏洞利用技术,这是AI安全研究中的核心关切,随着模型逐步具备代理能力。
- 来源
- Simon Willison
- 发布时间
- 2026年9月30日 06:20
- 评分
- 7.0 / 10