TechCrunch的测试发现,尽管Anthropic的Opus 4.6模型存在安全限制,但仍可被诱导生成色情内容。这一发现凸显了AI内容审核和模型安全对齐方面仍面临持续挑战。
背景
Anthropic以AI安全和对齐研究著称,Claude模型旨在拒绝有害请求。然而,研究人员和记者反复发现,精心设计足够复杂的提示词可以绕过这些安全护栏。
- 来源
- TechCrunch
- 发布时间
- 2026年8月22日 07:07
- 评分
- 6.0 / 10
TechCrunch的测试发现,尽管Anthropic的Opus 4.6模型存在安全限制,但仍可被诱导生成色情内容。这一发现凸显了AI内容审核和模型安全对齐方面仍面临持续挑战。
Anthropic以AI安全和对齐研究著称,Claude模型旨在拒绝有害请求。然而,研究人员和记者反复发现,精心设计足够复杂的提示词可以绕过这些安全护栏。