Anthropic研究人员展示了自动化AI系统在10项测试错误对齐行为的基准上全部提升表现,且未出现整体性能退化。这一发现为AI对齐研究提供了新思路,表明系统可能具备自我修正有害倾向的能力,同时也引发了对自主AI改进路径的谨慎思考。
背景
Anthropic是由前OpenAI研究员联合创办的AI安全导向研究实验室,以可解释性研究和AI对齐工作著称,其Claude模型强调基于宪法原则的AI治理以减少有害输出。
- 来源
- TechCrunch
- 发布时间
- 2026年8月29日 03:30
- 评分
- 8.0 / 10