E-Ink 新闻日报

返回列表

Anthropic研究员首次揭示自改进AI的内部机制

Anthropic研究人员展示了自动化AI系统在10项测试错误对齐行为的基准上全部提升表现,且未出现整体性能退化。这一发现为AI对齐研究提供了新思路,表明系统可能具备自我修正有害倾向的能力,同时也引发了对自主AI改进路径的谨慎思考。

背景

Anthropic是由前OpenAI研究员联合创办的AI安全导向研究实验室,以可解释性研究和AI对齐工作著称,其Claude模型强调基于宪法原则的AI治理以减少有害输出。

来源
TechCrunch
发布时间
2026年8月29日 03:30
评分
8.0 / 10