一项新研究发现,顶级AI实验室缺乏关于如何遏制失控模型的公开计划,引发了人们对应对AI系统日益表现出的意外且潜在危险行为的能力的担忧。这一发现凸显了随着对对齐风险认识加深,AI安全治理方面仍存在重大缺口。
背景
包括2025年ChatGPT政治角色扮演争议和Anthropic的Claude回应"抱歉我做不到"在内的多起AI事故,凸显了现实中的对齐失败问题。2025年的前沿AI实验室宣言签署方承诺分享安全信息,但实际的安全管控策略仍然不明确。
- 来源
- TechCrunch
- 发布时间
- 2026年8月23日 00:00
- 评分
- 6.0 / 10