E-Ink 新闻日报

返回列表

前沿AI实验室仍不愿透露如何遏制失控模型

一项新研究发现,顶级AI实验室缺乏关于如何遏制失控模型的公开计划,引发了人们对应对AI系统日益表现出的意外且潜在危险行为的能力的担忧。这一发现凸显了随着对对齐风险认识加深,AI安全治理方面仍存在重大缺口。

背景

包括2025年ChatGPT政治角色扮演争议和Anthropic的Claude回应"抱歉我做不到"在内的多起AI事故,凸显了现实中的对齐失败问题。2025年的前沿AI实验室宣言签署方承诺分享安全信息,但实际的安全管控策略仍然不明确。

来源
TechCrunch
发布时间
2026年8月23日 00:00
评分
6.0 / 10