AI实验室基础模型控制落后
The Decoder··作者 Maximilian Schreiner
关键信息
Guidelight评估了六项基础实践,包括记录内部AI活动、通过审查机制拦截高风险操作、使用紧急关闭或“circuit breaking”,以及制定控制失配模型的计划。其结论仅基于公开材料,例如系统卡、安全报告和博客文章。
资讯摘要
一份新的非营利评估称,主要AI实验室并没有充分控制好它们自己的内部AI系统。该评估来自Guidelight,它只使用公开证据来审视Anthropic、OpenAI、Google、xAI和Meta。所依据的材料包括系统卡、安全报告和博客文章,而不是内部审计或机密文件。Guidelight检查了六项基础控制实践,旨在降低AI系统以不安全或未经审查方式行动的风险。
这些实践包括记录内部活动、对高风险操作设置审查环节、使用被称为circuit breaking的紧急关闭机制,以及为控制失配模型做好准备。整体结论是,这些公司在发现异常行为方面做得最好,但在预防和控制方面做得最差。Anthropic和OpenAI拿到最高分C+,Google为D+且被认为有更详细的路线图,xAI得分D−,Meta则垫底,为F。Guidelight是一家独立非营利组织,由前OpenAI安全负责人Page Hedley和Steven Adler创立。

资讯正文
AI实验室未能妥善约束自身系统
没有一家AI公司对其内部AI系统全面落实基本控制措施。这是非营利组织Guidelight首次评估得出的结论。该组织仅依据系统卡、 safety reports 和博客文章等公开来源,对Anthropic、OpenAI、Google、xAI和Meta进行了审查。
Guidelight核查了六项基本做法。其中包括记录内部AI活动、通过审查机制对高风险操作进行把关、被称为“断路器”(circuit breaking)的紧急关闭措施,以及遏制失配模型的计划。Anthropic和OpenAI以C+并列领先,Google以D+紧随其后,并附有一份详细路线图;而xAI(D−)和Meta(F)的得分最差。
这些公司在识别不当行为方面做得最好,在预防和遏制方面做得最差。Guidelight是一个独立非营利组织,由前OpenAI安全负责人Page Hedley和Steven Adler创立。
来源与参考
收录于 2026-08-20