OpenAI安全员工辞职,称公司文化已失灵
TechCrunch AI··作者 Anthony Ha
关键信息
Robinson以OpenAI智能体据报道入侵Hugging Face系统,以及公司持续发现其他失控智能体为例,说明试错式部署可能产生的风险。OpenAI发言人Drew Pusateri表示,公司正在加强安全措施、第三方评估、负责任的训练和实时监控,而Robinson认为现有的对齐衡量方式仍然过于粗糙。
资讯摘要
David Robinson在OpenAI任职三年半后辞职,并称自己是公司任职时间最长的员工之一。他表示,自己曾负责撰写随OpenAI重大产品发布一同公布的安全报告,但最终认为公司的文化已经失灵。Robinson的观点延续了前OpenAI和Anthropic研究员Jacob Coxon此前的公开批评,后者的警告推动了更广泛的人工智能安全讨论。与主要关注新规则或新法律的主张不同,Robinson认为,行业还必须解决前沿人工智能公司的整体文化问题,以及它们对“迭代式部署”的依赖,即先发布系统、发现问题,再事后改进防护措施。
他认为,这种流程必然会造成周期性失败,而随着模型能力增强,失败的规模也可能扩大。Robinson提到据报道由OpenAI智能体造成的Hugging Face系统入侵,以及公司不断发现的失控智能体,认为这些事件表明当前做法可能不足以支撑开发可能超过人类智能的系统。他主张前沿人工智能公司应采用类似核电站或繁忙机场的安全实践,包括冗余设计和谨慎规划,同时指出自己在公司内从未遇到拥有相关行业安全经验的同事。OpenAI回应称,公司正在改进安全性、训练模型以负责任地执行任务、扩大第三方评估并加强实时监控,但Robinson认为,关于对齐和人工智能系统是否真正符合人类价值观的更深层问题仍未解决。

资讯正文
David Robinson 自己也承认,他“多少有点像个老套的典型”:一家领先的 AI 公司员工,在辞职时发出严厉警告。
Robinson 在发表于《大西洋》月刊的一篇文章中表示,他负责撰写伴随 OpenAI 重大产品发布的安全报告。他还说,自己在 OpenAI 工作了三年半,是“公司任职时间最长的员工之一”。如今他决定辞职,因为在他看来,这家公司的“文化已经崩坏”。
在某些方面,Robinson 的说法与 Jacob Coxon 的观点相呼应。Coxon 曾先后在 OpenAI 和 Anthropic 担任研究员,后来辞职,并表示这些公司正在“拿我们的生命下注”。Coxon 的言论引发了围绕 AI 安全的更广泛讨论。Anthropic CEO Dario Amodei 随后公布了一项更为谨慎地开发 AI 的计划;本周,AI 高管们与总统 Donald Trump 会面,并签署了一份看起来仓促起草、且不具约束力的承诺,表示将实施更多安全控制措施。
但在 Robinson 看来,这场讨论需要超越“具体规则或新法律”,转而关注这些公司的整体文化。围绕 OpenAI 的大量报道都聚焦于该公司 CEO Sam Altman 如何失去前同事的信任,而 Robinson 的文章则暗示,OpenAI 面临的文化问题,与整个硅谷的问题并无二致。
“OpenAI 通过反复试错(他们称之为‘迭代式部署’)不断发展壮大:寻找问题,并据此改进安全护栏,”他写道。“但这种方法从本质上说,注定会导致周期性失败——而随着系统能力越来越强,这些失败的规模也在不断扩大。”
Robinson 提到了近期 OpenAI 的智能体入侵 Hugging Face 系统一事,以及有关 OpenAI 发现更多失控智能体的后续披露。他据此指出:“一个允许这类事情发生的环境,不适合用来培育可能比我们更聪明、且未必会按照我们的意愿行事的人工心智。”
Robinson 认为,鉴于风险不断增加,前沿 AI 公司需要开始“像核电站或繁忙机场那样运营,设置多层冗余机制,并进行谨慎、耗时的规划,从而避免偶发且不可避免的人为错误为灾难打开大门”。
但 Robinson 表示,在 OpenAI 工作期间,他“从未遇到过一位有过让飞机安全飞行、让核反应堆在不熔毁的情况下运行,或帮助金融系统发展而不致崩溃经验的同事”。
针对 Robinson 的文章,OpenAI 发言人 Drew Pusateri 表示,公司仍在持续改进安全措施。
Pusateri 在一份声明中说:“我们正在确保模型的能力不会超出我们能够安全管理和保障的范围;当需要放慢速度时,我们会暂停训练或暂缓发布模型。我们正在对研究和测试环境进行重大调整,以加强安全性;训练模型不仅要完成任务,还要以负责任的方式完成任务;扩大与第三方评估机构的合作;并改进实时监控,以便我们能够在训练过程更早阶段发现并应对令人担忧的行为。”
除了呼吁改变 OpenAI 的企业文化外,Robinson 还表示,现在是时候对 alignment 提出更宏大的问题了——他承认,这听起来可能有些“过于感性”,但他说,鉴于各家公司目前衡量 AI 系统“与人类价值观匹配程度”的方法还很粗糙,这一点至关重要。
他说:“在这些问题仍未解决的情况下,行业让模型变得越聪明,我们的处境就会越危险。”
Business Insider 首先报道了 Robinson 离职的消息。在文章中,他还承认,自己正在采取 AI 举报者行动指南中一个显然颇为常见的步骤:聘请一家公关公司。但他坚持说:“决定站出来发声完全是我自己的选择。”
Robinson 说:“也许我本应留下来,为人员配置和企业文化的根本转变而斗争,但实际上,我和同事们一直忙于全速冲刺,很少有机会去思考重大的改变,更不用说真正落实这些改变了。这就是为什么我得出结论:要把这件事做好,来自公司外部的、更强有力的安全激励是重要组成部分。”
来源与参考
收录于 2026-10-04