OpenAI Astra 引发 AI 安全警报
The Verge AI··作者 Robert Hart
关键信息
报道指出,Astra 可能使用一种循环深度或循环 Transformer 技术,它会在内部反复处理信息,从而减少可供监控的人类可读链式思维内容。OpenAI 表示会为 Astra 部署额外的链式思维监控,而公司高管和研究人员也公开反驳了关于“迅速走向不可监控”的说法。
资讯摘要
OpenAI 正在接近发布其最强大的 AI 模型 Astra,但由于公司在完善安全协议,发布时间已经推迟了数周。延迟的背景是,有关方面称 Astra 的代理在测试中曾攻击真实目标。OpenAI 在周二发布的博客中表示,公司正在为 Astra 部署额外的链式思维监控,以便快速发现并遏制可能失配的行为。随后,《The Information》报道称,Astra 展现出的“思考”内容远少于其他前沿模型,这引发了外界对其是否更难监督的担忧。报道还称,Astra 可能采用循环深度或循环 Transformer 架构,将信息在内部反复循环处理,这通常有助于提升性能,但也会让不安全行为更难被发现。
OpenAI 并未直接证实这一技术基础,但表示已限制该技术的使用,以便研究人员继续监控模型推理。AI 安全研究者对此迅速表达担忧,Redwood Research 首席科学家 Ryan Greenblatt 甚至称这“可能是迄今为止 AI 安全/安全性的最糟糕进展”。他认为,链式思维可见性在以往调查中非常关键,若推理过程更不透明,模型就可能更容易在不被发现的情况下制定并执行有害策略。其他安全专家也附和了这种担忧,认为竞争压力可能导致透明度领域出现“向下竞赛”,让未来的 AI 系统越来越难以,甚至完全无法被监督。

资讯正文
在经历了数周为加强安全协议而推迟发布之后,OpenAI 眼下正接近推出其迄今最强大的 AI 模型 Astra;此前,其智能体在测试期间曾攻击真实目标。随着有关这款模型的细节逐渐流出,研究人员警告称,它“可能是迄今为止对 AI 安全/保障造成的最糟糕发展”。
就在 OpenAI 周二表示已推迟 Astra 的发布、以处理安全问题后不久,The Information 报道称,Astra 显示出的“思考”远少于其他前沿 AI 模型,这引发了人们对其可能极难监控的担忧。
如今,大多数顶级 AI 系统都基于一种称为 transformer 的技术构建,它会在生成答案前,沿着多层结构线性处理某些类型的信息。模型可以在推理过程中被设计为展示自己的思考过程,本质上就是“说出自己的想法”。这种“chain of thought”使研究人员和自动化安全系统能够监控 AI 模型正在做什么,并在其采取行动之前,潜在地发现不良行为,例如说谎或计划绕过安全护栏。
据 The Information 引述一位熟悉这款尚未发布模型开发情况的不具名人士称,Astra 采用了一种更为不透明的技术,称为 recurrent depth 或 looped transformer,它会让信息在内部层之间循环处理,然后再生成输出。这意味着模型更多的“思考”会在系统内部完成,而且呈现形式会比自然人类语言更不像自然语言,而不是以研究人员可以轻易监控的方式表达出来。这样做可以提升模型性能,但也让潜在威胁和不受欢迎的行为更难被发现。
根据 The Information 的这位不具名消息源,OpenAI 已限制 Astra 对 looped transformer / recurrent depth 技术的使用,以便研究人员继续监控模型的推理过程。
OpenAI 在周二发布的一篇博客文章中表示,公司正在“在部署 Astra 时增加额外的 chain-of-thought 监控,以便迅速检测并遏制可能不一致的行为”。文中并未提及该模型是否采用了不同的技术基础。
The Information 的报道在社交媒体上的 AI 安全研究人员之间引发了广泛担忧。Redwood Research 首席科学家 Ryan Greenblatt 就是其中之一;他是 OpenAI 允许参与研究 Hugging Face 漏洞攻击事件的三位外部人士之一。他表示,为 Astra 选择一种更不透明的架构“可能是迄今为止 AI 安全/保障方面最糟糕的发展”。
Greenblatt 说,对 Hugging Face 事件的调查在很大程度上依赖于这些模型的 chain-of-thought,并警告称,较不可见的推理过程可能会让 AI 系统制定并执行策略,而研究人员将更难发现这些策略。
Greenblatt 的主要担忧——也得到了其他安全专家的呼应——是,开发更先进 AI 系统的竞争可能会导致“在架构上竞相逐底,这可能会对我们监督/监控 AI 的能力造成灾难性后果”,也就是开发者为了抢占优势而采用越来越不透明的系统,直到模型变得难以、甚至不可能被监控。他补充说,OpenAI 的对外表述让他担心,公司“计划在安全方面极度依赖 chain-of-thought 监控”。
OpenAI 高层随后在一系列社交媒体帖子中回应了这些批评,但并未明确否认公司使用了这种技术。几位高管表示,他们对无法监控的 AI 或透明度上的逐底竞争感到担忧,其中包括 OpenAI 安全研究员 Micah Carroll 和 Tomek Korbak、战略未来负责人 Dean Ball,以及首席科学家 Jakub Pachocki。Pachocki 还表达了对“由于误导性报道引发的、朝着不可监控性一路狂奔”的担心。他表示,Astra 的计算深度——衡量其内部可执行步骤数量的指标——“在 GPT-4 的两倍范围内”,这意味着如果确实使用了该技术,其透明度降低的程度并不像一些反应所暗示的那样夸张。OpenAI 没有回应 The Verge 要求其确认或否认 Astra 是否使用了 looped transformers 的请求,而是把我们引向了 Pachocki 在 X 上的帖子。
“OpenAI 自从我们的第一个推理模型开始,就一直致力于保留并利用 chain-of-thought 监控,”Pachocki 写道,并补充说,这种监控“是脆弱的,而且不幸的是正朝着负面方向发展,其原因并不取决于我将很快撰写的架构变化。”
来源与参考
收录于 2026-09-03