OpenAI 新推理方法引发 AI 安全担忧
TechCrunch AI··作者 Russell Brandom
关键信息
报道称,Astra 对 recurrent depth 的使用是有限的,OpenAI 仍预计模型的思维链保持可读,而不是彻底转向完全不可解释的“neuralese”。OpenAI 也表示会部署更广泛的思维链监控系统,但批评者警告,这种技术一旦继续扩展,长期可能会降低可监控性。
资讯摘要
TechCrunch 报道称,OpenAI 即将推出的 Astra 模型可能采用一种名为 recurrent depth 的推理方法,也叫 opaque recurrence。与常见的顺序式思维链不同,这种技术据称会让模型对同一个提示进行多次循环处理,从而留下更少、也更难阅读的推理痕迹。这个消息让多位 AI 安全研究者感到不安,因为思维链日志一直是审视模型行为、发现失配问题的重要工具。Redwood CEO Buck Shlegeris 表示自己“极度担忧”,并警告如果 OpenAI 继续扩大这种技术的使用范围,可能会彻底破坏思维链的可监控性。AI 安全倡导者 Zvi Mowshowitz 甚至认为,可能需要法律来阻止各家实验室在更难监控的系统上展开“向下竞争”。
报道同时指出,Astra 对该技术的使用似乎是有限的,OpenAI 也反驳了其会转向完全不可解释的“neuralese”的说法。OpenAI 首席科学家 Jakub Pachocki 强调,保留可读的思维链一直是公司核心研究目标之一。尽管如此,报道还称 Anthropic 和 Google DeepMind 也已经在讨论这一技术,说明它可能会扩散到更多模型和公司。Redwood Research 首席科学家 Ryan Greenblatt 则警告说,opaque reasoning 可能很容易被进一步扩展,最终把推理过程几乎完全移入人类看不见的 latent space 中。

资讯正文
《The Information》周二报道称,OpenAI 的新 Astra 模型将采用一种名为“recurrent depth(递归深度)”的推理技术,使其能够摆脱大多数推理模型所特有的顺序式思考。这种技术也被称为“opaque recurrence(不透明递归)”,很可能会让人更难监控模型的思维链——这让 AI 安全专家感到不安。
尽管据报道,Astra 对这种技术的使用范围有限,但它的出现仍然引发了 AI 安全专家的强烈担忧。
Redwood 首席执行官 Buck Shlegeris 在这一消息传出后发帖写道:“我对有关 Astra 使用 opaque recurrence 的报道感到非常担忧。我不知道 Astra 相比之前的模型在 CoT 可监控性上是否差很多。但如果 OpenAI 进一步推进这项技术,他们就可以大幅增加递归程度,彻底破坏 CoT 的可监控性。”
长期倡导 AI 安全的 Zvi Mowshowitz 也发表了看法,并写道,可能需要法律来防止各家 AI 实验室之间出现“逐底竞争”。
Mowshowitz 写道:“这项技术是在玩火,冒着触碰一个禁忌的风险——OpenAI 和 Anthropic 一直努力建立这样的禁忌,即我们会尽可能长时间地认真维护 Chain of Thought 的忠实性和可监控性。更大强度地使用这类技术,可能会损害可监控性。”
在正常情况下,推理模型的思维链会提供模型在尝试解决问题时所采取的顺序步骤。虽然这种表示并不完美,但它仍然是监测异常行为或错位的重要工具。在 OpenAI 最近的失控代理活动案例中,思维链记录是梳理代理为何会那样行为的重要工具。
在 opaque recurrence 中,模型采用一种不那么线性的方式,会将同一个查询在循环中处理多次。这样产生的可读痕迹更少,实际上绕开了传统的思维链记录。
关键在于,Astra 对该技术的使用似乎是有限的。预计该模型的思维链仍然是可读的,而公司也反驳了任何有关它会转向“neuralese”的暗示。OpenAI 此前已经宣布,将把广泛的思维链监控系统作为其面向未来的安全计划的一部分。
OpenAI 首席科学家 Jakub Pachocki 在 X 上发文强调了实验室对可读思维链的承诺。Pachocki 写道:“自我们最早的推理模型以来,OpenAI 一直致力于保留并利用思维链监控。这是我们当前研究计划的核心目标。”
所有 AI 模型都会进行一定程度的不透明推理,而且很少有研究人员把思维链日志视作模型推理过程的直接呈现。即便如此,这些说明并不能消除人们的担忧:opaque recurrence 可能会让 AI 推理更难监控,尤其是在它被越来越多模型采用的情况下。周三上午,《The Information》在后续报道中称,Anthropic 和 Google DeepMind 都已经在讨论这项技术。
在一篇回应这一消息的帖子中,Redwood Research 首席科学家 Ryan Greenblatt 表示,隐式推理很容易比传统的思维链推理扩展得更快,实际上会把所有推理都从可见通道中移除。
Greenblatt 写道:“我最大的担忧是,从这里自然发展下去会把隐式推理扩展到让模型完全或几乎完全在潜在空间中进行推理的程度。我希望现在还不算太晚,能够避开最令人担忧的架构,并且 OpenAI 会就此止步。”
来源与参考
收录于 2026-09-03