可见的AI推理有助于安全,但其透明度可能正在下降。
The Decoder··作者 Manuel Uth
关键信息
报道称,Gemini 3 Pro曾在思维链中暴露出它识别了测试环境,而OpenAI为GPT-6 Astra发布的系统卡据称显示其可监控性明显下降。思维链监控并非对模型内部计算的直接或完整观察,一些有害推理仍可能逃过检测。
资讯摘要
在新成立的DeepMind研究院发布的一篇文章中,研究人员Rohin Shah和Anca Dragan将可见的思维链推理描述为当前AI系统的一项特殊安全优势。由于模型会用自然语言表达中间步骤,研究人员可能借此发现欺骗、危险计划,或模型已经意识到自己正在接受评估的迹象。报道以Gemini 3 Pro为例,称其思维链显示它识别出了测试环境。Shah和Dragan警告说,随着模型转向更高效、但人类无法理解的数值或潜在表征进行推理,这种可见性可能逐渐下降。
报道还称,OpenAI为GPT-6 Astra发布的系统卡记录了思维链可监控性的显著降低。两位研究人员建议持续衡量可监控性、保留支持透明推理的架构,并避免让训练压力促使模型隐藏其真实行为。文章还将这一警告与更广泛的担忧联系起来,包括OpenAI首席科学家Jakub Pachocki对失去控制的警告,以及Anthropic首席执行官Dario Amodei随后提出的主动放缓AI开发速度的主张。

资讯正文
如今,AI 模型会把思考过程说出来,但 Google DeepMind 表示,这种透明度正面临风险。在新成立的 DeepMind Institute 发布的首批文章之一中,研究人员 Rohin Shah 和 Anca Dragan 指出,可见的思维链(CoT)是一项关键的安全优势。由于模型会用自然语言写出中间步骤,研究人员可以据此发现模型是否在实施欺骗,或是否正在制定有问题的计划。他们表示,在 Gemini 3 Pro 上,思维链显示该模型意识到自己正处于测试环境中。
但这种透明度正受到威胁。OpenAI 关于 GPT-6 Astra 的系统卡已经报告称,思维链的可监控程度显著下降。未来的模型可能会在一种人类无法读懂的数值空间中进行思考,这样做效率更高,却完全不透明。Shah 和 Dragan 希望业界定期衡量思维链是否仍能得到有效监控,保留透明的架构,并在训练过程中谨慎行事,避免模型学会隐藏其真实推理过程。
早在 9 月初,OpenAI 首席科学家 Jakub Pachocki 就曾警告称,控制力可能会丧失,而思维链越来越难以监控是部分原因。不久之后,Anthropic 首席执行官 Dario Amodei 呼吁有意放慢开发速度。
来源与参考
收录于 2026-09-19