Anthropic展示早期自我改进的AI对齐
TechCrunch AI··作者 Russell Brandom
关键信息
这个系统被称为自动化对齐研究者(AAR),它会检索文献、提出方法,并以每次30分钟的方式训练模型,在迭代中保留有效方法、丢弃无效方法。Anthropic称,最佳AAR方法平均在六小时内就超过了有经验的人类研究者,而且成本差距明显:AAR每小时约4美元,而人类研究者约150美元。
资讯摘要
Anthropic发布了一项新研究,为自我改进型AI研究的实际形态提供了早期样本。论文题为《Automated Researchers Can Reliably Mitigate Alignment Failures》,重点介绍了一套旨在提升模型对齐表现的自动化系统。实验中,该系统被赋予10个与具体失配行为相关的基准任务。Anthropic表示,自动化研究者在全部10个基准上都提升了结果,同时没有让整体性能下降。该系统的工作方式模仿了传统研究流程的一部分:先检索现有文献,再提出方法,然后用30分钟训练模型,接着根据结果继续迭代。
有效的方法会被保留,无效的方法会被丢弃,因此系统能够快速、大规模地反复试验。论文认为,这些结果为“自动化对齐后训练”在短期内变得可行提供了早期证据。Anthropic还将该系统与人类研究者进行比较,称最佳AAR方法在平均六小时内就超过了经验丰富的人类所提出的方法。论文还指出,自动化系统的成本远低于人类研究者,大约每小时4美元的API推理成本,对比人类研究者每小时150美元。与此同时,作者也强调了局限性:只有当这些基准真实反映对齐目标时,这种方法才有意义,而维护这些基准以及相关文献本身也是一项重大挑战。

资讯正文
用其他 AI 模型来训练 AI 模型,已经成为一众新兴实验室非常热门的目标——而现在,Anthropic fellows program 里的一位研究员,让我们提前窥见了这一做法在实践中可能是什么样子。
周五,Anthropic 发表了一篇题为《Automated Researchers Can Reliably Mitigate Alignment Failures》的新论文,详细说明了 AI 系统如何可靠地提升某个模型在一组对齐基准上的表现。在被赋予 10 项针对特定失配行为的基准后,这些自动化系统成功让每一项基准的表现都得到提升,同时没有削弱整体性能。
该系统由 Anthropic fellow Chen Yueh-Han 领导,复现了研究中的许多传统做法。每个自动化系统都会检索现有文献、提出一种方法,并使用该方法训练模型 30 分钟,随后在多轮迭代中逐步提高基准表现。有效的方法会被保留下来,无效的方法则被丢弃,从而让系统能够以很高的速度和规模运行。
论文写道:“总体而言,这些结果为自动化的对齐后训练在短期内变得可行提供了早期证据。”
这篇论文向递归自我改进迈出了一步;许多人认为,这将是 AI 进展中的下一个重要阶段。如果模型能够改进自身的对齐训练,那么它们也有可能更广泛地改进训练实践——到那时,人类 AI 研究人员或许很快就会变得多余。
论文并不回避这一想法,明确将 Automated Alignment Researcher(AAR)与其人类对应者进行比较。论文写道:“表现最好的 AAR 方法,在平均 6 小时内就能胜过经验丰富的人类所提出的方法。”“人类引导的研究方向并不会带来更强的表现。”
如果还有人不信,论文甚至给出了成本对比。论文写道:“AAR 每小时在 API 推理上的成本大约为 4 美元,而我们为人类研究人员支付的费用是每小时 150 美元。”
公平地说,论文也指出了这种方法的一些局限性。自动化系统只有在这些基准真实反映实际对齐目标的前提下才有效,而且即便如此,建立并维护这些基准仍有大量工作要做——更不用说维护和扩展自动化研究者所依赖的文献基础了。
谁在幕后操盘新的“隐身模型”Ox Alpha?
Anthropic 研究员刚刚让我们一窥自我改进型 AI 的样子 | TechCrunch
来源与参考
收录于 2026-08-29