Trillium Labs 将公开研究高风险人工智能

WIRED AI··作者 Will Knight

关键信息

Trillium Labs 初期将重点研究后训练、强化学习和递归自我改进,其中递归自我改进可能持续推进并引发人类失去控制的担忧。创始人还指出,产业界与学术界之间存在现实资源鸿沟:高校往往缺乏复现大型实验室研究所需的计算资源。

资讯摘要

Nathan Lambert 和 Tom Zick 是两名人工智能研究员,他们在加州大学伯克利分校读研究生期间相识,并共同成立了非营利组织 Trillium Labs。该组织将研究多个人工智能领域,并公开发布实验方法和结果,使外部科学家能够分析和复现实验。Lambert 认为,前沿人工智能公司的保密做法限制了同行审查,也减少了外部研究者提出新方法和贡献力量的机会,使人工智能发展偏离了科学方法。OpenAI 和 Anthropic 等公司的领先模型通常只能通过应用程序或应用程序接口访问,因此外界很难了解模型的构建方式及其行为。

相比之下,中国的一些公司已经发布了可以下载的模型,小米还公开了某次重要训练运行的实时细节,斯坦福大学研究人员也在公开预训练 Marin 模型。这场争论之所以更加紧迫,是因为强大模型能够自动发现软件漏洞,并探测或攻击计算机系统,因此有人主张只应让可信机构使用这些能力。Trillium Labs 初期将研究后训练、强化学习和递归自我改进,包括这些方法如何塑造模型行为,以及如何导致意外行为或过度迎合用户。

Trillium Labs 将公开研究高风险人工智能

资讯正文

这些 AI 专家希望公开开展高风险研究

两位业内科学家 Nathan Lambert 和 Tom Zick 持相反观点。两人创办了非营利组织 Trillium Labs,将以更加透明的方式开展 AI 研究,涉及多个领域,其中包括递归自我改进(RSI)和智能体等可能存在问题的方向。具体而言,这意味着公布实验细节,以便外部科学家进行研究和复现。

Lambert 表示,前沿 AI 实验室对研究工作的保密,削弱了整个社区审视相关理念和提出新方法的能力。他认为,让外部专家了解模型是如何构建和调优的,可能对降低风险至关重要。

Lambert 对 WIRED 表示:“在过去几千年里,人类一直把科学方法作为工具箱中的一种手段,用来降低危害、创造更美好的未来。当前前沿 AI 开发所走的封闭路线,正在让我们倒退一步。”

世界上最强大的模型——例如 OpenAI 和 Anthropic 开发的模型——只能通过应用程序或应用程序编程接口(API)访问。很多时候,这种方式是以牺牲模型构建方式和行为表现的透明度为代价的。

其他公司,尤其是中国的公司,则提供了相对强大的模型,用户可以下载这些模型并在自己的硬件上运行。例如,中国公司 Xiaomi 最近公布了其一款模型进行重大训练时的实时细节。斯坦福大学的研究人员也正在公开对 AI 模型 Marin 进行预训练。

目前,整个行业正围绕哪种策略更好展开竞争,这主要是因为前沿模型如今的能力已经非常强大。它们能够自动发现新的软件漏洞,还能自动探测并入侵系统;而近期几起备受关注的大规模黑客攻击事件,也促使人们对这一问题展开更严格的审视。

有限访问体系的支持者认为,必须把这种能力掌握在少数值得信任的人手中;而 Lambert 和 Zick 这一阵营的人则认为,对风险形成共同理解,才能让所有人受益更多。

Lambert 此前曾在 Ai2 工作。Ai2 采取了不同寻常的开放式 AI 研究方式,包括在发布模型本身的同时,公布用于构建模型的数据和训练方法等细节。他还曾在 Hugging Face 工作,运营一个颇受欢迎的技术博客,并创办了 American Truly Open Models——这项倡议旨在鼓励美国公司发布更多开放模型。Zick 曾在哈佛大学工作,并帮助 Charles Schwab 制定有关“负责任 AI”的政策。

两人在新冠疫情期间通过 Zoom 结识。当时,两人都是加州大学伯克利分校研究 AI 的研究生。在看到产业界的 AI 研究与学术工作之间日益脱节后,他们萌生了创办这一新非营利组织的想法。Lambert 表示,由于缺乏必要资源,教授和学生往往无法复现大型公司实验室内部开展的研究。

Zick 表示,今天启动的 Trillium Labs 最初将专注于后训练,即在大型模型构建完成后对其进行微调。另一个重点领域将是 RSI,即通过让 AI 参与研究来开发新模型的过程。持续进步可能无限延续、最终导致人类失去控制的前景,已经令许多 AI 研究人员感到担忧。本月早些时候,一名 Anthropic 研究人员离开公司并警告称,RSI 可能对人类构成生存威胁,这一问题因此获得了主流关注。

这家非营利机构还将研究如何利用强化学习来提升模型能力。强化学习会奖励模型的良好结果,并惩罚其糟糕表现。这种方法让智能体的能力大幅增强,但也使它们更容易做出意料之外的事情。他们将研究强化学习如何塑造 AI 模型的性格和行为;例如,当模型变得过度迎合时,这种方法就可能带来问题。

Zick 说:“要理解强化学习在后训练阶段如何扩展,你需要大量计算资源以及许多谨慎的实验。”她表示,公开强化学习训练运行的具体细节,可能会在外部研究人员仔细审视这些工作时带来令人意外的洞见。

该实验室已从 Schmidt Sciences、Halcyon Futures 及其他机构筹集到一笔未披露金额。创始人表示,他们的目标是总计筹集 4000 万至 1 亿美元,并计划在未来 18 个月内投入 3000 万美元用于训练。

政策智库 Institute for Progress 的新兴技术政策主管 Tim Fist 对 WIRED 表示:“我非常支持比目前研发领域所拥有的透明度高得多的透明度。”

Lambert 和 Zick 最终希望,Trillim Labs 能为有关如何最好地构建 AI 的更广泛讨论,带来一些亟需的细微辨析。

Lambert 说:“如今的 AI 讨论由少数几种世界观主导。我们相信,科学方法以及对近期事件进行谨慎测量,是理解 AI 模型新行为的最佳方式。”

来源与参考

  1. 原始链接
  2. These AI Experts Want to Do High-Stakes Research Out in the Open

收录于 2026-10-03