DeepMind 的 Co-Scientist 进化为闭环实验系统

The Decoder··作者 Matthias Bastian

关键信息

Google 表示,验证模块会把文本中的数值主张与执行日志交叉核对,以减少虚构结果,这是在应对基于 LLM 的科研代理的已知弱点。文章也指出了重要限制:部分实验仍需人工操作,某些结果尚未完全确认,而且在医疗 AI 案例中,基准分数提升并不总是与医生评估一致。

资讯摘要

Google DeepMind 将 Co-Scientist 从一个主要用于生成假设的系统,升级为一个与实验室工作流深度连接的闭环研究平台。该系统基于 Gemini 模型,现在可以从研究问题出发推导假设、制定实验计划、编写代码或机器可读的实验协议、控制实验设备、分析结果,并起草科学论文。Google 还表示,系统中的验证模块会把生成文本里的数值主张与执行日志交叉比对,以减少幻觉和编造结果。公司最早在 2025 年 2 月推出 Co-Scientist,当时它基于 Gemini 2.0,但在事实核查和文献综述方面仍有不足。此次更新中,系统在三个学科里以不同程度的自主性接受了验证。材料科学实验中,它为人类执行生成了合成配方,并在半自动化高温炉上找到了某种目标二维材料更安全的制备路径,这种材料此前主要通过有害蚀刻制备。经过 25 轮人工修正后,团队制得了性质接近目标材料的层状结构,但其原子结构仍未得到最终确认。第二个材料学实验中,系统借助 Gemini 3 Deep Think 直接控制设备,首次尝试就合成出三种半导体薄膜,并把配方开发时间从数天缩短到数分钟。不过,人工仍需手动放置样品和前驱体,而且这种快速模式得到的晶体比精细优化后的配方更小、均匀性更差。

文章还指出,这些配方是否能迁移到其他实验室仍是未知数。生物学实验中,Co-Scientist 自主构建了一个图像分析管线,用来预测基因工程大肠杆菌菌落在不同化学浓度下会形成哪些图案,其预测结果与未公开的实验室结果在四个形状特征中的三个相符。研究者也承认,这个系统只能在已知条件之间推理,无法预测全新系统中的行为。计算机科学实验则完全没有人工参与,除了最初设置之外全部由系统完成。Co-Scientist 设计了名为 Agent_H 的医疗 AI 架构,该架构会对输入问题分类、并行生成几十个回答候选,再不断细化。经过对回答长度的修正后,Agent_H 在健康类基准上优于六个前沿模型,包括 GPT-5 和 Claude Opus 5。可是,人类评估并没有完全支持这些基准结果。三位拥有认证资格的医生从九个维度评分后发现,与基线 Gemini 3.1 Pro 相比,Agent_H 只有在“较低潜在有害回答风险”这一项上表现出统计显著优势。自动化评估器与医生判断的相关性也很弱,这说明高基准分数并不一定意味着临床上真的更好。

DeepMind 的 Co-Scientist 进化为闭环实验系统

资讯正文

Google DeepMind 的 AI Co-Scientist 现在可以规划实验、操作实验室设备,并撰写科学论文

Google DeepMind 已将其多智能体系统 Co-Scientist 从一个假设生成器扩展为一个与实验室集成的研究伙伴。根据 Google 的说法,该系统已经在三个学科中交付了经过实验验证的结果。

Co-Scientist 构建于当前的 Gemini 模型之上,如今不再只是生成假设,而是能够规划实验、编写代码并控制实验室设备。技术上的新变化在于闭环研究工作流:系统先从研究问题出发推导假设,创建实验计划,生成程序或机器可读的实验室协议,分析结果,并产出科学论文稿件。

验证模块会将文本中的数值性声明与生成代码的执行日志交叉核对,以减少伪造结果。Google 最早在 2025 年 2 月推出 Co-Scientist,当时它基于 Gemini 2.0,但在事实核查和文献综述方面存在不足。

升级后的系统在三个学科中经过验证,并且自主性不断提高。在材料科学中,Co-Scientist 为人类设计了合成配方以供执行;在生物学中,它在专家反馈下构建了一个预测管线;在计算机科学中,它则完全独立运行。

Co-Scientist 进行合成、预测与设计

在材料合成方面,研究人员将 Co-Scientist 与一台半自动化高温炉配合使用。系统为一种备受追捧的二维材料找到了一条更安全的制备路径,而该材料此前主要通过有危险性的蚀刻工艺制得,同时还生成了与实验室设备相匹配的完整生长配方。经过 25 轮人类优化后,团队制备出了性质与目标材料相似的层状结构,但其原子结构是否最终得到确认仍有待证明。

在第二项实验中,三种半导体薄膜在第一次尝试时就被合成成功。Co-Scientist 使用 Gemini 3 Deep Think 直接控制设备,将配方开发时间从数天缩短到数分钟。人类仍然需要手动装载样品和前驱体材料,而快速模式产出的晶体比经过精细优化的配方所能得到的晶体更小、均匀性也更差。该研究的首席作者 Samuel Schmidgall 写道,这些配方是否能迁移到其他实验室仍然是个悬而未决的问题。

在生物学领域,Co-Scientist 自主构建了一个图像分析管线,用于预测在不同化学浓度下,经基因工程改造的大肠杆菌菌落会形成哪些图案。使用 Gemini 3 Pro Image 生成的预测与未发表的实验室结果在四种形状特征中的三种上相符。研究人员承认,该系统只能在已知条件之间进行推理,无法预测全新系统中的行为。那样的话,就要惊人得多。

在一项计算机科学实验中,除了最初的设置之外,没有任何人类参与。Co-Scientist 设计了 “Agent_H”,这是一种医疗 AI 架构,它会对传入查询进行分类,并行生成数十个响应候选,然后对其进行优化。经过对过长回复的校正后,Agent_H 在健康基准测试上的表现超过了包括 GPT-5 和 Claude Opus 5 在内的六个前沿模型。

但这些基准测试结果并没有经受住人工评估的检验。三位经过委员会认证的医生对九个类别中的回答进行了评分,而 Agent_H 仅在其中一个类别上——降低潜在有害回答的风险——相较于基准模型 Gemini 3.1 Pro 表现出统计学显著优势。

自动化的基准评估器与医生判断之间的相关性也很弱。研究人员表示,高分并不意味着一个系统在临床角度上真的能给出更好的答案,这也引发了一个问题:这些基准测试究竟在衡量什么。

可靠性模块将幻觉率降至 4%

基于 LLM 的自主研究系统的一个核心问题是 AI 胡扯。当 AI 代理因良好结果而受到奖励时,它就会有捏造内容的动机。此前的分析已记录到现有系统中的捏造率高达 80% 到 100%。Co-Scientist 通过两种方式来应对这一问题。该系统会因伪造或抄袭内容而受到惩罚,同时一个独立的验证模块会将每一项数值主张与已执行代码的实际结果逐一交叉核对。

在一项涉及 30 位领域专家和 450 次独立审查的双盲研究中,研究人员评估了 150 篇由系统自主生成的论文。启用可靠性模块后,Co-Scientist 在 4% 的案例中捏造了关键结果;未启用时,这一比例上升到 46%。对比系统则达到了 90%。

Co-Scientist 的输出中从未出现完全捏造的数据,但对比系统的论文中有 44% 出现了这类数据。近乎抄袭的内容从 60% 降至 16%。一个集成式安全架构拒绝了 98.7% 可能有害的研究方向。

尽管取得了这些进展,研究人员仍然观察到残留错误。该系统倾向于选择性报告,而且据 Schmidgall 说,它会在论文中写出“非常可信的方法”,但这些方法与其实际代码并不一致。

实验室助手与自主研究员之间的差距仍然很大

研究人员认为,这些结果是朝着闭环多智能体 AI 系统迈出的进展,这类系统可以通过实验反馈不断改进,并有望加速科学研究。Schmidgall 写道:“在 AI 系统能够驾驭科学的物理现实之前,还有很长的路要走。但我们对 LLM 帮助人类、加速现实世界进步的潜力充满期待。”

自动化研究目前是最受炒作的 AI 应用之一。OpenAI 计划在今年秋天推出一个 AI 代理系统,至少可以执行相当于实习生水平的研究工作。但外界仍在争论,当前基于 LLM 的系统究竟能否真正发现新知识,还是只是在把训练数据中早已埋藏的内容显式化。

来源与参考

  1. 原始链接
  2. Google Deepmind's AI Co-Scientist now plans experiments, runs lab equipment, and writes scientific papers

收录于 2026-08-29