AI 编程代理现代化科研软件

The Decoder··作者 Jonathan Kemper

关键信息

报告给出多项显著加速案例,例如 RustQC 将运行时间从 15 小时 34 分钟缩短到 14 分钟 54 秒,HelixForge 在一项测试中比 BamSurgeon 快 59.6 倍。与此同时,作者强调代理可能“自信地出错”,因此仍需要独立测试框架和人工验证。

资讯摘要

一份由 OpenAI 及学术伙伴共同完成的实地报告认为,AI 编程代理可以帮助现代化那些随着时间推移而变得脆弱的科研软件。报告聚焦 8 个案例,主要来自生物学领域,使用的代理包括 Codex 和 Claude Code,任务范围从维护、优化到更大规模的重写都有。许多工具最初只是为某篇论文编写的辅助脚本,但后来却变成了整个研究领域都依赖的重要软件,却一直缺乏正式的长期工程支持。一个较简单的例子是 GPT-5.5 为 cyvcf2 更新了过时的构建和安装流程,使其采用现代方式。更大的迁移案例是 MHCflurry,Claude Code 和 Codex 协作把大约 1 万行代码从 TensorFlow 迁移到了 PyTorch。另一个项目 rustar-aligner 则用 Rust 从零重写了 STAR,并在对 1 万条酵母短测序读段的测试中,与原工具在单端读段上达到 99.815% 的一致率,在双端读段上达到 99.883% 的一致率。这个比较还检查了两种程序输出中的多个其他字段,而且双方都没有出现“对方能映射而自己不能映射”的读段。

RustQC 展示了代理在整合工具链上的价值,它把 15 个质量控制工具合并成一个程序,使运行时间从超过 15 小时降到不到 15 分钟。HelixForge 也类似,它用基于 GPU 的版本替换了一个基因组数据模拟工具,在完整流程上快了 59.6 倍,在主要计算步骤上快了 98.6 倍。不过,报告的核心警告是:代码跑得快,并不等于科学结论正确。代理经常给出看起来很合理、但实际上有错误的答案,因此研究人员仍必须依赖专家判断、独立测试和人工审查来发现细微 bug。比如在 bayesm 案例中,重写版本虽然快了很多,但早期版本在两个高级方法里出现了难以从输出中直接发现的错误。总体而言,这份报告的结论是:AI 编程代理已经能显著提升科研软件工程效率,但它们还不能独立判断科学是否正确。

AI 编程代理现代化科研软件

资讯正文

AI 编码代理可以现代化研究软件,但无法判断科学是否正确

OpenAI 及其学术合作伙伴的一份现场报告显示,编码代理可以更新并加速老化的研究软件。不过,在很多情况下,工作的重心会从编写代码转移到验证结果上。

许多被广泛使用的研究工具最初只是为某篇论文提供支持的配套代码。小型学术团队往往在没有足够时间或资源进行适当测试、维护或优化的情况下编写它们。结果就是,软件虽然脆弱,却对整个学科至关重要,而且需要持续修补。OpenAI 及其学术合作伙伴的一份现场报告表明,AI 编码代理或许可以帮助填补这一缺口。

这份报告记录了八个案例研究,主要集中在生物学领域,研究团队使用了 Codex 和 Claude Code 等编码代理。这些项目涵盖了从基础维护和定向优化,到用现代编程语言进行全面重写等不同工作。

编码代理带来了超过 60 倍的提速

其中一个较为简单的项目是现代化 cyvcf2,这是一个用于读取遗传数据的 Python 库。GPT-5.5 将其过时的构建和安装流程替换为现代化方案。

MHCflurry 的迁移则复杂得多。MHCflurry 是一种免疫学模型,用于预测免疫细胞会识别哪些靶标。Claude Code 和 Codex 在开发者与审阅者的角色之间轮换,将大约 10,000 行代码从 TensorFlow 迁移到了 PyTorch。

rustar-aligner 项目则更具雄心。它用 Rust 从头重建了 STAR。STAR 会将来自细胞的测序读段比对到基因组中的相应位置。原始版本包含超过 20,000 行 C 和 C++ 代码,虽然它仍然是许多研究流程的一部分,但已不再有人持续维护。

为了检查重写后的程序是否与原版表现一致,团队使用来自酵母细胞的 10,000 条短测序读段测试了这两个工具。对于单端读段,rustar-aligner 在 99.815% 的情况下得出了与 STAR 相同的结果。对于双端读段,一致率为 99.883%。

这次比较覆盖的不只是基因组中的比对位置,还包括两个程序为每条读段生成的其他几个关键字段。没有任何一个工具把对方未能比对的读段比对上。

RustQC 通过将 15 个独立的质量控制工具整合进一个程序,实现了最大的提速。在一个大型数据集上,运行时间从 15 小时 34 分钟降至 14 分钟 54 秒,速度提升超过 60 倍。

另一个项目 HelixForge 用可在 GPU 上运行的版本替换了一个用于生成合成基因组数据的工具。在一项使用来自一名供体以及基因组中一段一千万碱基对区域的数据的测试中,HelixForge 完成完整流程的速度比 BamSurgeon 快 59.6 倍。仅主计算步骤就快了 98.6 倍。

快速代码仍然可能产生错误的科学结果

在这些案例研究中,代理能够迅速完成定义明确的任务,但却无法可靠判断其工作在科学上是否正确。即便代码中存在错误,这些系统也常常满怀信心地将其呈现出来。

“有了编码代理,想要快速推进并不难;但就目前而言,要在科学上走得更远,仍然需要专家的指导、理解、品味和细致关照,”cyvcf2 开发者 Brent Pedersen 写道。

领导 RustQC 的 Philip Ewels 将代理描述为“口才出众、说服力强,而且自信地出错,且这种错误很容易被忽视。”他从不让模型自行判断自己工作的准确性,而是构建了一个独立的测试框架。

bayesm 这个案例研究表明,这类错误有多难被发现。它的 Rust 重写版本运行速度比原版快了 2 到 20 倍,但两个高级方法的最初版本都包含一些仅凭输出很难看出的错误。

在其中一种方法里,代理把一个关键控制参数取反,导致程序使用的是目标值的倒数。另一个 bug 影响了计算本身。研究人员是在针对数千个已知结果的合成数据集进行详细校准测试后才发现这一点的。

另一种名为 HART 的方法整体上给出了看似合理的结果,但仍包含若干缺陷。其中包括不必要的高成本计算,以及一个缩放错误的校正因子。仅靠看起来合理的测试结果,并不能证明代码就是正确的。

更早一次将 MHCflurry 迁移到 PyTorch 的尝试在 2025 年初失败了。开发者 Sergey Feldman 现在把这次失败归因于当时可用的模型,而不是编码工具本身。在他看来,只有更新一代的模型才变得足够可靠,能够独立处理这项工作的大部分内容。

人类定义测试,代理编写代码

这些项目遵循了一种一致的分工。人类定义目标、成功标准和验证方法,而代理负责实现。

hifiasm 项目展示了这一点在实践中是如何运作的。Hifiasm 会把许多短片段组装成一个完整基因组。在请 GPT-5.5 对其进行优化之前,研究人员先建立了一个包含独立训练集和验证集的测试环境。随后,该模型找出了能够将真实人类基因组数据运行时间缩短将近 15% 的改动。

HI.SIM 是一个用于模拟遗传数据的库,它对人工参与的要求更少。GPT-5.2 只用一轮就找到了优化程序各个部分的方法。随后,使用更新模型再进行一轮,又找到了更多改进。综合这些修改后,在不改变输出的前提下,运行时间减少了约 31%。

低成本重写会带来维护问题

作者还粗略估算了潜在节省。如果代理能够解决影响研究软件安装问题的四分之一到一半,那么 100 个软件包节省下来的研究时间价值将介于 60 万美元到近 500 万美元之间。仅对 NumPy 而言,报告估计代理每年可节省大约 650 小时的维护工作。

与验证和科学准确性一样,长期维护仍然是一个重大的未解问题。低成本重写可能会使用户社区碎片化,并把经验丰富的维护者已经有限的时间进一步摊薄。

这些团队在所有权和维护方式上采取了不同的做法。有些改动直接并入了原始项目。由于 STAR 已不再维护,rustar-aligner 转入了 scverse 研究联盟。FastQC 的作者拒绝用其 Rust 重写版本取代原始工具。于是,该团队把自己发现的改进加入了原始的 Java 版本,并实现了同样的三倍提速。

这份实地报告回顾的是已经完成的项目,并依赖参与者本人的叙述。作者强调,这些发现并非来自一项具有代表性的研究。尽管如此,他们仍认为,主要瓶颈正在从编码本身转向验证、科学审查,以及对维护和未来开发的清晰责任划分。

在研究之外的软件开发中,也出现了同样的模式。METR 的一项研究发现,实际项目维护者会拒绝大约一半被广泛使用的 SWE-bench Verified 基准认定为通过的解决方案。

一项关于开发者对 AI 生成代码感到沮丧的研究发现了类似的权衡。代码生成阶段节省下来的时间,可能会转而耗在审查上。curl 项目在 AI 生成的漏洞报告不断消耗维护者时间、却没有产出有用结果后,关闭了其漏洞赏金计划。

这份实地报告是 OpenAI 更广泛进军科学领域的一部分。该公司已组建了一支专门的科学团队,由 Kevin Weil 领导;他预计,2026 年之于科学,将如 2025 年之于软件工程。4 月,OpenAI 推出了 GPT-Rosalind,这是一款面向生命科学研究的模型,并发布了一个可免费使用的生命科学插件供 Codex 使用,该插件可将模型连接到 50 多个公共数据库和生物工具。

来源与参考

  1. 原始链接
  2. AI coding agents can modernize research software but can't judge if the science is right

收录于 2026-08-02