BootLoops 用人工智能模型进行精确科学计算
The Decoder··作者 Matthias Bastian
关键信息
Claude 通过 BootLoops 计算了30个与散射振幅和椭圆积分有关的问题,其中15个复现了已知结果,另有15个被描述为首次计算;另一项研究分析了来自1000 Genomes Project的57亿个突变对。Schwartz 警告说,模型可能过早宣布任务完成,或从正确计算中得出错误结论,因此人工监督不可或缺。
资讯摘要
哈佛大学物理学家、Anthropic 访问研究员 Matthew Schwartz 表示,研究人员不应期待语言模型像人类科学家一样工作,而应寻找适合模型能力的“Claude 型问题”。这一思路促成了 BootLoops,这是一个开源工具框架,旨在利用数学、物理学和计算机科学工具,帮助模型完成精确的定量计算。三个月内,Schwartz 与19名合作者使用该工具完成了覆盖18个领域的36篇手稿。最初的粒子物理研究涉及散射振幅和椭圆积分,Claude 计算了30个积分,其中15个复现已知结果,另外15个被描述为首次计算。
在生态学研究中,该系统帮助大规模求解一个存在20年的中性生物多样性理论方程,对巴拿马运河巴罗科罗拉多岛数据的分析显示,树种组成变化速度是理论允许速度的4.5倍;生态学家 James O'Dwyer 随后帮助将这一发现转化为更好的预测模型。其他项目分析了57亿个突变对以寻找基因转换证据,检查了4,452份经济学复现材料,并建立了覆盖6,072种语言的词重音数据库。Schwartz 强调,这些结果通常只有在专家确定研究方向并检查推理后才具有科学价值,而模型仍经常过早得出结论或错误解释正确的计算结果。

资讯正文
开源“BootLoops”工具支持 AI 模型执行精确的科学计算
要点:哈佛大学物理学家 Matthew Schwartz 开发了“BootLoops”,这是一款利用语言模型进行科学计算、弥合不同学科之间知识鸿沟的开源工具。
在三个月内,Schwartz 与 19 位合著者在 18 个领域完成了 36 篇手稿,研究范围从粒子物理学计算到生态建模和基因组分析。
Schwartz 警告说,这些模型经常过早宣布成功,或者从正确的计算中得出错误结论,因此人的监督和验证至关重要。
自动化解决问题与开展相关研究并不是一回事。
这是哈佛大学物理学家 Matthew Schwartz 在 Anthropic 客座文章中得出的结论。他介绍说,自己不再尝试像对待人类研究人员那样使用 Claude,而是开始寻找“Claude 形状的问题”——也就是能够发挥当今 AI 模型优势的任务。Schwartz 目前也是 Anthropic 的访问研究员。
这种方法促成了 BootLoops 的诞生。这是一款用于精确科学计算的开源工具,其源代码已发布在 GitHub 上。
Schwartz 表示,借助这款工具,Claude 发现了粒子物理学、生态学、群体遗传学、经济学和语言学之间的联系。不过,这些结果往往只有在领域专家介入并确定研究方向后,才真正具有科学价值。
Schwartz 用“凸包”这一概念说明 AI 如何帮助科学研究。人类知识是碎片化的,不同领域分别向不同方向延伸,而它们之间的空白却无人探索。一个实验室可能花费 20 年,使用单一方法研究一组基因,却将相邻基因和其他研究方法置之不理。像 BootLoops 这样的 AI 工具,正是要通过在知识崎岖的前沿之间建立联系,填补这些空白。
三个月内在 18 个领域完成 36 篇手稿
在三个月的时间里,该团队与 19 位合著者合作,在 18 个领域完成了 36 篇手稿。Schwartz 最初从粒子物理学计算入手,具体研究散射振幅和椭圆积分。几周之内,Claude 就利用 BootLoops 计算出了 30 个积分,其中 15 个复现了已知结果,另外 15 个则是首次完成计算。
随后,他将搜索范围扩大到其他领域。在生态学方面,Claude 解决了一个来自中性生物多样性理论、存在 20 年之久的方程;此前,人们一直无法在大规模条件下完成这一计算。将结果应用于数据后发现,巴拿马运河中的巴罗·科罗拉多岛树种组成的变化速度,是该理论所允许速度的 4.5 倍。生态学家 James O'Dwyer 随后帮助将这一发现转化为更出色的预测模型。
在群体遗传学方面,该团队分析了“千人基因组计划”中的 57 亿对突变,并发现了支持一种名为基因转换机制的证据。其他项目还包括一款面向经济学期刊的 AI 数据编辑器,它自动检查了 4,452 个复现包(相关研究已作为 NBER 工作论文发表);以及一个涵盖 6,072 种语言的词重音数据库,该数据库由三位语言学家共同构建。
“面向工程师的 Python”如今已经过时
Schwartz 描述了 AI 改变科学的速度之快,以至于提前规划几乎变得不可能。为什么要申请一项为期三年的资助,去支持一项 AI 模型可能一夜之间就能解决的计算工作?
培养博士生也成了一个悬而未决的问题。自从他发表关于“Vibe Physics”的早期文章以来,这种感觉变得愈发强烈。在计算机科学等一些领域,这种颠覆令人担忧。两年前,他会认为“面向工程师的 Python”课程“必不可少”,但如今却认为它“没有必要”,因为 Claude 可以处理这些任务。
构建用于研究物理现象的机器学习模型,是 AI 如今也能接手的另一个领域。当 Claude 可以根据指令实现机器学习研究的最新成果时,即便深入了解神经网络,所能带来的回报也很有限。
“亲自检查一切”
Schwartz 还警告了这些模型的弱点。Claude 喜欢过早宣布胜利,像“完成了,不过有一个星号”这样的说法,往往意味着“根本没有完成”。它会误判任务需要多长时间,而且往往采用蛮力方式进行计算,而不是寻找更优雅的解决方案。自动化检查并不可靠,即使计算本身是正确的,Claude 的结论也可能出错。
除了可靠性问题之外,与真正的新问题相比,该模型更倾向于处理那些历史悠久、被大量引用的争论。Schwartz 说,这些项目还“非常消耗计算资源和 token”。
Schwartz 还认为,把注意力集中在大型数学问题和头条新闻上存在风险。不切实际的期待可能会让人们忽视那些如今已经能够发挥作用的生产性应用。Schwartz 表示,真正的进步仍将建立在坚实基础之上,只是速度会更快。科学方法本身并未受到威胁,而人类的引导和品味仍然不可或缺。
来源与参考
收录于 2026-10-04