AI或许让科研更多而非更好

The Decoder··作者 Jonathan Kemper

关键信息

作者借用最优觅食理论来建模研究者如何在不同项目之间分配精力,把科研过程分成一个必需阶段和一个可选择的深度投入阶段。他们认为,只有当 AI 加速的是那个长期受时间限制的可选深度阶段时,质量才会提升;在另外两种情形下,研究的彻底性会下降,甚至会让较弱的项目更值得推进。

资讯摘要

这篇报道讨论了一项理论经济学研究,质疑即使 AI 工具完全可靠,科学研究是否也会因此变得更好。作者认为,语言模型节省时间后,研究者未必会把省下来的时间继续投入到同一个项目中,反而可能转向更多新项目。用经济学的话说,单个项目上多花时间的机会成本会上升,因为这些时间也可以用来开启新的工作。为了只看“省时”这一效应,模型刻意假设 LLMs 几乎没有成本,而且不会引入错误。

研究者借用了行为生态学中的最优觅食理论,用来描述生物如何在多个机会之间分配努力,并将其改造成科研场景。模型中的科研项目分为前期判断想法是否可行,以及后续继续或放弃的决策;若继续推进,还包括必须完成的部分和可自由选择的深度工作,比如额外实验、更深入的数据分析或润色文字。论文指出,只有当 AI 加速的正是这种经常因时间紧张而被压缩的可选深度阶段时,研究质量才会提高;在另外两种情形下,AI 会让更多论文进入流通,但每篇都更浅。报道最后还提到,OpenAI 的一份实地报告显示,AI 在重写研究软件方面可带来最高 60 倍的加速,但瓶颈只是从编码转移到了验证和长期维护,这说明省时并不自动等于更好的科学。

AI或许让科研更多而非更好

资讯正文

人工智能可能让科学家做更多但质量更差的工作,而不是少做但做得更好,研究指出

即使语言模型完美无缺,它们也可能让研究变得更糟,而不是更好。一项新的理论研究指出,由于人工智能节省了时间,研究人员会把更多精力花在每个项目上的情况变少,而不是变多。

语言模型被认为能够在科学的各个阶段加速进程,从提出假设到分析数据再到撰写论文。显而易见的希望是,如果人工智能承担了那些繁琐的常规任务,研究人员就会有更多时间真正去思考。

来自普林斯顿大学、华盛顿大学以及其他机构的研究人员撰写的一篇理论经济学论文,对这一假设提出了质疑。当人工智能从科学家手中接走一部分工作时,这位科学家的时间就变得更有价值。花在现有项目上的每一小时,都是不能用于开启新项目的一小时。经济学家把这称为“机会成本”,而这篇论文的模型正是建立在这一理念之上。

在分析中,作者刻意将 LLM 理想化。他们把它们视为能够削减时间成本、不会引入错误且金钱成本几乎可以忽略不计的工具,这种设定旨在将时间节省的纯粹效应与这项技术众所周知的弱点区分开来。

科学投入的觅食模型

研究人员建立了一个数学模型,其基础是行为生态学中的最优觅食理论,这一框架用于描述生物体如何在相互竞争的机会之间分配精力。将其应用于科学后,该模型模拟了研究人员如何在不同项目之间分配劳动,以及当 LLM 缩短项目生命周期不同阶段所需时间时会发生什么。

在模型中,一个研究项目分为两个阶段。研究人员首先检查一个想法是否具有可行性,然后决定是放弃它还是继续推进。继续推进又分为一部分是必须完成的工作,比如制作图表、排版文字和投稿;另一部分是自愿投入的工作,比如做额外实验、进行更深入的分析,或润色行文。作者认为,当时间变得紧张时,正是这部分自愿投入最容易被牺牲。

三种情形中有两种会导致研究质量下降

论文根据人工智能在研究过程中应用于哪里,列出了三种情形。在第一种情形中,人工智能帮助评估早期想法。由于重新开始的成本更低,研究人员会变得更加挑剔,因此只有最有前景的项目会继续推进。但即便如此,这些项目得到的处理也会更不充分,因为节省下来的时间更适合去启动一个新项目。作者称,这种模式在技术领域很典型。

在第二种情形中,人工智能通过加快写作、排版和分析来帮助发表。由于把论文送出去所需的努力更少,原本较弱的项目也变得值得去做。进入流通的论文更多了,但每篇论文最终都更浅显。这种模式在以实地工作为基础的学科中很典型。

只有在第三种情形中,人工智能才真正提升质量。在这里,它加快的是自愿性的深度研究阶段,例如额外实验或更细致的分析。由于人工智能针对的是研究人员一直以来因时间压力而不得不偷工减料的那个确切阶段,节省下来的时间就会转化为更周密的工作。

那么,在三分之二的情况下,彻底性会下降。当时间变得更有价值时,把一篇已经可以发表的论文继续打磨得更完美,就不再划算。那段时间更适合投入到下一个项目上。

节省时间的谬误

“作为一种劳动增强型技术,LLM 会提高我们时间的机会成本,推动我们做更多事情,但做得更差——而不是做同样多的事情,但做得更好,”作者写道。那种认为节省下来的时间会自动转化为更深入分析的想法,并不成立。

该模型在理论上描述的情况,实际上已经开始在实践中显现。OpenAI 对八个科学案例研究的一份实地报告发现,在重写研究软件时,速度最高可提升 60 倍,但瓶颈只是从编码转移到了验证和长期维护上。感知到的时间节省甚至不必是真实的,也会改变行为。METR 的一项研究发现,使用 AI 工具的资深开源开发者完成任务实际上多花了 19% 的时间,尽管他们感觉自己快了 24%。

这种摩擦在论文发表体系中也很明显。在 LLM 加快写作的领域,投稿量已经迅速攀升,并给本就超负荷的同行评审系统带来压力。Sakana AI 的“AI Scientist-v2”把一篇完全由 AI 生成的论文送进了一个 ICLR workshop,连引用错误都原封不动保留了下来。Arxiv 随后作出更严厉的处罚,威胁称如果文本中出现捏造来源或 AI 元评论,将禁止投稿一年。

论文认为,制度层面的应对措施必须因学科而异,因为 AI 对研究的影响并不是一种统一的加速。它取决于流程的哪个阶段被提速。一项关于软件开发的最新研究将这种动态描述为一种公地悲剧:个体生产力的提升,是以后来必须审查和维护这些产出的人为代价的。

来源与参考

  1. 原始链接
  2. AI could make scientists do more work less well, not less work better, study argues

收录于 2026-08-24