LLM擅长算题,不擅长原创思维
The Decoder··作者 Matthias Bastian
关键信息
Gowers 认为,LLM 能够探索很多搜索路径并组合已有方法,但缺少判断在巨大搜索空间中哪些路径最有希望的直觉。Sarnak 补充说,AI 可以从现有理论推出结果,但在从简单问题出发时,往往不能像人类数学家那样形成支撑重大证明的抽象概念。
资讯摘要
这篇文章报道了一种在著名数学家中越来越常见的看法:大型语言模型对数学很有帮助,但还算不上真正有创造力的数学思考者。Timothy Gowers 认为,LLM 擅长组合已知方法,也能尝试很多候选路径,但缺少人类那种把巨大的搜索空间缩小到少数高产路线的直觉。Peter Sarnak 也持类似观点,他指出 AI 可以从已有理论中推导结果,但当面对一个朴素的起点时,仍然难以发展出支撑重大证明所需的抽象概念。DeepMind 研究员 Tom Zahavy 在论文《LLMs Can't Jump》中也得出了相近结论。
Zahavy 把瓶颈称为“操控性溯因”(manipulative abduction),也就是在没有现成语言模板可循的情况下发明新的基础假设。文章认为,这种能力才是科学发明中真正困难的部分,而不只是操纵符号或回忆先例。文中还提到,world models 可能为未来提供一条路径。总体而言,这场讨论反映了一个持续争论:LLM 到底是在变得更接近通用思维,还是主要在基准测试和熟悉题型上变得更强。

资讯正文
顶尖数学家表示,LLM 是出色的计算器,但并不擅长创造性思考
LLM 无法跳跃,第二部分。数学家 Timothy Gowers 和 Peter Sarnak 认为,大语言模型具备相当强的数学能力,但对于真正的新想法则有着明确的局限。Gowers 认为,当前模型擅长把已知方法组合起来,并尝试许多搜索路径,但缺乏直觉,无法在巨大的搜索空间中挑出少数真正有成效的路线。Sarnak 也持相同看法:AI 可以从现有理论中推导出结果,但当从一个基础性问题出发时,却无法发展出支撑重大证明所需的抽象概念。
DeepMind 研究员 Tom Zahavy 也得出了类似结论。在他的论文《LLMs Can't Jump》中,他将瓶颈归结为“manipulative abduction”——也就是在没有语言先例的情况下,发明新的基础性假设的能力。世界模型可能提供一种前进方向。这些判断也推动了更广泛的争论:LLM 到底是在变得更加多面,还是“只是”在基准测试和熟悉的问题空间里表现越来越好。
来源与参考
收录于 2026-08-17