初创公司寻找超越Transformer的LLM
MIT Technology Review AI··作者 Will Douglas Heaven
关键信息
文章解释说,密集注意力会把每个token与其他所有token进行比较,因此输入越长,计算开销增长越快;文中以一篇1万词的文档为例,可能需要约5000万次乘法运算。文章还指出,推理模型和更大的上下文窗口会进一步加重Transformer的负担,因为它们需要同时处理更多信息。
资讯摘要
《麻省理工科技评论》认为,AI领域接下来最重要的问题之一,是Transformer之后会是什么。Transformer架构最早来自谷歌2017年的论文《Attention Is All You Need》,因为它非常擅长处理长序列,尤其是文本,所以很快成为现代大语言模型的基础。九年过去了,文章指出,几乎所有主流LLM都建立在Transformer之上,一位受访的初创公司创始人甚至称它为计算机科学史上最重要的创新之一。可是,正是这一套曾经极其强大的机制,如今也开始变成限制。Transformer的密集注意力机制需要把每个token与其他每个token进行比较,随着序列变长,计算开销会急剧上升。
文章提到,这也是LLM耗电巨大的重要原因,并引用OpenAI今年预计在算力上支出500亿美元,以及国际能源署关于数据中心用电量到2030年将翻倍的预测。Transformer在处理超大上下文窗口时也不够理想,但新的应用反而要求模型同时接收更多信息,比如整套文档库、完整代码库,或者智能体系统中来自其他LLM的输出。推理模型还会通过类似“草稿纸”的chain of thought来进行思考,这又增加了模型需要跟踪的信息量。文章因此把Transformer视为越来越明显的瓶颈,并指出一批初创公司正在尝试用稀疏注意力等新方法来减少需要计算的token配对,从而寻找下一代LLM架构。

资讯正文
MIT Technology Review 的 What’s Next 系列横跨各行各业、趋势与技术,为你带来未来的第一手预览。你可以在这里阅读其余内容。
早在 2017 年夏天,Google 的 AI 研究人员发表了一篇名为《Attention Is All You Need》的论文,在其中提出了一种名为 transformer 的新型神经网络。事实证明,它在处理长序列数据,尤其是文本方面表现非常出色。
九年过去了,transformer 已成为市场上每一款主流大语言模型的核心引擎。AI 初创公司 Subquadratic 的联合创始人兼首席执行官 Justin Dangel 说:“整个 AI 行业都是建立在 transformer 之上的。它们是计算机科学史上最重要的创新之一,而且已经改变了世界。”
但 transformer 正开始显露出老态。近年来 LLM 的许多进展,例如所谓推理模型的发展,以及它们一次性处理大量输入的能力,并不是对这项核心技术的精巧延伸,而是用来修补其某些根本缺陷的变通办法。
如今,越来越多的科学家和工程师开始追问下一步会是什么。LLM 不会消失,但它们的构建方式正悬而未决。(MIT Technology Review 在今年“AI 领域最重要的 10 件事”榜单中,将这一未来一代模型称为 LLMs+。)
于是,一波希望推动这种繁荣技术边界的初创公司出现了。毫无疑问,其中一些会失败——但它们几乎没有什么可失去,却有一切可争取,而相比之下,今天处于领先位置的公司反而背负着更多。
数量的力量
但首先,问题在哪里。transformer 的关键优势在于一种名为稠密注意力(dense attention)的机制,它通过一系列数字来编码一段文本的含义。这个过程涉及通过一种乘法形式,将文本中的每一个词(或者词的一部分,即 token)与其他每一个词进行比较。
稠密注意力能够以惊人的准确度捕捉文本含义。但随着文本长度增加,处理它所需的计算量会迅速累积。一篇 1 万词的文档可能需要 transformer 执行 5000 万次乘法运算。这正是 LLM 如此耗电的主要原因。
成本高得惊人。OpenAI 总裁 Greg Brockman 说,公司今年将在算力上花费 500 亿美元。而国际能源署预测,到 2030 年,数据中心的总耗电量将翻倍。
此外,transformer 还难以胜任许多最新模型试图完成的工作。由于它们按词逐个处理文本,transformer 并不擅长同时跟踪大量信息(换句话说,它们所谓的上下文窗口不能太大)。但如果 LLM 要执行更困难的任务,就需要摄入更多数据:整座文档库、完整代码库,或者在智能体的情况下,来自其他 LLM 的输出。
至于推理模型,它们的工作方式是给自己写笔记(某种称为“思维链”的草稿板),然后再把这些笔记读回来,这同样会增加需要处理的数据量。
随着 LLM 变得越来越大、越来越强,Transformer 已经成了瓶颈。这项技术原本的关键优势,如今反而变成了限制。
下面是四种关于如何解决 Transformer 问题的新思路——这些创新有望永久改变 LLM,让它们更快、效率高得多,而且也许还会更聪明。
01:重新思考注意力机制
让 LLM 更快、更便宜的一个显而易见的方法,是正面解决问题,改变注意力机制的工作方式。用一种名为稀疏注意力(sparse attention)的机制替代密集注意力(dense attention)——它只对文本块中的部分词语配对进行计算,而不是对全部配对都计算——可以大幅减少 LLM 需要执行的计算量。
多年来,研究人员提出了许多稀疏注意力机制。问题在于,没有一种能像密集注意力那样出色地捕捉语义。
这种情况可能已经改变。位于迈阿密的初创公司 Subquadratic 声称,它发明了首个稀疏注意力机制,在搜索和编码等少数任务上可与主流顶级 LLM 匹敌。这是一个非常大胆的说法(而且业内一些人仍持怀疑态度)。
Subquadratic 表示,它的模型 SubQ 通过在接收到每一段文本时即时判断哪些词重要、哪些词不重要来工作。该公司还称,已有数千人加入其等候名单,并计划很快让该模型广泛可用。
与此同时,位于旧金山的初创公司 Manifest AI 则从不同角度切入这一问题。它不是改变注意力机制的工作方式,而是用别的东西取而代之。
该公司开发出一种称为 power retention 的机制,它只保留与特定任务最相关的信息,并确保 LLM 需要跟踪的数据量不会失控增长。
注意力机制要求 LLM 记住上下文窗口中的所有内容。稀疏注意力模型(如 SubQ)会丢弃大量单个词语,但仍会保留对所见内容的大致印象。相比之下,power retention 的工作方式是为模型提供上下文窗口的滚动摘要。随着新信息不断加入,相关性较低的信息会被丢弃。
retention 的基本原理已经存在了十年。Manifest AI 声称,它更新了这些技术,首次构建出能够与基于 Transformer 的 LLM 抗衡的模型。
该公司表示,只需极少量重新训练,就可以把一个 Transformer 模型改造成 power retention 模型。为证明这一点,它将一个现有的开源编码 LLM——StarCoder——转化为使用 power retention 的版本,命名为 PowerCoder。它还发布了一个名为 Brumby 的模型,并声称它可与阿里巴巴广受欢迎的开源模型 Qwen 的某些版本相媲美。
Manifest AI 希望其 power retention 技术成为 LLM 需要执行涉及处理海量数据的任务时的首选方案。该公司联合创始人兼 CTO Carles Gelada 去年在一段宣布公司这项技术的视频中声称,它有许多有用的应用场景——从分析长达数小时的视频,到构建能够连续数周保持任务执行的智能体。
02:让模型更小、更灵活
总部位于马萨诸塞州剑桥的 MIT 分拆公司 Liquid AI 并没有完全替换或抛弃 transformer,而是将其与自家技术 liquid neural networks 结合起来,构建出联合创始人兼 CEO Ramin Hasani 所称的 LFM(liquid foundation models,液态基础模型)。
Liquid AI 的模型比大多数 LLM 要小得多,也更省能耗。该公司为包括 Mercedes 在内的汽车制造商开发模型,这些模型运行在车辆内部的小型芯片上。其最新模型甚至可以运行在 Raspberry Pi 上,这是一款面向爱好者的低功耗电脑,售价 50 美元。
Hasani 说,这些模型可供任何年营收低于 1000 万美元的组织免费使用。而且它们已经证明非常受欢迎:他说,公司目前的下载量已接近 3400 万次。
液态神经网络的灵感来自蠕虫的大脑。它们是另一类早于 transformer 出现的神经网络——卷积神经网络——的延伸。其关键创新在于一种机制,能够让模型根据新信息调整自身行为,因此可以边做边学。而 transformer 做不到这一点:一旦模型训练完成,其行为就固定了。
Liquid AI 的最初模型相当基础,但可以飞无人机或驾驶车辆。借助 LFM,该公司正试图扩大技术规模,以与主流 LLM 竞争。其新模型的性能可与体量大四倍的竞品持平,包括阿里巴巴的 Qwen 和 Google 的开源 LLM Gemma 的各个版本。
典型的 LLM 是由一层层互相连接的 transformer 叠加而成。Liquid AI 近期推出的 LFM 则是混合模型,由 20% 的 transformer 和 80% 的液态神经网络构成。
这个比例是由 Liquid AI 自己构建的另一套 AI 系统得出的,这套系统被用于帮助设计公司所有模型。Hasani 说:“这就是我们公司现在的核心技术。”这套设计 AI 会筛选大量不同的神经网络组合——包括液态网络、卷积网络等等,以及 transformer——并提出把不同结构拼接起来的设计方案,以找到性能与效率的最佳平衡点。
Hasani 认为 transformer 只是开始:“你知道,你的大脑就是一个 AGI 系统,而且它只消耗 20 瓦电。怎么可能做到?我们还能有更多创新。”
03:一次性生成文本
几乎所有 LLM 都是一次输出一个词。这样做有道理,因为人说话和写作就是这样。但对于计算机来说,这种方式效率非常低。
对于 LLM 来说,一次性生成整段文本——一口气吐出完整句子甚至整段落——更快也更便宜。位于加利福尼亚州帕洛阿尔托的初创公司 Inception 采用的正是这种方法,该公司正在使用一种名为 diffusion 的技术来构建 LLM。
扩散模型更广为人知的用途,是驱动大多数图像和视频生成模型。这类模型的训练方式,是接收一张随机像素网格——就像老式电视机的雪花屏——并把它变成一张图像。它们通过同时处理所有像素来完成这件事,找出哪些像素需要改变,才能让这些静态噪点更像一张高清照片。
事实证明,这个过程同样也适用于文本。Inception 已经训练出自己的 LLM,让它接收一串随机词语,并把它变成通顺的句子。扩散式 LLM 仍然使用 transformer 来编码含义,但由于它们一次生成整块文本,能让 transformer 以更少的代价做更多事情。Inception 联合创始人兼首席执行官 Stefano Ermon 说:“你仍然是在用一个大型 transformer 模型,但你可以同时预测许多 token。也正因为如此,与今天大多数其他公司在构建的模型相比,这些模型要快得多,也更具成本效益。”
挑战在于,如何把一种为图像生成设计的技术应用到文本上。Ermon 说,对图像而言,如果你需要把一个蓝色像素改成红色像素,你可以经过中间色逐步过渡。但这对文本不适用:“当你面对的是‘cat’和‘dog’时,中间并没有真正可供过渡的东西。”
Ermon 还是斯坦福大学的研究人员。2024 年,他和两位斯坦福同事找出了让扩散模型适用于文本的数学方法。他们训练出一个扩散模型,其性能与 GPT-2 相当——GPT-2 是 OpenAI 在 2019 年推出的 LLM——但速度快了 10 倍。这已经足以让 Ermon 将其拆分出来创办公司。
如今,他把目光投向了更大的舞台。Inception 声称其最新模型 Mercury 2 的表现可与 OpenAI 2023 年发布的一些 GPT-4 模型相媲美,而且速度同样快 10 倍。Ermon 说:“我们非常看好这种方法,因为它是能够扩大规模的路径。”
他补充说,真正重要的只有速度和成本:“归根结底,货币将会是每美元对应的智能水平。”
押注扩散路线的并不只有 Inception。Google 也在尝试这种方法,并打造了一个名为 Diffusion Gemma 的原型 LLM。不过 Ermon 并不担心竞争。“我认为这反而是在验证它,”他说,“这就是未来。”
04:超越词语
另一家总部位于帕洛阿尔托的初创公司 Pathway,或许是这批新玩家中最激进的一个。它希望把 LLM 从语言的束缚中解放出来。
这家公司构建了一种名为 Dragon Hatchling 的 LLM(名字取自 Terry Pratchett 的小说《魔法的颜色》中的龙:如果你足够用力地去想象它们,它们就会实体化)。到目前为止,它最亮眼的成绩,是在一项基准测试中取得了高分;这项测试让 LLM 去对抗超过 250,000 道极难的数独题。Dragon Hatchling 解决了其中 97% 以上的题目;而几家顶级实验室的多款领先 LLM 则连一道都没解出来。
Pathway 想要表达的观点是,尽管 LLM 在许多不同任务上都取得了显著成功,但仍然存在一些关键类别的问题是它们无法解决的。数独只是其中一个例子。Pathway 联合创始人兼首席执行官 Zuzanna Stamirowska 表示,如果我们希望 LLM 能够针对现实问题提出真正新颖的解决方案,就需要超越 transformer。
这是因为 transformer 迫使 LLM 用文本来处理一切。但语言并不是某些推理任务的最佳工具。Stamirowska 说:“用一个个词来表示一个数独棋盘是非常困难的。”
Pathway 的解决方案是改变 transformer 背后的数学机制,用一种名为 state space 的数学结构取代 attention 机制。state space 不再按词逐个编码信息,而是把信息压缩成一种更抽象的表示。采用这种技术后,Dragon Hatchling 仍然可以处理和生成文本,但它也能模拟那些不涉及词序列的推理形式。这不仅让 Pathway 的模型更高效,而且(理论上)还能使其承担其他 LLM 无法完成的任务。
Stamirowska 说,可以把它想成国际象棋或数学——这类谜题不会以一长串句子的形式存在于你的脑海中:“你大脑里冒出的那个顿悟时刻,不一定是以语言形式出现的。我们会认为,如果你必须用语言来推理,你就会在某种程度上受到限制。”
Stamirowska 承认,主流 LLM 可以读一本关于如何解数独的书,然后写出代码来完成这项任务。但她说,我们想要打造的不只是“会读书”的模型:“人工智能的希望不是去解数独,而是去治愈癌症。那没有一本现成的书可供参考。”
她补充说:“transformer 是我们偶然找到的一种工程上的便利。它开启了一种信仰,但认为不会再次出现突破,那就太可笑了。”
深入报道
一家初创公司声称,它突破了限制 LLM 发展的瓶颈
Subquadratic 现在已分享了更多关于其新模型的细节。不过,仍有人持怀疑态度。
一个根本性缺陷让 LLM 对攻击极其脆弱
这使得诱骗它们做出不该做的事情变得很容易,例如告诉你如何破坏飞机的导航系统。
来源与参考
收录于 2026-08-11