PrismML hopes its tiny LLM will change how we all use AI | TechCrunch
TechCrunch AI··作者 Julie Bort
资讯摘要
If AI lab PrismML isn’t on your radar yet, it should be — not because it’s raised gobs of money (it hasn’t yet, just a $22.25 million seed round), but because of the technical minds involved and the potentially industry-changing tech it’s developing. PrismML is betting that capable, high-performing, reasoning large language models don’t, in fact, have to be large. It is making reasoning models so small they can fit on PCs and smartphones. (It’s even rumored to be in talks with Apple, though CEO Babak Hassibi declined to comment on that to TechCrunch.)…

资讯正文
如果 AI 实验室 PrismML 还没有进入你的视野,那它值得你关注——并不是因为它筹集了巨额资金(事实上还没有,目前只有一轮 2,225 万美元的种子轮融资),而是因为参与其中的技术人才,以及它正在开发的、可能改变整个行业的技术。
PrismML 押注的是:能力强、性能优异且具备推理能力的大语言模型,实际上并不一定非得很大。
该公司正在打造体积小到足以在 PC 和智能手机上运行的推理模型。(甚至有传言称它正与 Apple 洽谈,不过 CEO Babak Hassibi 拒绝就此向 TechCrunch 置评。)
周四,PrismML 发布了 Bonsai 2 27B,这是其模型家族中的最新产品。该模型将 Alibaba 广泛使用的开源模型 Qwen3.8 27B 压缩至 5.9 GB。这个体积足以装进一台 PC,甚至可能可以在高端智能手机上运行。与原始模型相比,其内存占用缩小到了九分之一至十分之一。
PrismML 由一群 Caltech 研究人员创立,并由 Caltech 教授、压缩技术专家 Hassibi 领导。这家初创公司的顾问还包括 Ion Stoica。Stoica 是 Databricks 等多家公司的联合创始人,也是 Berkeley 知名的 Sky Computing Lab 主任。该实验室孕育了众多技术和初创公司,包括 Letta 和 SGLang。
PrismML 还获得了 Khosla Ventures、Cerberus Capital 和 Caltech 的投资支持。
当然,这家初创公司并非唯一一家致力于 LLM 压缩技术的企业。由西班牙 Donostia International Physics Center 一位知名教授创立的 Multiverse Computing 也是其中之一。(而且 Multiverse Computing 已经筹集了巨额资金。)
但 Hassibi 表示,PrismML 的压缩技术独具特色,因为与原始模型相比,其 LLM 几乎没有任何性能损失。Bonsai 2 的综合基准测试得分达到了 Qwen 的 98%。几个月前的 3 月,第一代 Bonsai 发布时,这一比例为 95%。该公司表示,初代模型的下载量已经超过 1,100 万次,而 PrismML 体积更小的其他模型又获得了 260 万次下载。
这表明,PrismML 的压缩效果在两次发布之间有所提升。它能否最终达到基准测试性能 100% 对等,目前仍有待观察。Hassibi 表示,压缩很可能始终会带来一定影响。
不过,无论如何,基准测试完全对等更多只是一个学术问题。LLM 在未经压缩时本身也没有那么准确,而基准测试也不能完美反映实际任务,因此 2% 的性能下降不太可能对模型在实际使用中的表现产生显著影响。(此外,在准确性方面,模型运行于其中的外围软件——也就是运行框架——同样有很大影响。)
PrismML 表示,它通过缩减构成模型的“权重”来实现这一点——权重本质上是模型在训练期间学习并存储的信息。通常,每个权重需要 16 位。PrismML 采用的方法被称为“三元”权重,将其简化为三个可能值:+1、−1 或 0。由于每个权重需要存储的数值小得多,模型所占空间也随之大幅减少。(如需深入了解这种压缩技术,可参阅该项目的 Hugging Face 页面。)
这家初创公司的下一个目标,是将这种压缩技术应用于规模更大的模型。Hassibi 对 TechCrunch 表示:“我们接下来将发布的模型,希望能在未来几个月内推出,参数规模将达到数千亿级;我预计,在这些模型中保留其智能会更加容易。”
他补充说,随着模型规模增大,“在不损失智能的情况下,可供压缩的空间也会更大。因此总体而言,我想说的是,对于更大的模型,实现 100% 的智能保留会更容易。”
Stoica 告诉我们,他对这项技术感到兴奋,因为它让高级模型能够在用户的设备上运行。“智能将触手可及,而且可以免费使用,因为它会在你已经购买的设备上运行。同时,它也将保护隐私,因为你不必把数据发送到云端。”
来源与参考
收录于 2026-09-19