Meta 重返开源权重模型

The Decoder··作者 Maximilian Schreiner

关键信息

Glimmer 旨在让 AI 智能体在 Mac 或 PC 上用单张消费级 GPU 本地全天候运行,Meta 还表示通过 4 位量化可将模型压到 20GB 以下内存。Meta 还称一个小型辅助模型可将文本输出速度最高提升 3.1 倍,但其基准对比大多由公司内部完成,且并未针对竞品做优化。

资讯摘要

Meta 发布了 Muse Glimmer,这是一个 300 亿参数的开源权重模型,并在 Hugging Face 上以 Apache 2.0 许可提供。公司表示,这个模型面向智能体工作负载,目标是在 Mac 或 PC 上借助单张消费级 GPU 本地运行,而不是依赖云端推理。Meta 说,Glimmer 是自 2025 年春季 Llama 4 以来发布的首个开源模型,而且后续还会继续推出;据《华尔街日报》报道,更强的 Muse Spark 1.2 开源权重版本预计将在未来几周内上线。此次发布发生在 Meta AI 团队经历动荡之后,包括 Llama 4 因基准争议遭到批评,以及在 Meta Superintelligence Labs 之下多次重组。Meta 还表示,Glimmer 是通过蒸馏更大模型 Muse Spark 的输出训练出来的,这是把大模型压缩成小模型的常见方法。

Meta 将 Glimmer 与 Google 的 Gemma4-31B 和阿里巴巴的 Qwen3.6-27B 进行比较,并声称它在大多数基准上占优,尤其是在工具使用、网页搜索和长上下文等智能体任务上。与此同时,Meta 也承认 Qwen 在桌面控制和终端任务上更强,而三者在多模态任务上的表现大致相当。文章提醒读者,这些对比应谨慎看待,因为大部分数据由 Meta 自行收集,而且测试环境并未针对竞品模型优化。与发布同步,Mark Zuckerberg 发表了题为《The Future is for Everyone》的文章,主张超级智能不应由少数实验室垄断,而应尽可能广泛分布。他还明确为“从可观察内容中学习”辩护,这使他直接卷入了当前围绕蒸馏、以及利用前沿模型输出作为训练数据的行业争议。

Meta 重返开源权重模型

资讯正文

Meta 在扎克伯格“以更快速度复制中国并通过拍卖出售算力”的计划下重返开放模型路线

在停更一年多后,Meta 再次发布模型权重。紧凑型智能体模型 Muse Glimmer 足以与竞争对手抗衡,而马克·扎克伯格还配了一篇文章,读起来像是对 OpenAI 和 Anthropic 的回应。

这段空窗期并不平静。借助 Llama,Meta 长期以来一直是开放模型最重要的来源,但 Llama 4 表现不佳,并因基准分数被“修饰”而招致批评。该系列中最大的版本甚至根本没有发布。扎克伯格将 AI 团队重组为 Meta Superintelligence Labs,向数据提供商 Scale AI 以及顶尖研究人员的挖角投入了数十亿美元,并多次重组该部门。多年来一直是 Meta AI 研究代言人的首席科学家 Yann LeCun 已经离开公司。Muse Glimmer 是这个新部门的首个开放模型。

Meta 具有竞争力,但并不占据主导

Meta 将 Glimmer 与 Google 的 Gemma4-31B 和阿里巴巴的 Qwen3.6-27B 进行了对比,这两者是同一尺寸级别中领先的开放模型。Glimmer 在大多数基准测试中胜出,尤其是在工具调用、网页搜索和长上下文处理等智能体任务上。Qwen 在驱动电脑桌面和终端任务方面明显更强。在多模态任务上,三者表现持平。

因此,Meta 确实重新回到了小型开放模型的竞争中,但还没有领跑。并且像所有由厂商运行的基准测试一样,这些数字也要打些折扣看待。Meta 大部分对比数据由自己收集,并在方法报告中承认,其测试设置并未针对竞争对手模型进行优化。

旨在运行于你自己的硬件上

在完整精度下,这个模型需要超过 55 GB 内存。Meta 将权重量化到约 4 位,把模型压缩到 20 GB 以下。Meta 表示,这样的体积足以连同图像处理一起,装入当前消费级显卡和 MacBook 的内存中。一个小型辅助模型还能将文本输出速度最高提升 3.1 倍。其核心卖点是:一个处理你的日历、文件和私人消息的智能体,应该完全运行在你的设备上,而不是把任何数据传到云端。

Glimmer 是通过对 Meta 更大的 Muse Spark 模型进行蒸馏训练得到的,这意味着小模型学习模仿大模型的输出。这也是如今大多数紧凑型模型的构建方式。

扎克伯格为蒸馏其他实验室的模型辩护,Amodei 则称其构成威胁

随着这一发布,扎克伯格发表了一篇题为《The Future is for Everyone》的文章,阐述 Meta 的开源战略。他的核心论点是,超级智能不应该掌握在少数实验室手中,而应该尽可能广泛地分布。他写道,不可能存在单一、善意的超级智能;安全来自众多参与者之间的平衡。最危险的结果将是领先实验室把最好的模型据为己有。

引人注目的是,他为蒸馏其他公司的模型辩护得如此直白。他写道,有些人试图把这描述为有害,但值得保护的原则是“你可以从你能观察到的任何事物中学习”。这正落在一场持续进行的争论中央。OpenAI 和 Anthropic 一再指责中国实验室未经许可把他们的模型当作教师;Anthropic 首席执行官 Dario Amodei 多年来一直警告前沿级开源模型的风险,同时推动对中国实施更严格的出口管制。蒸馏会利用前沿模型的输出,在不同训练阶段生成训练数据。OpenAI 等公司认为,这让中国实验室搭了顺风车,而且鉴于他们在自身训练流水线上的投入,这实际上等同于偷窃。

扎克伯格持相反观点。他认为,美国不应该限制开源模型,而应确保最好的开源模型来自美国,其中也包括蒸馏。他还希望美国实验室在训练数据方面少一些规则,作为交换,他承诺与政府开展更紧密的合作,例如提前提供模型用于安全测试。

Meta 偏偏由这家公司来提出这样的论点,是有商业原因的。在最强能力的模型上,Meta 落后于 OpenAI 和 Anthropic。开放、广泛分发的模型是 Meta 可能合理声称领先的唯一领域。眼下,中国实验室正扮演着这一角色,而同样是这些实验室,被 OpenAI 和 Anthropic 指责在“吃”他们模型输出的“剩饭”。

直到几周前,人们才清楚这个话题有多敏感。根据 The Information 的报道,Meta 在 6 月限制了自家工程师如何使用 Anthropic 的 Claude Code 和 OpenAI 的 Codex,以免它们的输出进入 Meta 的训练数据。一份内部备忘录警告称,与合作伙伴公司之间会出现严重升级。至少在措辞上,这种升级如今已经发生。

悬而未决的问题是:投资者能从 6000 亿美元中得到什么?

对股东来说,另一个更大的问题正在逼近。根据《华尔街日报》,Meta 计划今年单年就投入最高 1450 亿美元,其中大部分用于数据中心,并在 2028 年前累计投入 6000 亿美元。到目前为止,还没有直接收入与之匹配。Meta 在高端模型上落后于 OpenAI 和 Anthropic,也没有同等规模的 API 业务,而像 Glimmer 这样的开源模型,设计上就不会带来许可收入。

7 月份则显示了华尔街变得多么没耐心。在财报电话会上,扎克伯格提出了一个云业务设想,希望直接将 Meta 的数据中心商业化。但他没有给出细节,投资者随即抛售股票。在一次内部全员大会上,他也承认了公司 AI 改造中的薄弱环节。

元宇宙的类比几乎让人无法忽视。当时,他宣布了一次代际性的技术平台转变,将公司更名,并在多年里向 Reality Labs 投入了数百亿美元,但始终没有真正出现面向大众市场的产品。不过,有一个差别很重要。AI 已经在改善 Meta 的核心业务,包括广告定向和推荐系统,而且 AI 计算能力的需求是真实存在的,这从整个行业的支出就能看出来。但如果 Meta 搭建起庞大的基础设施,却把模型免费送出去,而竞争对手却把最好的模型拿去卖钱呢?

Zuck 打算如何赚钱的线索,藏在这篇文章的一个从属分句里。免费版本应该能触达数十亿人,而任何想要更多算力的人,都要通过“动态拍卖机制”付费。需求决定价格,稀缺的数据中心容量则会分配给出价最高的人。

Meta 对这套玩法并不陌生。其广告业务是地球上最大拍卖机器之一,多年来一直遵循同样的逻辑运转。扎克伯格会把这种定价模式移植到算力上,这也与他在 7 月暗示过的云计算思路相契合。但这仍然只是一张草图:没有产品,没有时间表,也没有说明它究竟适用于消费者、开发者还是企业客户。

因此,这篇文章也像是在回应 Meta 自己的投资者。如果 Meta 无法赢得最佳模型的竞争,它就宣布分发才是真正目标,而其基础设施本身就是产品。一些观察人士认为,在 Deepmind 最近经历动荡之后,Google 可能会沿着类似路径前进。至于这是否会变成一个价值 6000 亿美元的商业模式,这不是扎克伯格的理念单靠自己就能回答的问题。

来源与参考

  1. 原始链接
  2. Meta returns to open models with Zuckerberg's plan to out-copy China and sell compute by auction

收录于 2026-08-11