德国联盟发布开放模型 Soofi S

The Decoder··作者 Jonathan Kemper

关键信息

该模型的混合设计通过在每个 token 仅激活少量参数来提升推理效率,即使输入很长也能保持相对稳定的速度。发布后,联盟还披露了涉及 GPQA 的训练数据污染问题,并重新计算了结果,称排名顺序没有改变。

资讯摘要

一个德国人工智能研究联盟发布了 Soofi S,这是一款开放的 30B 级语言模型,训练完全依托德国电信的 AI 云基础设施完成。该模型采用混合架构,总参数量为 316 亿,但每个 token 只激活其中的 32 亿参数,设计目标是提高长输入场景下的推理效率。联盟表示,Soofi S 在德语数据上投入很大,因此在涵盖德语、英语和编程任务的基准测试中,表现优于其他完全开放的模型,例如 Olmo 3 32B 和 Apertus 70B。最初发布后,项目又补充了关于“过训练”争议的说明,并加入了技术报告第 3 版的信息。2026 年 7 月 24 日的更新中,联盟称社区在公开训练数据中发现了一个污染问题。问题出在 QA-base 数据集上,这个数据集原本只应包含从 25 个标准基准中改写得到的练习题,用于让模型熟悉测试格式,而不是直接接触真实测试题。结果其中却混入了 GPQA 的测试集改写题目,包括 GPQA Diamond 变体,而且既有英文版本,也有机器翻译成德语的版本。报告指出,根源在于 GPQA 在 Hugging Face 上的标注方式:它没有单独的训练集,所有测试内容都放在默认的“train”分割名下。

由于数据管道按照分割名筛选内容,测试集就被误混进了练习题。随后进行的全面审计还发现 TruthfulQA、BLiMP 和 Inverse Scaling 也有相同模式,但这些基准并未用于 Soofi S 的评估。联盟随后把 GPQA 从评测中移除,对 16 个对比模型重新计算了结果,并表示总体排名没有变化。作者还指出,训练过程中没有出现明显异常,因为受影响的 GPQA 分数是逐步提升的,从 32.3 分升到 43.4 分,走势看起来与其他测试类似,并没有突然飙升的警报信号。为避免类似问题再次发生,团队现在会直接把训练数据和所有测试题进行自动交叉核对,而不再依赖数据集标签。联盟参与者还强调,正是因为采用开放方式,社区才能发现这个问题;他们也公开了大约 152,000 条单独结果供外部核验。另一个联盟合作方 Ellamind 使用其自己保留、可确认未被训练集见过的测试数据做了独立评估,也验证了这些结果。联盟表示,受影响的内容只占整个语料库的极小一部分,而更大的 Soofi L 模型已经在训练中,指令微调版和推理版预计将在未来几周内以宽松许可进入 beta 测试并发布。

德国联盟发布开放模型 Soofi S

资讯正文

德国 AI 联盟发布 Soofi S,这是一款开放的 30B 模型,在英文和德文基准测试中都名列前茅

要点

- 一个德国研究联盟发布了开源语言模型 Soofi S,该模型完全在德国电信(Deutsche Telekom)的 AI 云基础设施上训练而成。

- 该模型采用了一种资源高效的混合架构,每个 token 只激活其 316 亿个参数中的 32 亿个,即使输入非常长,处理速度也能保持恒定。

- 由于高度聚焦德语训练数据,Soofi S 在德语、英语和编程任务的基准测试中,优于其他完全开放的模型,例如 Olmo 3 32B 和 Apertus 70B。

更新——

- 已加入关于过训练指控的声明

- 已加入 Tech Report 第 3 版中的信息

2026 年 7 月 24 日更新:

该联盟发布了其预训练报告第 3.0 版,并披露了一个污染事件:社区在最初发布后的公开训练数据中发现了这一问题。该问题影响了 QA-base 数据集,该数据集本应只包含来自 25 个标准基准测试的改写训练切分。这些内容是为了教模型测试格式而设计的练习题,而不是实际的测试题本身。但该数据集还包含了科学基准 GPQA 测试集中的改写问题,包括 GPQA Diamond 变体,既有英文版本,也有机器翻译成德文的版本。

报告将原因追溯到 GPQA 的一个特性。在 Hugging Face 上,这项基准并没有单独的训练集。它的所有测试材料都放在默认标签“train”之下。由于数据管道是根据这些切分名称来选择内容的,测试集最终就与练习题混在了一起。此后进行的全面审计又发现另外三个基准也存在同样的模式(TruthfulQA、BLiMP 和 Inverse Scaling),不过这些都没有用于 Soofi-S 评估。

作为回应,该联盟将 GPQA 从评估中完全移除,并重新计算了全部 16 个对比模型的总体结果,以确保比较公平。根据作者说法,排名顺序没有变化。值得注意的是,没有人在训练期间发现这个问题。模型在受影响的 GPQA 任务上的表现确实稳步提升,从 32.3 分上升到 43.4 分,但这一增幅仍在正常范围内,看起来与其他测试上的进展并无二致。没有出现可作为警示信号的突然跃升。为防止此类情况再次发生,团队现在会自动将训练数据与所有测试题进行交叉核对,而不再依赖那些往往会误导人的标签。

项目参与者、Fraunhofer IAIS 的 Nicolas Flores Herr 等人将这起事件视为开放式方法有效的证据,因为社区之所以能发现这个问题,正是因为数据是公开可用的。团队表示,他们已将大约 152,000 条单独结果开放供核验。联盟伙伴 Ellamind 采用其自己刻意保留、且模型训练时被保证从未见过的测试数据进行了另一项评估,结果证实了这些结论。该联盟称,受影响的部分仅占整个语料库的极小一部分。目前,经过微调的 instruct 和 reasoning 变体正在进行 beta 测试,预计将在未来几周内以宽松许可发布。更大的 Soofi L 模型已经在训练中。

2026 年 7 月 15 日更新:

发布后,批评者认为,按照经典的 Chinchilla scaling laws 标准,Soofi S 被严重“过度训练”了。Google DeepMind 在 2022 年公布了这些定律,用于描述在固定算力预算下如何平衡模型规模与训练数据。它们给出的甜点区大约是每个参数 20 个 token。Soofi S 远远超过了这一比例。它使用约 27 万亿个 token 和 300 亿个参数,比例达到数百比一。如果只计算每个 token 激活的 32 亿参数,这个比例会跃升到数千比一。

该项目技术领导团队成员 Michael Fromm 对这一批评进行了反驳。他认为,这些规则不能简单地套用于 Mixture-of-Experts(MoE)架构。Fromm 说:“有新的研究表明,来自稠密模型的旧 scaling laws 不再适用于 MoE 架构。” 原因在于 MoE 模型的构建方式。单个专家会从查看相同文档中受益,因此在大型、高质量数据集里,重复数据的问题比在稠密模型中要小。作为对比,Fromm 提到 Nvidia,其自家模型训练时最多使用了 25 万亿个 token。

2026 年 7 月 13 日原文:

Soofi S 是首批完全在德国电信位于慕尼黑的 Industrial AI Cloud 上训练的大语言模型之一。这款开放的 30B 模型采用了轻量级混合架构,并且训练数据组合有意向德语倾斜。

由 KI Bundesverband(德国 AI 协会)协调的一个德国研究联盟发布了 Soofi S 30B-A3B。这是一款开放语言模型。根据其预训练报告,它在完全开放模型中,英语和德语基准测试上都取得了最高分,超越了此前的领先者,如 OLMo 3 32B 和 Apertus 70B。

为长上下文打造的轻量架构

Soofi S 是一个 Mixture-of-Experts 模型。它总计包含 316 亿个参数,但每个生成 token 只激活约 32 亿个参数。这使得它的计算成本更接近一款 3B 模型,而不是传统的 30B 模型。该联盟采用了 Nvidia 的 Nemotron 3 Nano 架构且未作修改,这是一种将 Mamba-2 层与标准注意力层相结合的混合设计。

与典型 Transformer 的关键区别在于记忆行为。在传统模型中,用于注意力计算、存储之前 token 的 KV cache 会随着上下文长度线性增长。在长输入和大量并行请求的情况下,重新加载该缓存会成为瓶颈。Soofi S 的 52 层中,只有 6 层会维护这样的缓存。

其实际收益体现在生成吞吐量上。在 40,000 token 的上下文长度下、32 个并行请求时,Soofi S 每 GPU 每秒生成的 token 数大约是 14 亿到 24 亿参数区间的稠密模型的 8 倍左右。随着上下文增长,传统模型的吞吐量会显著下降,而 Soofi S 从 4,000 到 256,000 token 基本保持平稳。测量中只有阿里巴巴的 Qwen3.5 35B-A3B 表现出类似行为,它也采用了混合架构。

围绕德语构建的训练混合

该联盟总共处理了约 27 万亿个 token,分为三个阶段。第一阶段,模型从约 20 万亿个 token 中学习语言基础,这些 token 来自网页、代码、数学和领域特定文本的广泛混合。第二阶段接着使用约 6 万亿个来自更高质量来源的 token,以强化此前学到的模式。随后一个较短的第三阶段通过训练最长可达 100 万 token 的超长文档来扩展上下文窗口。

对德语的刻意聚焦是核心。在第一阶段,德语占训练混合的 7.2%;在第二阶段,这一比例上升到 15.3%。而在 Nvidia 的 Nemotron 参考配方中,所有非英语语言加起来也只占大约 5%。

在数据来源方面,该联盟结合了来自 HPLT 的德语网页文本、开放许可的 German Commons 语料库、FinePDFs 和 FineWiki 的德语部分,以及商业授权的 Genios 语料库,其中包含来自 916 家德国出版物的 1.93 亿篇报纸文章。机器翻译和合成生成的德语文本也补充了这一组合。

德语和英语两项开源模型得分均居首

报告称,在与另外 16 个开源模型的评测中,Soofi S 在德语和英语的综合得分上都领先所有完全开源模型。这其中包括来自 Allen Institute for AI 的 OLMo 3 32B,以及来自 ETH Zurich 和 EPFL 的 Apertus 70B。与所有欧洲主权基线模型相比,这一模型在套件中的所有德语基准测试上都更胜一筹,有时甚至以两位数的优势领先。

不过,Soofi S 在德语竞赛数学上的表现不算出色,在 Minerva MATH-DE 上得分 56 分,明显落后于 Qwen3.5 35B-A3B(76.5 分)和 Gemma 3 27B(65.6 分)。它在 NaturalQuestions 的开放式事实检索上也落后。后者很可能与其仅有 30 亿个活动参数有关,这使它能够存储的世界知识比稠密的 270 亿参数模型更少。

RULER 长上下文测试还揭示了一个具体的弱点:当模型必须从一段长文本中提取高频出现的词时,Soofi S 在超过 32,000 个 token 的上下文范围后,命中率会降至约 3%,而可比的 Nemotron 模型仍能达到 60% 到 64%。作者将此归因于:他们的长上下文训练数据包含许多长文档,但缺乏专为提取任务设计的合成数据。在其余 12 项 RULER 任务上,两款模型的表现大致相同。

主权基础设施与可验证的开放性

这次训练运行于 3 月至 5 月间在慕尼黑德国电信工业 AI 云上进行,最多使用了 512 块 Nvidia B200 GPU,总计约 253,000 个 GPU 小时。根据报告,该设施完全使用可再生能源供电,采用艾斯巴赫运河(Eisbach canal)的水进行冷却,并将废热输送到周边的 Tucherpark 社区。Soofi S 是这套基础设施上最早进行的大型训练运行之一。

Soofi 背后是一个由德国科研机构和企业组成的联盟,由德国 AI 协会协调,并作为欧洲 IPCEI-CIS 计划的一部分,获得了德国联邦经济与能源部的资助。

参与方包括弗劳恩霍夫 IAIS 和 IIS 研究所、德国人工智能研究中心(DFKI)、达姆施塔特工业大学、维尔茨堡大学、L3S 研究中心、柏林应用科学大学,以及 AI 公司 Ellamind 和 Merantix Momentum。该项目的目标是打造一个开放的欧洲 AI 模型家族,能够运行在主权基础设施上,并在工业应用中接受测试。

研究人员正在公布模型权重以及部分中间检查点、完整的训练与评估代码,以及一份详细的数据清单,其中列出了原始 token 数、epoch 数量和各数据来源的有效贡献。那些经过审查但被排除的数据来源也已记录在案。团队表示,这意味着 Soofi S 符合 Open Source Initiative 的 Open Source AI Definition 1.0。

一项更严格的欧洲开放数据定义提案要求每一个训练 token 都必须能够自由分发,而 Soofi S 并不满足这一要求,原因在于其中有 1.3% 来自 Genios 的数据,而这些数据受商业许可约束。报告称,大约 99% 的训练混合数据可以被独立重建。该模型发布所采用的确切许可协议目前尚未最终确定。

技术负责人 Michael Fromm 写道,Soofi S 的定位介于两类模型之间:一类是像 EuroLLM 或 Teuken 这样覆盖多种语言、强调欧洲主权的广泛多语种项目;另一类则是表现最强的国际开源权重模型。根据项目网站,该联盟正在为下一阶段寻找行业合作伙伴,以在涉及技术文档、代码生成和基于智能体的系统的应用中测试该模型。

来源与参考

  1. 原始链接
  2. German AI consortium releases Soofi S, an open 30B model that tops benchmarks in both English and German

收录于 2026-07-25