小米 MiMo-V2.6-Pro 低价领跑开放模型

The Decoder··作者 Maximilian Schreiner

关键信息

这款拥有 1.02 万亿参数的混合专家模型每次请求约激活 420 亿个参数,价格为每百万输入令牌 0.435 美元、每百万输出令牌 0.87 美元。小米称 Pro 的强化学习训练耗时不到六天、成本约为 262 万美元,并通过冻结内部分配机制和防范“奖励破解”来维持训练稳定性。

资讯摘要

小米发布了 MiMo-V2.6 系列,并将 MiMo-V2.6-Pro 定位为性能领先且价格远低于同类系统的公开可用模型。根据小米和报道引用的 Artificial Analysis 数据,Pro 在 Intelligence Index 上获得 46 分,领先 Kimi K3 和 Qwen 等模型。其价格为每百万输入令牌 0.435 美元、每百万输出令牌 0.87 美元,Artificial Analysis 估算单个测试任务的成本约为 0.13 美元。Pro 是一款总参数量达 1.02 万亿的混合专家模型,但单次请求实际激活的参数约为 420 亿,同时发布的还有更小的 MiMo-V2.6-Flash。

小米称,性能提升来自强化学习规模的扩大,包括每个训练步骤使用更多数据、采用更多样的任务环境,以及投入更多计算资源对答案进行评分。在 DeepSWE 编程测试中,Pro 的成绩据称从 58.4 分升至 72.6 分,Flash 则从 48.8 分升至 65.7 分;整个训练过程耗时不到六天。小米还发布了 Pro-UltraSpeed 版本、强化学习工具包、约 7000 个带自动评分器的软件开发、网络安全、办公和网页设计任务,以及约 1000 个音乐创作任务。不过,Anthropic 指控小米与其他中国实验室一起提取 Claude 的交互数据用于模型训练,这一争议给此次发布增添了治理层面的疑问,而小米的发布内容并未解决该指控。

小米 MiMo-V2.6-Pro 低价领跑开放模型

资讯正文

小米的平价旗舰 AI 领先开放模型,Anthropic 称 Claude 助其达到这一水平

要点

- 小米的新款 MiMo-V2.6-Pro 模型目前在开放 AI 模型排名中位居榜首,而成本远低于竞争对手。

- 小米通过扩大强化学习实现了性能跃升,并公开发布了相关工具和训练任务。

- 与此同时,Anthropic 指控小米通过 Claude 模型不当抽取数据,用于训练自家的模型产品线。

小米发布了 MiMo-V2.6 系列,其中的旗舰模型在开放获取的模型中排名最高,而每项任务的成本仅为竞争对手的一小部分。这些提升来自大幅扩展的强化学习训练,不过该公司也被指控借用了 Anthropic 的 Claude。

据小米介绍,两款新模型中规模较大的 MiMo-V2.6-Pro 在分析机构 Artificial Analysis 的 Intelligence Index 上获得了 46 分。这使其成为目前性能最强的开放获取 AI 模型,领先于 Kimi K3 和 Qwen 等竞争对手。真正引人注目的是它的价格:每百万输入 token 只需 0.435 美元,每百万输出 token 只需 0.87 美元。

按照 Artificial Analysis 的计算,完成一次测试任务的成本仅约为 0.13 美元,是能力相近模型收费的一小部分。这使该模型进入所谓的“智能与成本帕累托前沿”。

Pro 是一个混合专家模型,拥有 1.02 万亿个参数,但每次请求仅激活其中 420 亿个参数。与它一同发布的还有规模更小、效率更高的 MiMo-V2.6-Flash。

性能提升来自强化学习

小米将性能跃升归因于大幅扩展的强化学习(RL),也就是通过试错、反馈和奖励进行训练。该公司从三个方面扩大了这一阶段的规模:增加每个训练步骤使用的数据量、提供更多样化的任务环境,以及投入更多计算资源对解决方案进行评分。

小米表示,整个训练过程耗时不到六天,Pro 的成本约为 262 万美元,Flash 的成本约为 85 万美元。在 DeepSWE 编程测试中,Pro 的得分从 58.4 分升至 72.6 分,Flash 则从 48.8 分升至 65.7 分。

为确保在这一规模下训练过程保持稳定,小米冻结了模型的内部分布机制,并增加了多层防护,以抵御“奖励破解”(reward hacking)——也就是模型在没有真正解决任务的情况下,利用各种伎俩操纵奖励的行为。

约 7000 个带有自动评分器的任务

除这些模型外,小米还推出了一个名为 Pro-UltraSpeed 的特别高速版本,输出速度最高可提升至 20 倍。最突出的是,该公司开放了自己的强化学习工具包,其中包括技术报告、完整训练框架、用于进一步训练的较小模型,以及约 7000 个现成的训练任务。这些任务配有自动评分器,涵盖软件开发、网络安全、办公工作和网页设计,此外还有大约 1000 个音乐创作任务。

这些任务来自多种来源。有些代码来自员工在 GitHub 上提交的真实拉取请求以及用户查询,另一些任务描述则由语言模型生成。网络安全任务取材于 OSS-Fuzz——一个包含数万个真实软件漏洞的集合;办公环境则是通过合成方式重建的。

刻意开放,也成为 Anthropic 的靶心

这种开放姿态与 Anthropic 仅两周前提出的指控形成了鲜明对比。在其威胁情报报告中,Anthropic 调查了 2025 年 12 月至 2026 年 8 月期间发现的 Claude 滥用案例,并点名指出有七家中国实验室参与了针对该模型的行动:Alibaba、Moonshot AI、DeepSeek、Zhipu、Xiaomi、MiniMax 和 SenseTime。

据称,这些实验室总共生成了约 1.9 亿次交互,以窃取 Claude 的能力,用于训练自己的模型。Anthropic 将这种做法称为非法蒸馏。

Xiaomi 的名字也出现在其中。在一宗标记为 GTG-16008 的案件中,Anthropic 追踪到 2026 年 3 月和 4 月期间、持续 20 多天的超过 40 万次交互:Xiaomi 将其自有 MiMo 模型中的用户对话和编码会话通过 OpenClaw 和 OpenCode 传给 Claude,目的是丰富未来模型的训练数据。报告几乎没有说明,用于内部蒸馏教师模型的早期训练数据和教师数据究竟来自何处。

换句话说,报告称 Xiaomi 记录了用户与其 MiMo 模型之间的对话,然后将这些对话输入 Claude,以提取训练数据;而正是这些数据,如今推动 Xiaomi 登上了开放模型排名的榜首。

来源与参考

  1. 原始链接
  2. Xiaomi's affordable flagship AI leads the open models, and Anthropic says Claude helped get it there

收录于 2026-09-23