微软转向廉价专用AI模型
The Decoder··作者 Gregor Kobsik
关键信息
文中的网络安全结果依赖于 MDASH,这是微软的编排系统,它会把困难任务转交给 OpenAI 的推理模型,而不是只依赖 MAI-Cyber-1-Flash 本身。文章还指出,微软希望模型可以替换,以避免过度依赖单一模型家族。
资讯摘要
微软AI正在把 token 效率作为核心战略,更倾向于使用小型专用模型,而不是只追求一个大型通用模型。AI CEO Mustafa Suleyman 认为,行业需要在顶级性能和成本之间做权衡,而不能默认越大的模型越好。 在网络安全领域,微软表示其 MAI-Cyber-1-Flash 在 CyberGym 基准上比 Anthropic 的 Mythos 高出 12 个百分点,而成本大约只有后者的一半。 但文章特别强调,这一结果并不是单靠该模型实现的,而是依赖于 MDASH 这一编排层,它会协调多个模型,并且在遇到困难任务时仍然调用 OpenAI 的推理模型。 微软还声称,MAI-Image-2.5-Flash 与 GPT-Image-2 相比,GPU 成本最多可以降低 84%。
Suleyman 的更大目标是打造可替换的模型,避免微软被单一模型家族锁定。 文章认为,竞争正在从单个模型转向更重要的“harness”或编排器,因为它们负责在便宜的专用模型和前沿模型之间分配工作。 文中还提到,Anthropic 已经为 Claude Fable 5 采用了类似思路,Sakana 也围绕这一理念构建了 Fugu。 文章最后指出,微软这些更小的 MAI 模型是否真的能在部分替代 OpenAI 时保持同等表现,仍然有待观察。

资讯正文
微软 AI 选择押注低成本的专用模型,而不是追逐最前沿模型
微软 AI 正在把 token 效率作为竞争重点,更青睐小型专用模型,而不是通用的前沿模型。AI 首席执行官 Mustafa Suleyman 写道,行业必须权衡顶级性能与成本。公司并非训练一个万能模型,而是为单一领域训练紧凑型模型。Suleyman 表示,其最新的网络安全模型 MAI-Cyber-1-Flash 在 CyberGym 基准测试中,以一半的成本领先 Anthropic 的 Mythos 12 个百分点。不过,这一结果需要依赖 MDASH 系统;该系统会协调多个模型,并且仍会把高难度任务路由给 OpenAI 的推理模型。微软还表示,与 GPT-Image-2 相比,MAI-Image-2.5-Flash 可将 GPU 成本降低最高达 84%。
Suleyman 也希望使用可替换模型,以避免微软依赖单一模型家族。微软这些小型 MAI 模型在多大程度上能部分替代 OpenAI,并匹配其性能,仍令人怀疑。
竞争正在从单个模型转向 harnesses,也就是负责任务路由并提供上下文的软件。编排器会把大部分工作交给更便宜的专用模型,并为棘手情况保留前沿模型。Anthropic 为 Claude Fable 5 建模采用了这种方法,而 Sakana 则围绕它构建了 Fugu。
来源与参考
收录于 2026-07-31