GLM-5.3-Flash 以更低成本逼近顶级模型
The Decoder··作者 Maximilian Schreiner
关键信息
Artificial Analysis 在最大推理强度下将 GLM-5.3-Flash 评为 57 分,而 GLM-5.3 为 60 分,并认为它位于智能与成本的帕累托前沿。Z.ai 还表示,他们在 SGLang 之上构建了服务软件,并采用分阶段处理设计,使同一硬件上的吞吐量提升了三倍。
资讯摘要
Z.ai 发布了 GLM-5.3-Flash,并将其描述为 GLM-5 系列中首个原生多模态模型。该模型总参数为 3200 亿,但推理时只有 180 亿参数被激活,权重已在 Hugging Face 上开放,许可证为 MIT。它还支持 100 万 token 的上下文窗口,这意味着可以在单次请求中输入非常长的文档或大规模提示词。根据 Artificial Analysis 的测试,GLM-5.3-Flash 在最大推理强度下的 Intelligence Index 得分为 57 分。这个分数只比更大的 GLM-5.3 低 3 分,而 GLM-5.3 的得分为 60 分,并且该模型在该基准上的位置与 GPT-5.6 Terra 和 Muse Spark 1.2 相当。最引人注目的还是价格:Artificial Analysis 计算出的单次任务成本为 0.09 美元,而 GLM-5.3 为 0.68 美元,前者大约便宜 7.5 倍。
该机构认为,这种能力与价格的组合使其位于智能与成本的帕累托前沿,也进一步加大了中国模型对西方厂商的价格压力。文章还强调了基础设施层面的意义:在正式发布前,Z.ai 先以“ox-alpha”的匿名名称在 OpenCode 和 OpenRouter 上测试该模型,并且它成为当周最受欢迎的模型。Z.ai 表示,这些流量全部运行在中国 AI 芯片上,而 SemiAnalysis 报道称该系统的吞吐量达到每天 100 万亿 token。公司声称其硬件效率和每 token 成本与常见的 Nvidia GPU 相当,SemiAnalysis 认为这再次对长期存在的 CUDA 优势构成挑战。为了实现这一点,Z.ai 在 SGLang 之上构建了自己的服务栈,把处理拆分成可独立扩展的多个阶段,并表示这一改造在同样硬件上将吞吐量提升了三倍,优化过程中还使用了一个基于 GLM-5.3 的智能体。

资讯正文
GLM-5.3-Flash 以极低的成本匹敌顶级模型,并且无需 Nvidia 即可运行
关键要点
- Z.ai 发布了 GLM-5.3-Flash,这是一款拥有 3200 亿参数、上下文窗口达 100 万 token 的模型。
- 在 Intelligence Index 上,它的表现几乎与更大的 GLM-5.3 持平,但每次任务成本仅 0.09 美元,便宜约 7.5 倍。
- 该模型完全运行在中国 AI 芯片上,而 Z.ai 自家的软件则实现了与 Nvidia GPU 相当的效率。
Z.ai 的新模型 GLM-5.3-Flash 以极高的性价比见长,但也有明确短板,同时还带来了一个值得关注的基础设施层面话题。
据 Z.ai 介绍,GLM-5.3-Flash 是 GLM-5 系列中首个原生多模态模型。它共有 3200 亿参数,其中只有 180 亿处于激活状态,采用 MIT 许可发布,并提供 100 万 token 的上下文窗口。模型权重已发布在 Hugging Face 上。
Artificial Analysis 的测评显示,该模型在最大推理强度下的 Intelligence Index 得分为 57 分。这个成绩只比更大的 GLM-5.3 低 3 分,后者得分为 60 分,同时与 GPT-5.6 Terra 和 Muse Spark 1.2 持平。
用中国芯片而不是 Nvidia
在发布之前,Z.ai 曾在 OpenCode 和 OpenRouter 上以匿名名义“ox-alpha”测试该模型,并使其成为当周最受欢迎的模型。有意思的是,Z.ai 表示,所有这些流量都运行在中国 AI 芯片上。
SemiAnalysis 报道称,该模型每天可处理 100 万亿个 token,这一容量水平直到现在还被认为只有前沿实验室才能实现。Z.ai 认为,其硬件效率和每 token 成本与常见的 Nvidia GPU 不相上下。SemiAnalysis 将此解读为对“CUDA 护城河”的又一次检验,紧随 OpenAI 新芯片的最新结果之后。
CUDA 是 Nvidia 位于 AI 软件与显卡之间的编程层。它已发展近 20 年,几乎所有 AI 框架都为其进行了优化。切换到其他芯片意味着要重做这些工作,重新编写计算操作,调整内存访问方式,并排查性能瓶颈。
因此,Z.ai 在 SGLang 之上构建了自己的服务软件,并将处理流程拆分为可独立扩展的多个阶段。团队表示,这使得在同样硬件上,其吞吐量比最初方案提升了三倍。一个基于 GLM-5.3 的智能体也参与了优化工作。
来源与参考
收录于 2026-08-28