Deepseek 的 DSpark 最高可将 AI 推理加速 85%
The Decoder··作者 Matthias Bastian
关键信息
Deepseek 表示,DSpark 的做法是让小模型先提出候选输出,再由大模型批量验证,而不是逐个 token 生成。该公司还在 Google DeepMind 的 Gemma 和阿里巴巴的 Qwen 等开源模型上测试了这一方法,说明这种思路可能不只适用于 Deepseek 自家系统。
资讯摘要
Deepseek 发布了 DSpark,这是一种新的推理框架,据称可将 AI 模型的单用户响应速度提升 60% 到 85%。该公司认为,传统 LLM 逐个 token 生成文本的方式效率不高,容易导致 GPU 利用率偏低,并让较长回答的延迟变高。DSpark 通过推测解码来改进这一点:先由一个更小的模型生成候选 token,再由更大的模型批量检查这些候选结果。它还会按小词组而不是单个 token 生成,从而进一步提高整体效率。
除此之外,DSpark 还引入了一个基于置信度的机制,会根据当前计算负载动态调整验证深度,尽量减少对被拒绝候选 token 的无效计算。Deepseek 表示,这套方法不仅在自家模型上测试过,也在 Google DeepMind 的 Gemma 和阿里巴巴的 Qwen 等开源模型上验证过,说明其适用范围可能更广。该框架以及与北京大学联合开发的 Deepseek-V4-Pro 模型已在 Hugging Face 和 GitHub 上以 MIT 许可证公开,技术细节则写在论文中。文章还强调,这一发布对中国具有战略意义,因为更低的推理成本意味着用更少的高端芯片就能支撑更多 AI 工作负载。

资讯正文
Deepseek 的 DSpark 将 AI 速度最高提升 85%,在美国出口管制收紧之际取得战略性胜利
据该公司称,Deepseek 已发布 DSpark,这是一种新方法,可将其 AI 模型的单用户响应速度提升 60% 至 85%。
Deepseek 表示,大多数 LLM 都是一次生成一个词,这会导致 GPU 利用率偏低,且在生成长回复时等待时间很长。它的新框架 DSpark 采用了推测解码(speculative decoding):一个更小、更轻量的模型先提出答案候选,然后由更大的模型分批进行校验。它还会生成小词组而不是单个 token,从而提升整体效率。一个基于置信度的系统会根据计算负载动态调整验证深度,减少对被拒绝的 token 提案所浪费的处理量。
Deepseek 还用来自 Google DeepMind(Gemma)和阿里巴巴(Qwen)的开源模型测试了 DSpark,表明这种方法具有广泛适用性。该框架以及与北京大学共同开发的 Deepseek-V4-Pro 模型,已在 Hugging Face 和 GitHub 上以 MIT 许可证发布。技术细节见论文。
减少芯片压力,或实现更快扩展
这一发布对中国具有战略意义。更快的推理可降低芯片需求并削减基础设施成本。这对中国以及潜在的欧盟都是好消息,因为两者在数据中心建设和高性能芯片方面都落后于美国。
不过,杰文斯悖论可能会出现。更高效的推理确实会降低每次查询所需的芯片需求。但释放出来的算力很可能会立即被更多 AI 请求、更长上下文或新应用所吸收。芯片总需求可能保持不变,甚至继续增长。Deepseek 自己表示,DSpark“实现了此前无法达到的性能层级,推动了我们服务系统的帕累托前沿”。
尽管如此,从短期看,这些效率提升对中国和欧盟都有帮助。它们可以用更少的高端芯片榨出更多 AI 性能。鉴于芯片供应紧张以及美国出口限制,这是一项战略优势,也削弱了美国将芯片作为地缘政治杠杆的能力。
AI 新闻,无需炒作——由人工策划
订阅 THE DECODER,即可无广告阅读、每周 AI 新闻简报、每年六次发布的独家《AI Radar》前沿报告、完整档案访问权限,以及评论区访问权限。
来源与参考
收录于 2026-07-01