Qwen3.8-Omni-Flash以低价挑战Gemini Flash

The Decoder··作者 Matthias Bastian

关键信息

Qwen估算音频输入成本低于每小时0.01美元,而以每秒一帧处理带音频的720p视频约需0.20美元,且不包括响应成本。基准测试对比和成本估算均来自厂商,仍需独立验证;Gemini 3.8 Flash的初始价格计划于2027年1月1日翻倍。

资讯摘要

Qwen3.8-Omni-Flash是Qwen首个专门面向AI智能体场景构建的多模态模型。它能够同时处理音频和视频,从中得出结论,并在不需要用户逐步指挥的情况下调用工具。文章列举的应用包括编辑视频博客、翻译短视频和总结电影。该模型的上下文窗口最高达到一百万个Token,使智能体能够在一次交互中分析非常庞大的输入。

Qwen表示,它在音视频任务上的表现接近Gemini 3.8 Flash,但这些对比尚未经过独立验证。其API价格为每百万输入Token 0.15美元、每百万输出Token 0.47美元;Qwen还估算音频处理成本低于每小时0.01美元,以每秒一帧处理带音频的720p视频约需0.20美元。该模型可通过Qwen Studio、Qwen Cloud和API使用,Qwen-MM-Plugins则为Claude Code、Gemini CLI和Qwen Code等智能体环境增加视频编辑、说话人识别和视频转PDF笔记等能力。Qwen-Live Harness还支持通过摄像头和麦克风进行实时交互。

Qwen3.8-Omni-Flash以低价挑战Gemini Flash

资讯正文

Qwen3.8-Omni-Flash 以低于 Google Gemini Flash 的价格,达到相当的多模态基准测试成绩

Qwen3.8-Omni-Flash 是 Qwen 首个为 AI 智能体打造的多模态模型。它能够同时处理音频和视频、得出结论,并自主调用工具来编辑视频博客、翻译短视频或总结电影。其上下文窗口覆盖 100 万个 token。在音视频任务上,Qwen 表示,该模型的表现接近 Gemini 3.8 Flash。

该模型可通过 Qwen Studio、Qwen Cloud 和 API 使用。开源的 Qwen-MM-Plugins 为 Claude Code、Gemini CLI 和 Qwen Code 等智能体增加了视频编辑、说话人识别、PDF 视频笔记以及可复用工作流等功能。Qwen-Live Harness 则支持通过摄像头和麦克风进行实时交互。

来源与参考

  1. 原始链接
  2. Qwen3.8-Omni-Flash undercuts Google's Gemini Flash pricing while matching its multimodal benchmarks

收录于 2026-09-20