阿里巴巴发布面向长周期任务的 Qwen3.8-Max
The Decoder··作者 Jonathan Kemper
关键信息
阿里巴巴表示,Qwen3.8-Max 基于 Qwen3.5 架构,拥有 2.4 万亿总参数和每次查询 950 亿激活参数,属于稀疏的专家混合架构。公司展示了其在编码、论文复现、芯片设计和电商模拟中的自主运行,但这些结果来自阿里巴巴自己的评测,而不是独立基准测试。
资讯摘要
阿里巴巴 Qwen 团队发布了 Qwen3.8-Max,这是其目前最强大的语言模型。该模型总参数规模达到 2.4 万亿,每次请求激活 950 亿参数,重点不在于回答单轮提示词,而是面向长周期的自主执行任务。阿里巴巴表示,它基于 Qwen3.5 架构开发,并将成为首个公开发布权重的 Qwen-Max 模型。该模型的预览版其实在 7 月中旬就已公布,当时可以通过 Alibaba 的 Token Plan、Qoder 和 QoderWork 以标准价格 10% 的费用使用。
为了展示能力,阿里巴巴给出了多个无需人工干预的编码和研究案例。第一个案例中,Qwen3.8-Max 花了 16 天构建命令行工具 oh-my-cli,它会把用户请求转成 GitHub issues,自行分配任务,编写代码,运行测试,并在反复迭代后持续改进结果。到 2026 年 7 月 30 日,该项目已经累计 265 次提交、127 个 pull request 和 151 个 issue,整个过程没有人工插手。
第二个案例中,模型拿到论文《Unified Data Selection for LLM Reasoning》时没有任何起始代码,任务是复现论文结果并进一步改进。阿里巴巴称,这一过程大约持续了 5 天、消耗约 125 小时算力,模型写了 7,600 行代码,并运行了 33 个 GPU 训练任务。它先复现了论文的 6 项主要结果,随后在 4 轮中测试了 18 个自有想法,并在 AIME24 数学基准上比论文方法高出 2.7 分。
第三个案例来自阿里巴巴天池平台上的 WWW2025 Multimodal Dialogue Intent Recognition Challenge,526 支人类队伍参与竞争。Qwen3.8-Max 在 24 小时内微调了多个中文语言模型以及用于商品截图的 Qwen2.5-VL-7B,并把它们组合成投票系统。经过 45 次提交,准确率从 0.60 提升到 0.853,最终超过了 526 支人类队伍中的 458 支。
阿里巴巴还展示了两个更长周期的规划任务。其一是芯片设计任务,模型需要为加密方案设计一个密码学构件,其中关键指标是逻辑门数量,因为门越少,芯片通常越小、越高效。模型从一个能用但臃肿的 8,298 门设计开始,经过大约 500 次迭代将其压缩到 678 门。随后经过开源工具 OpenROAD 的自动布局,物理面积从 106x106 微米缩小到 46x46 微米,减少了 81%。阿里巴巴表示,模型在几百轮迭代后仍能继续做深层结构修改,而不是停留在表面调整。最后一个案例是 E-Commerce-Bench,用于模拟在线零售整整一个财年,但提供文本在这里被截断,未给出完整结果。

资讯正文
阿里巴巴的开源权重 Qwen3.8-Max 以 2.4 万亿参数挑战长周期 AI 任务
阿里巴巴推出了 Qwen3.8-Max,这是一款拥有 2.4 万亿参数的语言模型,旨在自主完成持续数天的复杂任务。
在测试中,该模型自主构建了软件,复现并改进了一篇研究论文的结果,还成功运行了一家模拟电商业务。
内部基准测试显示,其表现与西方顶级模型不相上下。Qwen3.8-Max 现已可用,模型权重计划下周发布。
阿里巴巴的新旗舰模型 Qwen3.8-Max 旨在处理持续数天的复杂任务,从复现研究论文到自主设计芯片。团队计划下周发布其权重。
阿里巴巴的 Qwen 团队发布了 Qwen3.8-Max,这是迄今为止他们最强大的语言模型。该模型总参数规模达到 2.4 万亿,每次查询激活 950 亿参数。Qwen3.8-Max 基于 Qwen3.5 架构构建,团队表示,其重点不是只回答一次性的提示,而是在较长时间内独立完成复杂任务。
阿里巴巴最早于 7 月中旬公布了这款模型的预览版,可通过阿里巴巴的 Token Plan、Qoder 和 QoderWork 使用,价格仅为标准价格的 10%。即便当时,团队也提到该模型拥有 2.4 万亿参数,并将其排在 Fable 5 之后,但没有公开基准测试结果。Qwen3.8-Max 是 Qwen-Max 系列中首个权重将向公众开放的模型。
三次自主编码实战检验了模型的能力
为了展示 Qwen3.8-Max 的编码实力,团队给出了三个案例研究,在这些案例中,模型完全在没有任何人工帮助的情况下运行。
在第一个案例中,Qwen3.8-Max 花了 16 天构建命令行工具 oh-my-cli。模型接收用户请求,将其转化为 GitHub issues,把任务分配给自己,编写代码,运行测试,并反复迭代改进结果。到 2026 年 7 月 30 日,它已经累计提交 265 次 commit、127 个 pull request 和 151 个 issue,全程没有任何人工介入。
在第二个案例中,模型拿到研究论文《Unified Data Selection for LLM Reasoning》,但没有起始代码。它的任务是复现论文结果,然后在此基础上进一步改进。根据团队说法,在大约 5 天、约 125 小时的计算时间里,Qwen3.8-Max 编写了 7,600 行代码,并运行了 33 个 GPU 训练任务。它首先复现了论文的全部六项主要结果。随后,它在四轮中测试了自己的 18 个想法,并在 AIME24 数学基准上比论文方法高出 2.7 分。
第三个案例涉及阿里巴巴天池平台上的 WWW2025 Multimodal Dialogue Intent Recognition Challenge,共有 526 支人类队伍参赛。模型在 24 小时内微调了多款中文语言模型,以及用于商品截图的 Qwen2.5-VL-7B,并将它们组合成一个投票系统。在 45 次提交中,准确率从 0.60 提升到 0.853。这使得 Qwen3.8-Max 的表现超过了 526 支人类队伍中的 458 支。
芯片设计和模拟财年测试长周期规划
另外两个案例研究针对的是跨越数百轮交互的任务。第一个案例中,Qwen3.8-Max 需要为加密方案设计一个加密构件。对于这类电路来说,关键的效率指标是它所需的逻辑门数量,也就是芯片上的基本单元。逻辑门越少,芯片就越小、越高效。该模型最初给出了一个可用但臃肿的设计,使用了 8,298 个逻辑门,并在大约 500 次迭代中将其缩减到 678 个逻辑门。
经过开源工具 OpenROAD 的自动布局步骤后,物理芯片面积从 106x106 微米缩小到 46x46 微米,减少了 81%。Qwen 团队表示,模型在数百次迭代之后仍持续做出深层结构性改动,而不是停留在表层微调。
第二个案例研究是 E-Commerce-Bench,这是一个基于来自淘宝和天猫匿名化数据、模拟整个财年在线零售运作的基准。模型从 100,000 元资金起步,需要全年并行经营多个网店。这意味着要采购商品、用自然语言与供应商谈判、调整价格、处理退货,并应对台风或供应链中断等危机。
在供应商池中还隐藏着 152 个骗子,模型需要将其识别出来。最终,Qwen3.8-Max 的余额达到 416,252 元,将初始资金翻了四倍。这比亚军 GLM 5.2 高出 38%,也超过其前代 Qwen3.7-Max 的 2.5 倍以上。该模型在年初进行了激进投资,并在假日季实现了超过 100,000 元的净利润。
多模态能力与无需源代码的应用重建
在多模态任务方面,Qwen3.8-Max 可以处理超过 200 页的文档和超过 100 小时的视频,团队表示。他们还推出了 RecreationBench,这是一个新的基准,要求模型在无法访问源代码的情况下重建正在运行的应用。
模型只能通过交互来观察目标应用,也就是说只能看到点击和键盘输入。测试覆盖 Ubuntu、macOS、Windows、Android 以及网页。与此同时,团队还发布了 Qwen-MM-Plugins,这是一个扩展库,可为现有智能体系统增加图像和视频处理、视觉工具调用以及多模态记忆。
Qwen 团队将模型能够维持如此长时间任务的能力归因于强化学习训练环境的大幅扩展。训练不再只聚焦于单一任务,还覆盖了多日工作流、而不是单个文件的嵌套目录结构,以及各种智能体执行框架。
团队内部在十多个基准上的评分指数从 0.474 上升到 0.725。模型在大约 4,000 个环境时表现最佳,此后分数略有回落。
中国开源模型竞赛升温
Qwen3.8-Max 最直接的对手也来自中国。月之暗面(Moonshot AI)于 7 月 27 日在 Hugging Face 上发布了开源权重的 Kimi K3,这是一款多模态混合专家模型,拥有 2.8 万亿参数和 100 万 token 的上下文窗口。除了权重之外,月之暗面还公开了其部分基础设施,包括注意力内核、MoE 通信库,以及用于大规模运行智能体的工具。不过,独立测试削弱了该公司的说法。K3 在网络安全能力和复杂数学方面都远远落后于西方顶级模型。
Qwen3.8-Max 现在已可通过 QwenCloud 使用。其权重计划于下周在 Hugging Face 和 ModelScope 上线。该模型同时支持 OpenAI 的 Chat Completions 格式和 Anthropic 的 API 协议,因此可以直接接入 Claude Code、Codex、Qoder CLI、Qwen Code 和 OpenClaw。一个名为 reasoning_effort 的参数允许用户在三档之间选择,在速度和彻底性之间进行取舍。
Qwen3.8-Max 并不是阿里巴巴近期新增的唯一产品。几周前,该团队推出了 Qwen-Image-3.0,这是一款面向信息密集型版面的图像生成器,支持最多 4,500 token 的输入,并且能够渲染小至 10 像素的可读文字。在规模的另一端,阿里巴巴也在继续推进 Qwen3.6-35B-A3B 这类小型开源模型;该模型共有 350 亿参数,但每次只激活 30 亿参数。
来源与参考
收录于 2026-08-04