中国AI进展不该再让人意外
The Verge AI··作者 Robert Hart
关键信息
文章指出,在 OpenRouter 以 token 消耗和基准测试衡量的排行榜上,前 10 个 AI 工具里有 6 个来自中国,而且中国模型与美国前沿系统之间的性能差距正在缩小。文中还强调,Moonshot 和阿里巴巴都计划以开源权重方式发布新模型,这将允许开发者下载并修改训练得到的核心参数,与美国领先实验室普遍采用的封闭模型方式形成鲜明对比。
资讯摘要
The Verge 认为,真正令人意外的并不是中国 AI 公司发布了有竞争力的新模型,而是市场总把这类发布当成“意外”。文章一开始就描述了两家中国 AI 公司发布新模型后引发的连锁反应,包括媒体称其震动美国科技行业、扰动市场,甚至被比作“AI 版 Sputnik 时刻”。作者把这种反应与此前 DeepSeek 的出圈联系起来,指出当时外界也曾把它视为对前沿 AI 成本假设的挑战。文章强调,中国与美国模型之间的性能差距已经缩小了相当长一段时间,而中国系统如今已经跻身全球最常用、也最具竞争力的 AI 产品之列。文中援引 OpenRouter 数据称,在按 token 消耗和基准测试统计的前 10 个 AI 工具中,有 6 个来自中国,而且中国模型通常更便宜。
随后,文章聚焦 Moonshot AI 的新旗舰模型 Kimi K3,称其据公司说法几乎超过所有美国模型,仅落后于 OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Claude Fable 5,并且其定价为每百万输出 tokens 15 美元,而对手大约分别是 30 美元和 50 美元。Moonshot 还表示,发布后需求过于强劲,以至于一度暂停了新订阅。几天后,阿里巴巴又预览了 Qwen3.8,并将其描述为当前最强大的模型之一,仅次于 Fable 5。文章最后指出,这两家公司都计划以 open weight 形式公开旗舰模型,这意味着开发者可以下载、使用并修改模型训练形成的核心参数,这与美国领先 AI 实验室普遍采取的封闭式专有路线形成了对比。

资讯正文
上周,两家中国人工智能公司发布了新模型,并表示这些模型有能力与 OpenAI 和 Anthropic 的最佳系统正面竞争。市场迅速作出反应,而且反应并不意外。股市出现波动,评论人士宣称硅谷“震惊了”,政策制定者则重新拿出那套熟悉的军备竞赛和“警钟敲响”的说法。
在一则标题中,美联社称,一款中国模型让“美国科技行业大吃一惊”。彭博社则将其描述为一种“令人意外的突破”,正在“搅动市场”,并引发全球科技股下跌,因为市场担心这可能迫使美国公司重新思考其在数据中心、芯片和其他 AI 基础设施上的巨额支出。Business Insider 质疑这次发布是否是“下一个 DeepSeek?”,指的是去年让美国 AI 行业措手不及的那款中国模型。Xprize 创始人 Peter Diamandis 甚至将这次发布称为美国的“AI 斯普特尼克时刻”,借指冷战高峰时期苏联发射人造卫星、促使美国大幅加大对科学和航天项目投资的历史事件。当然,DeepSeek 当时也曾被广泛形容为美国的 AI 斯普特尼克时刻;之所以说那种类比当时没那么突兀,是因为 DeepSeek 似乎几乎没有预警便突然出现,挑战了人们对前沿 AI 成本的主流假设,并立即在科技和金融领域引发反应。
真正令人意外的是,这些模型发布竟然本身就被视为意外。多年来,人们一直被提醒中国正在 AI 领域迎头赶上。然而,当这一时刻似乎真的到来时,世界仍然感到震惊。
美国和中国公司训练了全球几乎所有最常用的 AI 模型,而在 OpenRouter 按 token 消耗和基准测试追踪的排行榜前十名 AI 工具中,有六个来自中国。性能差距已经缩小了一段时间,Z.ai 和 DeepSeek 等公司最近推出的模型被认为与 Anthropic 和 OpenAI 等美国实验室的顶级产品极具竞争力。中国模型的使用成本也明显更低,而报道显示,随着使用美国本土供应商的成本飙升,美国公司正越来越多地转向中国工具。
北京也一直热衷于支持本土 AI 努力,包括通过激励和资金支持创新,以及打击试图摆脱中国关联的企业。与此同时,华盛顿的 AI 战略往往在两种极端之间摇摆:一边是强硬干预,令盟友质疑美国的可靠性;另一边是放任市场自行修正的自由放任假设。面对一个准备将国家全部力量集中到单一技术目标上的竞争者,这样的做法很难维持下去。
总部位于北京的创业公司 Moonshot AI 是中国领先的 AI 模型开发者之一,周五发布了一款新的旗舰模型,声称其性能超过几乎所有美国模型,仅落后于 OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Claude Fable 5。Moonshot 还对 Kimi K3 采取了激进定价,按每百万输出 token 收取 15 美元,而 GPT-5.6 Sol 约为 30 美元,Fable 5 则为 50 美元。Moonshot 表示,发布后需求极为强劲,以至于服务一度被挤爆,公司暂时暂停了新的订阅。多数回应主要集中在这次发布上。
几天后,中国科技巨头阿里巴巴又发布了 Qwen3.8 的预览版。它将这款新模型描述为“当今可用的最强模型之一”,并称其“仅次于 Fable 5”。这进一步加剧了 Kimi K3 引发的轰动。
关键在于,两家公司都计划将各自的新旗舰模型公开提供。Moonshot 和阿里巴巴都表示,他们计划以开源权重的形式发布模型,这将允许开发者下载、使用并修改 AI 训练过程中形成、并影响其响应的核心参数。与此形成鲜明对比的是,大多数领先的美国 AI 实验室,包括 OpenAI、Anthropic 和 Google,采取的是封闭、专有的前沿模型路线。
其中的经济学问题尤其值得仔细审视。关于中国公司是否——如美国企业所指控的那样——使用美国模型来训练自己的模型,从而以极低成本提升性能,这一争议一直未有定论。不同模型之间的 token 并不能直接比较,仅看 token 价格也无法完整反映使用一个 AI 系统的成本。比如,更昂贵的模型可能用更少的 token 生成更好的回答。企业也经常通过补贴推理成本来争夺客户。换言之,更便宜并不自动意味着更好,甚至也不一定意味着总体成本更低。
不过,仍然存在一种可能:最终中国实验室会产出这样的模型——它们不只是便宜的替代品,而是能够真正与美国竞争对手相匹敌,甚至超越它们的系统。即便那些略微落后于前沿的公司,只要模型足够好、部署更容易或更便宜,或者提供条件更有吸引力,仍可能产生巨大影响。这可能会直接影响美国公司、更广泛的经济以及国家安全。
Anthropic 和 OpenAI 都在为可能达到万亿美元级别的 IPO 做准备,而它们的估值在一定程度上取决于这样一种预期:它们将主导全球 AI 市场。具备能力的中国模型正在挑战这一假设,并且可能会分流客户、压缩利润率,并削弱支撑这些估值的增长预期。鉴于美国 AI 的成本已经如此高昂,据报道,一些美国初创公司已经开始转向更便宜的中国模型。更广泛的市场风险也同样存在,且远不止少数几家 AI 公司。科技股在美国市场中的占比异常之高,而近来其中很大一部分增长都与这样一种预期有关:AI 需求将继续飙升。企业已将数千亿美元投入数据中心、芯片、能源以及其他基础设施,而这一切都建立在美国公司将继续占据主导地位的假设之上。如果中国实验室能够争取到其中一部分需求,或者证明这些模型可以以更低成本生产和运行,投资者就不可避免地会质疑这些支出是否合理。考虑到其中涉及的资金规模,他们的任何重新评估都会在这些行业中引发连锁反应,也会波及数以百万计把储蓄或养老金暴露于这些行业的人。
安全方面也有考量。能力很强的开源中国模型,即便仍落后于美国前沿水平,也可能让更广泛的用户获得先进 AI 系统,尤其是在美国公司限制访问或施加更严格防护的情况下。当美国政府要求 Anthropic 限制其最新模型的访问权限时,网络安全领域的领导者警告说,这样做会让防御者更难发现并修复漏洞。如果其他地方也能获得可比模型,这些限制就更难自圆其说。被拒绝访问美国模型的组织,可能会觉得不得不依赖中国替代品来保护自己的网络,否则就只能接受更高的风险,任由攻击者使用同样的工具。已经开始出现这样的报道:Kimi K3 识别并修复了网络安全漏洞,而 OpenAI 的 Codex 和 Anthropic 的 Fable 因安全护栏而不会触碰这些问题。即便能力没那么全面的模型也仍然可能构成威胁,而有些模型看起来已经在这样做了。6 月,中国的 Z.ai 声称其 GLM-5.2 模型在网络安全任务上的表现可以与 Anthropic 的 Mythos 相媲美,尽管它在更一般性的任务上仍然落后。
由于这两款模型都尚未全面发布,因此仍然很难独立评估它们到底有多强,而公司公布的基准测试说法也应谨慎看待。尽管如此,公开层面上几乎没有人暗示,这些公司在性能结果上存在根本性的误导。
但准确排名几乎无关紧要。无论 Kimi K3 和 Qwen3.8 最终被证明是位列全球前五的模型,还是仅仅排进前十,更广泛的结论都一样:中国领先的 AI 公司如今正在产出一些系统,它们完全有可能与美国顶尖实验室推出的模型相抗衡。而且,这样的情况正在越来越频繁地出现,以至于每一次新发布都不应再被视为一次震惊,更不该被当作又一个“DeepSeek”或“Sputnik 时刻”那样具有标志性的激励事件。如果这真是一场竞赛,那么现在是时候承认:别人也许真的会赢,或者至少会逼近到几乎等同于赢了的程度。
来源与参考
收录于 2026-07-22