Gemini 4 Argon缩小前沿人工智能差距
The Decoder··作者 Matthias Bastian
关键信息
该模型保留一百万输入词元的上下文窗口,可接收文本、图像、视频和音频,但只能输出文本;其“长解码续接”功能可以暂停并通过后续请求恢复长篇响应,以减少超时问题。目前公布的最高推理得分为53分,但Artificial Analysis估算促销价格下每项Intelligence Index任务成本为1.99美元,而且Argon据报道比部分竞争对手消耗更多词元。
资讯摘要
Google在超过七个月没有发布新的前沿模型后推出了Gemini 4 Argon,此前的相关产品是Gemini 3.1 Pro,而已经宣布的Gemini 3.5前沿模型最终被跳过。该模型让Google重新进入三家顶尖人工智能实验室之列,但Anthropic看起来仍保持总体领先。Argon最初将通过Fairwind计划提供给受信任的网络防御人员,同时供Google内部团队使用,并且这些早期用户获得的版本不设网络安全防护限制。Google表示,早期测试者的反馈将用于完善安全机制,之后才会向付费API客户、企业、开发者和Google AI Ultra订阅者开放,但公司尚未公布公开发布时间。
Argon的初始价格为每百万输入词元2美元、每百万输出词元10美元,缓存输入还可享受95%的折扣,即每百万词元约0.10美元。Google将输出上限从64,000词元提高到一百万词元,并称这是行业首创,同时将输入上下文窗口维持在一百万词元。Artificial Analysis在最高的“High”推理级别下给Argon打出53分,与GPT-6 Astra和Claude Fable 5.1并列,低于Claude Opus 5.5和Claude Sonnet 5.5,但比Gemini 3.1 Pro Preview提高了23分。

资讯正文
Google Gemini 4 Argon 缩小了与 OpenAI 和 Anthropic 的差距,但并未取得明确领先
要点
Google 发布了 Gemini 4 Argon,这是其最新的旗舰模型。该模型缩小了与 OpenAI 和 Anthropic 前沿模型之间的差距,并在一些关键基准测试中击败了其中部分模型。
一项新功能是:Argon 支持最多 100 万个输出 token,因此可以在单次运行中处理复杂推理,而不会超时。
Google 正在分阶段推出 Argon,初始价格为每百万输入 token 2 美元、每百万输出 token 10 美元;之后常规价格将上涨至 4 美元和 20 美元。缓存输入可享受 95% 的折扣。
Google 发布了 Gemini 4 Argon 这一新款前沿模型。它缩小了与 OpenAI 和 Anthropic 竞争对手之间的差距,并在一些关键基准测试中击败了其中部分模型。虽然它或许还不能明确地在所有模型中占据领先地位,但至少按初始价格计算,对于一款前沿模型来说相对便宜。
Argon 是 Google 在 Gemini 3.1 Pro 之后,时隔七个多月推出的首款前沿模型。这使这家广告巨头重新回到了顶尖三家 AI 实验室之列,不过 Anthropic 可能仍然保持领先。在经历了一段艰难而漫长的开发期后,原本已经宣布的 Gemini 3.5 前沿模型被完全跳过,Google 如今重新回到了竞争之中。
大多数用户还得等待
作为 Fairwind 计划的一部分,Argon 最初将提供给一批“值得信赖的网络防御人员”。他们以及 Google 内部团队将获得不受网络安全防护栏限制的模型。Google 以该级别 AI 能力需要采取“分阶段方式”为由,解释了逐步推出的安排。该公司还参与了美国政府的一项自愿计划,根据这项计划,政府机构可以在新模型公开发布之前访问这些模型。
早期测试人员的反馈将用于完善模型的安全机制。完成这一步后,Google 才计划向开发者、企业和消费者开放 Argon,首先面向付费 API 客户和 Google AI Ultra 订阅者。该公司尚未给出日期,只表示会“尽快”推出。
价格已经确定,至少初始价格如此:每百万输入 token 2 美元,每百万输出 token 10 美元。缓存输入 token 的价格低 95%,折合每百万约 10 美分。Gemini 3.8 Flash 的缓存折扣为 90%。这使 Google 的原始 token 价格远低于其他前沿模型,但 token 消耗量并不一定更低(见下文)。
*Google 并未明确说明这一数字,但表示缓存价格比常规输入 token 价格低 95%。
Google 还将输出上限从 64,000 个 token 提高到 100 万个 token,并称这是业内首创。其理念是,如果模型能够在单条轨迹中生成数十万个 token,就可以更全面地思考难题,并在一次运行中解决问题。为支持这一点,Google 正在 Gemini API 中加入一项名为“Long Decode Continuation”的新功能。它会暂停较长的响应,并通过后续请求恢复响应,从而避免推理过程因超时而中断。
输入上下文窗口仍为 100 万个 token。Argon 接受文本、图像、视频和音频作为输入,但只能输出文本。
Google Gemini 4 Argon 缩小了与 OpenAI 和 Anthropic 的差距,但并未取得明显领先
独立测试显示,Argon 的表现与 GPT-6 Astra 持平,但消耗的 token 更多
Artificial Analysis 提供了一份早期独立评估。在最高可用推理级别“High”下,Gemini 4 Argon 在 Artificial Analysis Intelligence Index 上获得 53 分。这一成绩与 OpenAI 的 GPT-6 Astra(max)和 Claude Fable 5.1 持平,并领先 GPT-6.1 Sol(max)1 分。
Artificial Analysis 还强调了 Argon 较低的幻觉率。在测试事实知识以及诚实处理知识盲区能力的基准测试 AA-Omniscience 中,Argon 的幻觉率为 15%。GPT-6 Astra(max)为 51%,GPT-6.1 Sol(max)为 54%。与其猜错,Argon 更有可能承认自己不知道答案。不过,它的准确率只有 50%,比 Gemini 3.1 Pro Preview 低 5 个百分点,比 GPT-6 Astra(max,为 63%)低 13 个百分点。在该基准测试的总分上,Argon 获得 42 分,与 GPT-6 Astra(43 分)和 GPT-6.1 Sol(42 分)大致相当。
Google 自己的基准测试结果则显得乐观得多。Argon 在其中大多数基准测试中都处于领先,有时优势还相当明显。
一如既往,AI 模型必须在现实世界的使用中证明自己,而表现不仅取决于模型本身,也取决于包裹在模型外部的软件。当前这正是 Google 的弱项:与 Claude Cowork 和 ChatGPT Work 相比,Gemini 应用仍然落后。
Argon 在文本的人类偏好排名中名列前茅
根据 Arena 的数据,Argon 在编程、困难提示词、指令遵循、较长查询和创意写作方面处于领先地位。它还在所有评估的专业领域中排名第一,并在英语、中文、俄语查询以及总体非英语查询中排名第一。
网页开发方面的结果则较为普通。在 Code Arena: WebDev 中,Argon 获得 1,679 分,排名第八。相比 Gemini 3.8 Flash(High),它提高了 96 分,排名也从第 29 位跃升,但仍未进入顶尖位置。
在性价比方面,Arena 将 Argon 排在所有竞争者之前。按每百万 token 8 美元的综合费率计算,Argon 推动了 Text Arena 的帕累托前沿,目前是该排名中成本效益最高的模型。
来源与参考
收录于 2026-10-02