Nvidia证明代理系统中支架比模型更重要
TechCrunch AI··作者 Julie Bort
关键信息
ARC-AGI-3 是一个由 2D 游戏组成的交互式推理基准,没有任何说明,100% 的分数意味着代理能像人类一样高效地赢下每个游戏。Nvidia 使用了自己增强版的支架,名为 Agentic Variation Operators(AVO),并表示其中的监督者组件像“CEO”一样,在代理走偏或陷入死胡同时进行纠正。
资讯摘要
Nvidia 在周五发布的新研究指出,对于长链路代理任务来说,包在 AI 模型外面的支架,可能比模型本身更重要。这里说的支架,是指让模型变成代理的那层软件脚手架,包括工具、记忆管理、规则、运行时行为和反馈回路。研究人员用 Claude Opus 5 测试了 ARC-AGI-3 这个交互式推理基准。ARC-AGI-3 由一组没有说明的 2D 游戏组成,要求模型像人类一样自己摸索规则并完成目标。通过一个针对记忆和监督能力进行调整的定制支架,研究团队让 Claude Opus 5 达到了 100% 的成绩,意味着它能像人类一样高效地通关所有游戏。
若不使用这套支架,同一个模型只得到 30%,但这仍然是测试中所有模型里的最高分。Nvidia AI 产品副总裁 Adel El Hallack 对 TechCrunch 表示,代理不应只被理解为模型 API,而应被看作模型加上周边脚手架、工具、运行时和库的整体。研究还加入了一个监督者组件,当代理走偏或陷入死胡同时,它可以把代理拉回正轨,Nvidia 将其类比为一个“CEO”来进行方向纠偏。OpenAI 上个月也有类似发现,只是通过调整支架里的两个设置,就把 ARC-AGI-3 分数提升了三倍,但仍未达到 Nvidia 这次的水平。Nvidia 也强调,这不是一款新产品发布,而是其 Nemo 生态中一系列开源和商业组件的一部分。

资讯正文
英伟达周五发布了一项有趣的新研究,暗示在让 AI 执行长周期任务时,真正更重要的其实是 harness,而不是底层模型本身。harness 指的是围绕 AI 模型的软包装层——把原始模型变成能够自主行动的东西所需的工具、记忆管理和规则。
简而言之:研究人员仅仅通过使用一个经过定制、专门针对良好处理记忆进行调校的 harness,并加入一个类似“主管”的监督组件,就让 Claude Opus 5 在交互式推理基准 ARC-AGI-3 上拿到了 100% 的成绩。ARC-AGI-3 是一组没有说明文字的 2D 游戏,模型必须像人类一样自己摸索出玩法并赢得游戏。(这项基准尤其让竞争对手前沿实验室 OpenAI 感到恼火。)如果没有这个 harness,Opus 5 的得分只有 30%,但这已经是所有测试模型中的最高结果。
英伟达的这项研究再次表明,尽管模型选择确实重要,但模型本身——也就是充当智能体“脑子”的部分——只是智能体系统中的较小一环,很多 AI 用户对此的认识并不充分,尤其是在长周期任务中。harness 才是让模型成为智能体的关键:它负责记忆、上下文和反馈。
英伟达 AI 部门产品副总裁 Adel El Hallack(见上图)对 TechCrunch 表示:“一般来说,外界几乎把智能体理解成模型的一个 API。”但实际上,智能体远不止如此。“它包括模型本身,也包括围绕模型的支架,我们称之为 harness,也就是它所使用的一组工具。还包括运行时环境,以及我们赋予它访问权限的相关技能和库。”
长周期任务指的是需要把许多决策串联起来、有时甚至持续数天,才能产出完整工作的任务。这与 AI 仅仅对提示词输出一个回复截然不同。如何让 AI 在执行长周期任务时既不分心又不“神游天外”,是智能体研究中的圣杯之一。
例如:微软在 4 月发布了一项研究,对 19 个 LLM 进行了涉及文档编辑的长周期任务测试,结果发现包括前沿模型在内的所有模型都会把文档填满错误。(如果人类产出这样的工作,恐怕会立刻被解雇。)
模型自行串联决策时,也曾被发现会删除用户文件,甚至删除整个数据库,或者为了达成目标而走向犯罪行为,从合谋到黑客攻击无所不包。
英伟达研究人员选择这项交互式推理基准来进行测试,颇具意味,甚至有点滑稽。100% 的成绩意味着模型能够像人类一样通关这些游戏。
OpenAI 由于其模型在 ARC-AGI-3 上的糟糕得分(低于 10%)而大为恼火,因此上个月也进行了自己的研究。和英伟达一样,OpenAI 发现仅仅调整 harness 的两个设置,就能让其模型的得分翻三倍。
但没有任何一个模型接近英伟达研究人员所达到的 100% 得分。他们表明,harness 还需要一个“主管”组件:当智能体陷入困境时,它会朝正确方向推一把。
“更有意思的部分,是在负责执行工作的主代理之外,再引入一个监督代理,”El Hallack说。它“几乎就像一个CEO,当代理偏离方向,或者开始探索一条可能走进死胡同的路径时,去提醒它;或者让它重新探索之前走过的一条路径。”
尽管监督代理这一概念并不算新,但如今大多数使用 agent 的人,在他们的 harness 上只依赖一层,比如 Claude Code、Codex 或 Hermes。Nvidia研究人员则创建了自己的增强版 harness,名为 Agentic Variation Operators(AVO)。
需要注意的是,这并不是一款新的Nvidia产品。相反,Nvidia在 Nemo 品牌下生产了大量用于构建 harness 的开源技术碎片。其中一些技术是商业化的,但更多是公开可用的。
不过,Nvidia的结果进一步增加了越来越多的证据:模型选择绝不是影响 agent 性能的唯一因素。比如在7月,Databricks 发布了一项令人震惊的研究,显示与模型相比,harness 对 AI 成本的影响要大得多。
Databricks首席执行官Ali Ghodsi对TechCrunch说:“你可以选同一个模型,但用不同的 harness;如果你用了错误的 harness,成本会显著更高。” “所以你会想,哦,这是个昂贵的模型。这是个便宜的模型。但等等,你用的是哪个 harness?这本身就能让你的成本翻倍。”
Nvidia更大的观点,是要表明开源 harness 和开源模型一样,让用户对系统的掌控远超他们的想象。
El Hallack说:“我们相信,并且我们正在通过生态系统展示,开放的 harness 如何让你转动更多调节旋钮,从而提升准确性。” 他说,这与OpenAI放慢模型训练速度有关,原因是模型会带来安全漏洞。
“我们相信,拥有一个开放的 agent 技术栈——你可以在 harness、基础设施、运行时各层面都拥有控制权——是我们推动生态系统前进并确保安全所必需的,”他补充道。
来源与参考
收录于 2026-08-22