英伟达优化控制层使编码代理令牌用量近乎减半
The Decoder··作者 Jonathan Kemper
关键信息
SoL-Pi 在 535 个可执行环境中探索了 152 个优化方向,完成了 3,000 多次运行和超过 60,000 次代理与环境交互。研究人员报告了四种机制:Action Fusion、Online Context Compact、ObservationPack 和 Evidence-Preserving Reducer;不过,该系统只基于 GPT-5.6 Sol 的轨迹进行优化,应用于 Opus 5 时触发这些机制的频率和强度都较低。
资讯摘要
英伟达的 SoL-Pi 研究针对的是编码代理的控制框架,而不是语言模型本身。这个控制框架负责决定代理如何观察状态、调用工具、管理上下文、处理反馈、验证结果,以及是否继续运行或终止任务。由于这些功能彼此紧密耦合,在一个环节节省令牌可能在其他环节引发错误,或只是把成本推迟到后续阶段,因此人工优化十分困难。SoL-Pi 让一个研究代理检查另一个代理的执行轨迹,提出控制框架修改方案,并在准备好的环境中测试这些方案。在 535 个环境中,研究包含 495 个源自 GitHub issue-pull-request 对的任务和 40 个合成测试案例,探索了 152 个方向,完成了 3,000 多次运行以及超过 60,000 次代理与环境交互。
为降低过拟合风险,研究人员将 EdgeBench 的评估任务与搜索过程完全隔离:51 个公开任务中有 11 个用于最终候选方案的一次性验证,另外 40 个保留到最终评估。最终产生的机制包括合并连续操作、压缩上下文、归档并概括较长的工具输出,以及使用更便宜的模型压缩错误和测试日志,同时检查是否遗漏关键信息。研究人员估计,与原生 Codex 和 Claude Code 控制框架相比,每小时可节省 8.75 至 13.50 美元;与 Pi 相比,每小时可节省 4.36 至 5.71 美元。将未经修改的系统应用于 Opus 5 时,SoL-Pi 保留了 Pi 约 94.3% 的性能,并实现了相近的节省幅度。

资讯正文
一篇新的 Nvidia 论文介绍了一种能够自动优化编码代理控制层的系统,这一控制层被称为 harness。研究人员称,在性能基本保持不变的情况下,Token 使用量可减少近一半。
AI 代理在无人监督的状态下运行得越久,成本就越高。单次预测会变成长串的推理、工具调用和反馈循环,Token 使用量也会随之急剧膨胀。
Nvidia 研究人员开展的一项新研究并未从模型层面着手降低这些成本,而是将目标放在 harness 上。Harness 是模型与其环境之间的控制层,Codex、Claude Code 或 OpenClaw 等系统都使用了这种控制层。
Harness 控制代理如何查看状态、执行操作以及处理反馈。迄今为止,大多数提高效率的方法都集中于通过更快的注意力内核和服务基础设施降低每个 Token 的成本,采用量化等模型压缩方法,或换用成本更低的模型。
AI 探索 152 个方向,以寻找更精简的控制逻辑
在实践中,优化 harness 很困难,因为工具使用、上下文管理、验证和中止逻辑都紧密耦合。某项改动可能在一个环节节省 Token,却在其他地方触发错误,或者只是把成本推迟到后续阶段。通常情况下,人类需要筛查冗长的执行轨迹,并将反复出现的失败模式转化为代码。
这个名为 SoL-Pi 的系统将这项工作自动化。一名研究代理会观察另一名代理的执行轨迹,提出改动,并在预先准备好的环境中进行测试。系统通过能力和效率检查来决定哪些候选方案能够保留下来。论文作者称,这种方法借鉴了递归式自我改进。
在 535 个可执行环境中,该系统探索了 152 个方向,其中包括从 GitHub issue—pull request 对中提取的 495 个任务,以及 40 个合成测试用例。整个过程总共生成了 3,000 多次运行,并完成了超过 60,000 次代理与环境之间的交互。研究人员表示,这一规模体现了系统搜索范围之广,但搜索得更多并不会自动带来更好的结果。这在此处构成了一项风险,因为早期研究表明,自动优化的 harness 往往会对训练任务过拟合,在不熟悉的任务上几乎没有收益。
SoL-Pi 通过严格分离搜索反馈与评估来应对这一问题。研究人员使用 EdgeBench 作为测试基准,并将其与搜索过程完全隔离。在其中的 51 个公开任务中,他们选取 11 个对最终候选方案进行一次性验证。剩余的 40 个任务被保留用于最终评估,而这些结果从未反馈回搜索过程。
消除无效工作的四种机制
搜索过程产生了四种机制。Action Fusion 会将连续的两个步骤合并为一个步骤,例如将代码编辑与测试运行合并,从而省去一次完整的语言模型调用。Online Context Compact 会在每个规划步骤之后运行,并在不丢失重要信息的情况下,尽可能裁剪累积的上下文。
ObservationPack 会归档较长的工具输出,并在后续步骤中加入简短摘要,而不是每次都重新发送完整文本。Evidence-Preserving Reducer 会将大型错误日志和测试日志交给成本更低的模型,由后者提炼出关键发现,并通过自动验证步骤捕捉任何遗漏的重要线索。
按美元计算,作者估计,与原生 Codex 和 Claude Code harness 相比,该系统每小时可节省 8.75 至 13.50 美元;与 Pi 相比,每小时可节省 4.36 至 5.71 美元。这些估算基于当前的 API 价格。
研究人员只使用 GPT-5.6 Sol 构建了该系统,随后未作任何修改便将其应用于 Opus 5。在后者上,该系统以类似的节省幅度保留了 Pi 94.3% 的性能。不过,在 Opus 5 下,这些机制触发的频率更低、力度也更弱。研究人员认为,这是因为该 harness 仅针对 GPT-5.6 Sol 的运行轨迹进行了优化。
在其他基准测试中,结果则更加复杂。
在 EdgeBench 之外,情况更加多元。在 Terminal-Bench 4 的 63 个 CPU 任务中,SoL-Pi 只解决了 15 个任务,而 Codex 和 Pi 各解决了 18 个。不过,总成本仍比 Pi 低约四分之一。
在 2026 年国际数学奥林匹克竞赛(IMO 2026)的形式化验证 Lean 4 任务中,该系统以每个已解决问题的最低成本攻克了六道题中的三道。在一项内核优化实验中,由 20 个 SoL-Pi worker 组成的集群,与规模相当的 Pi 集群相比,成本降低了 26.8%。
效率提升也伴随着权衡,因为更短的上下文可能会减少提示缓存的复用。在一次测试运行中,总成本仍从 1,339 美元降至 894 美元。展望未来,作者建议在大量任务上对 harness 进行预训练,方式类似于模型的预训练;同时,使用一个已经足够精简的 harness,从而降低寻找其后继版本的成本。他们将这种递归式效率提升称为一种愿景,而不是当前研究得出的结论。
今年 8 月,工具公司 Composio 进行的一项测试清楚表明,harness 会在多大程度上影响智能体的成本。该公司让 Deepseek V4 Flash 在包括 Claude Code 和基于 Pi 的 Oh My Pi 在内的四种智能体框架中运行。尽管执行任务的是同一个模型,但每个已解决任务的成本相差近三倍。
由于智能体消耗的 token 越来越多,定价和优化压力也在持续增加。OpenRouter 分析师 Peter Walker 表示,自 2026 年 2 月以来,智能体 token 的使用量增长了 14 倍,其中近 70% 来自缓存提示。
不过,SoL-Pi 所采用的这类上下文压缩也可能带来副作用。一项研究发现,压缩平均只能保留 17% 的用户指令。并行智能体同样会推高成本。Codex 开发者 Eric Provencher 最近警告说,使用两个以上的子智能体几乎总会在无法提升质量的情况下消耗 token,因为它们大部分时间都花在检查彼此的工作上。
来源与参考
收录于 2026-09-27