Google研究人员推出RRSI防止智能体过拟合测试
The Decoder··作者 Jonathan Kemper
关键信息
RRSI限制每次候选修改可以包含的独立编辑数量,并逐步缩小编辑预算、记录失败尝试,在进展停滞时探索尚未修改的工具框架组件,还利用批评器拒绝硬编码任务名称、答案或其他基准专用技巧。研究人员在八个涵盖编程、办公智能体工作和工程设计的基准上进行了测试,整个过程中底层的Claude Opus 4.8模型保持不变。
资讯摘要
现代人工智能智能体通常由一个固定的语言模型和一个工具框架组成,后者决定每一步使用哪些提示词、工具、记忆、工作流和控制逻辑。工具框架会影响智能体是否读取正确文件、能否从错误中恢复,以及能否清晰地交付结果;研究人员认为,近期智能体能力的许多进步来自对这一外围系统的改进。过去,工具框架优化主要依靠人工检查失败运行并手动修补,而较新的方法则让语言模型根据有限测试任务的反馈反复重写工具框架。论文指出,这种过程可能导致智能体记住基准特有的模式,偏爱因偶然因素得分较高的候选方案,并增加不会提升通用能力的额外复杂度。
RRSI通过限制每个候选方案包含的编辑数量、随时间缩小编辑预算、记录既往尝试,以及在进展停滞时探索新的工具框架组件来应对这一问题。它还使用批评器拒绝编码任务名称、答案或其他基准专用技巧的修改;只有能带来可测量性能提升时,系统才接受更高的计算成本,并会删除不再有帮助的组件。研究团队使用保持不变的Claude Opus 4.8模型,在八个基准上进行测试;据报告,RRSI在训练任务上的分数最高提升14.1分,在未见基准上的分数最高提升4.7分,运行时令牌使用量约减少30%,并且在任何未见基准上都没有低于基线。

资讯正文
Google 研究人员找到一种方法,防止自我改进型 AI 智能体记住测试题
那些持续优化自身工作环境的 AI 智能体,很快往往会在测试任务上过度专门化。Google Cloud AI Research 与多所大学共同提出了一种新方法,旨在防止这种情况,同时降低计算成本。
现代 AI 智能体会将一个固定的语言模型封装在所谓的 harness 中。这是一套由提示词、工作流、工具、记忆和逻辑组成的框架,用于控制模型在每一步能看到的内容。
harness 决定智能体是否会在修改文件前读取正确的文件,是否能从错误中恢复,以及是否能整洁地交付结果。根据一篇新的研究论文,智能体近期取得的许多进展都来自对 harness 的改进,而不是来自新模型。
直到最近,这项工作一直由人工完成。人们会检查失败的运行结果,然后手动修补 harness。较新的方法则通过让语言模型根据测试任务的反馈一次又一次地重写 harness,实现了这一循环的自动化。
研究人员将其称为一种实用形式的递归自我改进。系统生成反馈,并利用这些反馈优化 harness;而 harness 又反过来控制系统自身的行为。
自我优化会导致智能体记住测试任务
论文显示,这种自我优化也伴随着一个问题。由于智能体持续处理同一组有限的测试任务,最终会把这些任务记住。它在训练任务上的得分不断提高,但在全新、未见过的任务上的提升却会缩小,甚至完全消失。
研究人员表示,这种情况会以多种方式发生。搜索过程会记住只适用于某个特定基准测试的模式,会偏好那些纯粹因偶然性而得分较高的候选方案,还会不断叠加不必要的复杂性,在提高测试分数的同时,却没有让智能体变得更好。
其他方法主要是在训练任务上取得改进,但其中很少一部分能迁移到未见过的基准测试上。RRSI 在全部三个领域都提高了这些任务上的得分。图:Google
缩小编辑预算,加上严格的评审机制,让 harness 保持通用性
RRSI(Regularized Recursive Self-Improvement of Agent Harnesses,智能体 Harness 的正则化递归自我改进)作用于优化循环的两端,同时让 harness 保持完全可编辑状态。当系统提出新的修改时,预算会限制单个候选方案一次可以捆绑的独立编辑数量。
这一预算会随时间逐渐缩小。早期轮次允许进行较大规模的重写,而后期轮次只允许进行能够明确追溯到某项结果的小幅修改。系统还会记录此前的尝试,以免不断追逐同样的失败想法。当进展陷入停滞时,它会有意对尚未触及的 harness 部分进行实验。
RRSI 会在两个环节约束自我优化:提出新修改时,以及决定哪些修改最终成为 harness 的永久组成部分时。图:Google
在挑选修改时,一名评审者会检查每一项提案,并淘汰任何将任务名称、解决方案或其他特定于基准测试的技巧硬编码进去的提案。另一条规则规定,只有当更高的计算成本能带来可测量的性能提升时,系统才会接受这一成本增加。不再发挥作用的组件则会被移除。
放弃训练任务上的收益,最终会在新任务上得到回报
Google 研究人员找到了一种方法,可防止自我改进的 AI 代理记住测试内容
研究人员在涵盖编程、代理式办公工作和工程设计的八项基准测试上,对 RRSI 进行了测试。底层模型 Claude Opus 4.8 在整个过程中始终保持不变。研究团队将 RRSI 与未经修改的基线 harness 以及另外四种近期的优化方法进行了比较。
论文称,RRSI 在接受训练的任务上最高可提升 14.1 个百分点,在五项从未见过的基准测试上最高可提升 4.7 个百分点。与未进行正则化的版本相比,它在运行时使用的 token 数量还减少了约 30%。在所有未见过的基准测试中,整体性能从未低于基线,而对于记住了测试任务的 harness 来说,这种情况通常会发生。
RRSI harness 在训练集之外的每项任务上也都有所提升,其中在 JobBench 上的增幅最大,达到 4.7 个百分点。| 图片:Google
所有方法在训练任务上都表现良好,但在新任务上的结果却发生了逆转。其中两种方法的表现甚至低于基线 harness。RRSI 在所有变体中的训练增幅最小,同时也是唯一一种在未见任务上明显高于基线的方法。这些限制措施正是为了实现这种取舍而设计的。
在经过优化的 harness 中,RRSI 所需的 token 和步骤最少,并且在新任务上的表现最好,不过未经修改的基线 harness 甚至更加精简。| 图片:Google
在一个模型上优化的 harness 也能帮助较弱的模型
作者指出,他们的研究仅涵盖围绕冻结模型构建的 harness,并未涉及模型权重发生变化的情况。
他们总结称,只有当反复获得的反馈被转化为持久性改变时,自我改进才能让 AI 代理可靠地变得更强大。相关代码已发布在 GitHub 上。
正如 ARC-AGI-3 上的测试所显示的那样,手动设计的 harness 往往无法泛化到新任务。在一个专门构建的 harness 下,Opus 4.6 在熟悉的环境中取得了 97.1% 的得分,但在陌生环境中得分为 0%。Nvidia 最近展示了 SoL-Pi,这是一种相关方法,研究代理可以利用它自动重建编程代理的 harness。该方法最多可减少 49% 的 token 使用量,同时不会造成明显的性能下降。
在此之前不久,Google 还让代理“梦见”过去的搜索运行过程,以改进其搜索策略。那项工作同样不会改变模型本身。
来源与参考
收录于 2026-10-05