Dream-RSI 让人工智能代理通过重放历史搜索实现改进
The Decoder··作者 Jonathan Kemper
关键信息
Dream-RSI 只在已记录的搜索树中测试替代决策,因此重放阶段不会创造完全全新的解决方案,并且依赖历史搜索记录的质量与覆盖范围。在一项报告的基准测试中,Gemini 3.1 Pro 将平均运行时间从 3,587 毫秒降至 2,931 毫秒,将尝试次数从 550 次降至 317 次,而 SimpleTES 需要 51,200 次运行。
资讯摘要
自我改进的人工智能代理通常会提出解决方案、评估结果、从结果中学习,然后不断重复这一过程。面对复杂的搜索问题,核心难点在于探索:代理必须决定追踪哪些有希望的方向、哪些方向应并行尝试,以及哪些失败路径应当放弃。固定策略可能让代理反复走入相同的死胡同,而通过实时实验调整策略又需要大量昂贵的尝试。Dream-RSI 的做法是保存已完成搜索中的决策和结果,并在之后重放这些记录。
重放过程中,代理可以测试如果当初优先选择其他分支或更早放弃某些路径,结果可能会怎样,而不必重新生成或评估已经记录的解决方案。研究人员将这一过程称为“做梦”,代理会先选择更好的策略,再将其用于下一次真实搜索,并在循环中继续改进。研究团队使用 Gemini 3.1 Pro 和 Gemini 3.7 Flash,在三个领域的八项任务上测试了该方法;结果显示,它能以更少的尝试获得更快或更好的结果,其中一项统计程序任务生成的代码在全部六个测试数据集上都快于 sklearn 和 glmnet。

来源与参考
收录于 2026-09-20