AllSpark 发布高性能开放权重搜索智能体
The Decoder··作者 Jonathan Kemper
关键信息
Iris-mini 基于 Qwen3.6-35B-A3B,Iris-pro 基于 Qwen3.5-397B-A17B,两者都使用 256,000 个词元的上下文窗口,并以不配备辅助智能体或最终验证步骤的单智能体形式进行评测。论文还指出,上下文管理技术可能显著影响基准分数,因此启用外部流程后的结果未必只反映模型本身的能力。
资讯摘要
AllSpark 发布了 Iris-mini 和 Iris-pro,这两个开放权重智能体旨在自主开展网页研究。搜索智能体需要理解问题、选择查询、阅读返回页面、连接不同来源的证据,并判断是否已经收集到足够信息;不过,文章指出,当前领先系统在许多基准测试中仍主要使用搜索来确认预训练阶段已经获得的知识。Iris-mini 拥有 350 亿参数,基于 Qwen3.6-35B-A3B;Iris-pro 拥有 3970 亿参数,基于 Qwen3.5-397B-A17B;两者都支持 256,000 个词元的上下文窗口。它们的训练数据从网页及其外链结构反向构造:系统先从一个种子页面和外链出发,建立术语与关系图,再生成必须沿多个关联步骤推理的问题。
除最终答案外,其他术语都会被改写为同义表述,使问题无法通过简单的文本搜索直接解决;只有那些参考模型在没有工具时无法解决、但使用正确来源后能够解决的问题,才会进入数据集。教师模型会生成包含推理、搜索查询和结果的解决路径,随后经过正确性、重复循环、搜索深度以及逐步质量等多轮筛选。训练过程交替进行监督微调和强化学习,团队将其称为“SFT-RL climbing”,并把每轮中最难且已经解决的任务和效率较高的路径反馈到下一轮。论文报告称,Iris 在多个搜索基准上表现强劲,并且在未直接训练过的通用工具使用和办公任务上也有所提升;同时,团队强调上下文管理可能显著影响不同系统之间的比较。

资讯正文
Iris-mini 和 Iris-pro 是同级别中最强的开放权重搜索智能体
AllSpark 团队发布了 Iris-mini 和 Iris-pro 两款开源搜索智能体,并公布了完整的训练方案。论文称,这些训练数据和模型还提升了它们在从未接受过训练的任务上的表现,包括通用工具使用和办公工作。
基于语言模型构建的搜索智能体能够自主研究互联网。它们需要理解问题、决定要搜索什么、解读搜索结果,并判断自己是否已经为回答收集了足够的证据。模型究竟在多大程度上完成了这些工作,目前仍存在争议。在成熟的基准测试中,此类领先的 AI 系统大多只是利用互联网来确认它们在训练期间已经学到的知识。
在一篇新论文中,中国实验室 AllSpark 介绍了两款不同规模的搜索智能体。Iris-mini 拥有 350 亿个参数,Iris-pro 拥有 3970 亿个参数。团队表示,两者都基于 Qwen 系列模型(Qwen3.6-35B-A3B 和 Qwen3.5-397B-A17B)构建,支持 256,000 个 token 的上下文窗口,并在各自的规模级别中取得了开放权重搜索智能体的最佳表现。
训练问题是根据网页链接结构反向构造的
这套训练流程根据网页的链接结构反向构建任务。流程从一个种子页面及其指向的链接开始,构建出由术语和关系组成的图。随后,系统根据该图生成多步问题,回答这些问题需要将多个相互关联的步骤串联起来。
除了最终答案之外,所有术语都会被替换为释义,因此无法通过简单的文本搜索找到线索。智能体必须进行推理,而不只是查找信息。只有那些参考模型在没有工具时无法解决、但利用正确来源可以解决的问题,才会被纳入数据集。这使任务既具有难度,又能够得到明确验证。
两阶段筛选会剔除不良训练数据
一个更强的教师模型会生成由推理、搜索查询和搜索结果组成的解决路径。这些路径会经过两轮筛选。第一轮会检查完整路径的正确性、重复循环以及搜索深度。论文称,第二轮则由一个评判模型逐步审查,其评判标准并非人工设定,而是从数据本身推导出来的。
在此之后,模型还会针对实时网页搜索进行强化学习训练。评判模型和结果摘要都在训练集群内部运行,由团队自有的大型 Qwen 模型提供支持,因此训练不依赖外部服务。监督微调和强化学习交替进行,作者将这一过程称为“SFT-RL climbing”。每一轮中已经解决的最难任务,以及最高效的解决路径,都会反馈到下一轮训练周期中。
上下文管理的重要性可能超过模型差异
Iris-mini 和 Iris-pro 是同级别中最强的开放权重搜索代理
该团队认为,在常见基准测试中,运行时上下文管理所产生的影响,往往比报告中各系统之间的差距更大。在长时间的研究过程中,上下文可能会在代理解决所有子问题之前就被填满。丢弃对话历史等技巧可以人为延长研究过程,但这几乎无法反映模型本身的实际质量。
为隔离这一因素的影响,该团队在保持工具、上下文限制和评判模型不变的情况下,分别测试了每项基准是否启用上下文管理。只报告启用上下文管理后的结果,无法清楚区分其中哪些表现来自模型,哪些来自模型周围的脚手架系统。Iris 的得分也来自单个代理,未使用辅助代理,最后也没有额外的验证步骤。
四项基准测试的结果
测试涵盖 BrowseComp——用于测试根据间接线索寻找罕见事实的能力;其中文版本 BrowseComp-ZH;用于评估检索证据完整性的 DeepSearchQA;以及提出专家级学术问题的 Humanity's Last Exam。
上下文管理对较小模型的影响要大得多,能让 BrowseComp 得分最高提升 21.2 分。论文称,原因并不是 token 预算更小,而是 token 消耗速度更快。Iris-mini 在完成相同任务时需要更多步骤,也更频繁地触及上下文限制。
在 Humanity's Last Exam 上,提升幅度较小,因为该基准更依赖领域知识和学术推理,而网络搜索在其中只起辅助作用。最佳成绩来自将丢弃历史记录与第二次尝试结合起来。如果第一次尝试失败,系统会将其压缩成一份简短笔记,记录已经检查过并排除的内容,然后在下一次运行时将这份笔记附加到任务中。
当地面真值出错时
团队在论文附录中描述了一个案例:尽管代理的答案有源材料支持,却仍被判定为错误。BrowseComp-ZH 中的一道题目针对《Game of Thrones》系列。代理回答的是“Bolton”,但地面真值却写成了“Lannister”。题目所涉及的角色 Sansa Stark 实际上在第二段婚姻中嫁给了 Ramsay Bolton。因此,代理的答案是正确的。团队表示,地面真值与源材料之间出现的这类矛盾,促使他们着手构建更好的基准测试。
除了搜索之外,作者还报告了一个意外的副作用。生成的训练数据和专用模型都提升了模型在一些从未接受过训练的任务上的表现,包括通用工具使用和办公工作。研究团队认为,搜索可能更像是一项基础技能,而不是狭窄的专业能力,因为这种学习到的行为在任何需要代理处理不完整信息的场景中都能发挥作用。
Iris-mini 和 Iris-pro 的模型权重已在 Hugging Face 的一个集合中提供,代码则发布在 GitHub 上。目前发布的内容包括 Iris Harness,其中包含代理循环、工具、上下文管理策略,以及配套评测的全部四项基准测试。该 Harness 可连接到任何兼容 OpenAI 的端点运行。研究团队计划稍后发布数据构建和训练流程。
来源与参考
收录于 2026-09-14