Artificial Analysis推出AI代理搜索API基准
The Decoder··作者 Matthias Bastian
关键信息
该基准使用GPT-5.6 Luna和Artificial Analysis的开源代理框架Stirrup,并保持除搜索提供商之外的其他条件不变;每个任务都会运行25次。它结合了DeepSearchQA、BrowseComp子集和AA-Omniscience,并提供不使用工具的基线作对照;结果显示,即使单任务搜索支出上升,更好的搜索质量也可能降低总成本。
资讯摘要
Artificial Analysis推出了一个名为Search Index的新基准,用来衡量搜索API为AI代理提供服务时的表现。这个基准从质量、成本和速度三个维度进行评估。首批纳入的提供商包括Parallel、Exa、Firecrawl、You.com、Tavily、Keenable和Brave。为了保证比较公平,测试统一使用同一个模型GPT-5.6 Luna,并且只更换搜索提供商。代理运行在Artificial Analysis的开源框架Stirrup上,每个任务会执行25次。
Search Index由三个权重相同的测试组成。DeepSearchQA包含900道研究型问题,每道题都需要多次搜索查询。BrowseComp子集包含200个难以找到的事实,要求进行多步浏览;AA-Omniscience则覆盖六个知识领域的600道问题。Artificial Analysis还加入了一个不使用工具的基线,用来对比代理在有无搜索工具时的表现。
发布结果显示,一个关键权衡是:更好的搜索质量可能降低总成本,因为当模型第一次就获得更好的结果时,它需要消耗更少的token。比如Parallel Search(advanced)相比Basic版本,token使用量降低了40%以上,虽然单任务搜索成本更高。即便如此,总成本仍然更低,为0.084美元,而不是0.11美元。
速度方面也不能只看单次查询延迟。Parallel Search(turbo)的单次查询响应时间最短,为0.51秒,而Basic版本为1.03秒。但由于turbo的质量分数更低,67分对73分,代理不得不进行更多轮次的搜索,因此总任务时间几乎没有变化。Artificial Analysis认为Parallel、Firecrawl和Parallel(turbo)在成本与性能之间取得了最佳平衡。该方法论已公开,其他提供商也可以申请加入这个基准。

资讯正文
新的基准测试对面向 AI 智能体的搜索 API 在质量、成本和速度方面进行排名
Artificial Analysis 发布了“Search Index”,这是一项基准测试,用于衡量搜索 API 提供商在质量、成本和速度三个维度上为 AI 智能体提供服务的表现。
首批入选的服务包括 Parallel、Exa、Firecrawl、You.com、Tavily、Keenable 和 Brave。每一家都在统一的智能体设置中,使用相同的模型(GPT-5.6 Luna)进行测试;变化的只有搜索提供商。该智能体运行在 Stirrup 上,这是 Artificial Analysis 推出的一个开源框架,并且每个任务都会执行 25 次运行,用于搜索并调取网页。
该指数由三个权重相同的基准组成。DeepSearchQA 包含 900 个研究问题,每个问题都需要多次搜索查询。BrowseComp 的一个子集测试 200 条难以找到的事实,这些事实需要多步骤浏览。AA-Omniscience 覆盖六个知识领域中的 600 个问题。还有一个不使用工具的基线,即模型自行作答,用作对照点。
更好的搜索质量也会降低总成本。当模型一开始就能获得更好的结果时,所需 token 会更少。使用 Parallel Search(advanced)时,相比 Basic 版本,token 用量下降了超过 40%。按每个任务计算的搜索成本会上升,但总成本更低(0.084 美元对比 0.11 美元)。
单次查询的原始速度并不总意味着整体结果更快。Parallel Search(turbo)在单次查询响应时间上最短(0.51 秒,而 Basic 为 1.03 秒),但由于其质量更低(67 对比 73),迫使智能体进行更多轮次。最终,每个任务的总耗时大致相同。
Artificial Analysis 表示,Parallel、Firecrawl 和 Parallel(turbo)在成本与性能之间取得了最佳平衡。其他提供商也可以申请加入该基准测试。完整方法论已公开。
来源与参考
收录于 2026-08-19