AI搜索代理的难点在歧义而非检索

The Decoder··作者 Jonathan Kemper

关键信息

DiscoBench 包含 211 个任务、463 个歧义点,覆盖 11 个领域,包括电子游戏、体育、音乐、电影、科学和政治。该基准评估模型能否识别歧义、提出有用的追问并修正搜索路径;即使 Claude Opus 4.7 在单个检查点上也有 57% 的正确率,端到端结果却只有 39.8%。

资讯摘要

这篇文章的核心观点是,AI 搜索代理最常见的失败并不是不会搜,而是不知道什么时候该向用户确认问题。腾讯混元和清华大学的研究人员为此提出了 DiscoBench,用来测试模型能否在多步研究过程中识别歧义、提出有针对性的追问,并把搜索路径拉回正轨。与 GAIA、BrowseComp 等早期基准不同,DiscoBench 并不默认用户问题已经完整清晰,而是专门围绕含糊、不完整或有误的真实查询来设计。该基准包含 211 个任务和 463 个歧义点,覆盖 11 个知识领域,每个任务又被拆成多个检查点,代理需要在“继续搜索”“向用户提问”“直接回答”之间做选择。研究人员把歧义分为四类:一个描述可能对应多个实体、可能涉及不同时间段或版本、可能存在多种有效的排名或评估标准,或者干脆包含事实错误。

为了更贴近真实使用场景,数据集大部分以中文编写,反映中文网络上的常见搜索方式。只要代理提出了有用的澄清问题,模拟用户就会给出一个预设线索,从而帮助缩小搜索范围。结果显示,单步表现和端到端结果之间存在明显落差,例如 Claude Opus 4.7 在单个检查点上能答对 57%,但完整任务成功率只有 39.8%。文章还指出,仅仅在系统提示里要求模型“注意歧义”并不够,而如果模型一开始就走错理解方向,继续搜得越多,往往反而比直接猜测更糟。

AI搜索代理的难点在歧义而非检索

资讯正文

AI 搜索代理并不是在“搜索”这件事上失败,而是在查询变得含糊时没有问对问题

AI 搜索代理在多步骤研究任务中很少因为搜索本身而失败。它们真正的问题,是在查询含糊不清时没有向用户请求澄清。这是腾讯混元和清华大学团队发布的一项新基准得出的结论。反复搜索往往比直接猜测表现更差。

借助 DiscoBench,研究人员构建了一个测试框架,用来检查语言模型在深度搜索链中能否自主识别歧义、提出有针对性的后续问题,并修正自己的研究路径。此前像 GAIA 或 BrowseComp 这样的基准,都假定用户查询是完整且没有歧义的。

但现实世界中的查询往往含糊、不完整,甚至完全错误。在长推理链中,每一个未解决的歧义都会不断累积,把代理引向错误方向。如果模型在早期节点选错了实体,它就会继续用看似正确的语法搜索,却从根本上错过真正的目标。

四种歧义类型

DiscoBench 包含 211 个任务,在视频游戏、体育、音乐、电影、科学和政治等 11 个知识领域中总计有 463 个歧义点。每个任务被拆分为多个检查点。在每个检查点,代理可以在三种动作中选择一种:继续搜索、向用户请求澄清,或者直接给出答案。

研究人员将歧义定义为四种类型。一个描述可能对应多个实体,可能适用于不同的时间段或版本,可能允许多种有效的排名或评估标准,或者干脆包含明显的事实错误。该数据集主要用中文编写,以反映中文互联网中的典型搜索模式。

当代理提出一个有用的后续问题时,基于 LLM 的用户模拟器会释放一个预设线索,帮助缩小搜索范围。所有搜索请求都通过代理搜索引擎 Tavily 运行,而 Gemini 3 Flash 则作为模拟器使用。

即便是大模型也难以超过 50%

单步得分和整体结果之间存在差距。比如,Claude Opus 4.7 在检查点上的正确率为 57%,但端到端仅达到 39.8%。单个研究步骤本身运行正常,但只要有一个歧义没有解决,整条链路就可能崩塌。

仅靠警告提示并不够

作者还测试了这样一种情况:系统提示明确告诉代理要留意歧义,并在拿不准时提出后续问题。这种“Guided”模式旨在展示一种上限——当模型不必自己判断问题是否表述不充分时,它能达到的最佳表现。

搜索更多不如直接猜测

识别歧义和提出好问题是两种不同的能力

一个有用的研究代理需要同时具备这两种能力:既能识别何时该提出后续问题,也能把问题问到足以真正推动搜索向前。

按歧义类型来拆分,事实性错误最容易被发现,因为它们会在研究过程中造成直接矛盾。实体歧义和标准歧义更难处理,因为多个看似合理的候选项,或不够明确的评估标准,可以同时存在,而不会出现任何明显矛盾。

AI 代理需要更好的追问策略

其他近期研究也证实,当前的搜索代理在研究方式上存在基础性弱点。一项研究发现,在 BrowseComp 这类基准上,领先模型往往只是确认自己已经知道的内容。在专门构建、且包含知识截止时间之外事实的 LiveBrowseComp 上,所有系统都下降了 25 到 40 分。Halluhard 基准还显示,使用网页搜索的 Claude Opus 4.5 约有 30% 的情况会产生幻觉,主要是在核实被引用来源内容时。

Anthropic 在其最新模型更新 Claude Opus 4.8 中着手解决这一问题。该模型据称会更频繁地标记不确定性,而且与前代相比,它在自己代码中遗漏注释的 bug 数量大约减少了四倍。Perplexity 则采取了不同的方法,通过 Search as Code 让模型把搜索工作流写成 Python 程序,而不是调用预置 API。

不夸大热度的 AI 新闻——由人类精选

订阅 THE DECODER,获取无广告阅读、每周 AI 新闻简报、我们一年六次的独家“AI Radar”前沿报告、完整归档访问权限,以及评论区访问权限。

来源与参考

  1. 原始链接
  2. AI search agents don't fail at searching, they fail at asking the right questions when queries get ambiguous

收录于 2026-07-06