AI搜索代理的难点在歧义而非检索
The Decoder··作者 Jonathan Kemper
关键信息
DiscoBench 包含 211 个任务、463 个歧义点,覆盖 11 个领域,包括电子游戏、体育、音乐、电影、科学和政治。该基准评估模型能否识别歧义、提出有用的追问并修正搜索路径;即使 Claude Opus 4.7 在单个检查点上也有 57% 的正确率,端到端结果却只有 39.8%。
资讯摘要
这篇文章的核心观点是,AI 搜索代理最常见的失败并不是不会搜,而是不知道什么时候该向用户确认问题。腾讯混元和清华大学的研究人员为此提出了 DiscoBench,用来测试模型能否在多步研究过程中识别歧义、提出有针对性的追问,并把搜索路径拉回正轨。与 GAIA、BrowseComp 等早期基准不同,DiscoBench 并不默认用户问题已经完整清晰,而是专门围绕含糊、不完整或有误的真实查询来设计。该基准包含 211 个任务和 463 个歧义点,覆盖 11 个知识领域,每个任务又被拆成多个检查点,代理需要在“继续搜索”“向用户提问”“直接回答”之间做选择。研究人员把歧义分为四类:一个描述可能对应多个实体、可能涉及不同时间段或版本、可能存在多种有效的排名或评估标准,或者干脆包含事实错误。
为了更贴近真实使用场景,数据集大部分以中文编写,反映中文网络上的常见搜索方式。只要代理提出了有用的澄清问题,模拟用户就会给出一个预设线索,从而帮助缩小搜索范围。结果显示,单步表现和端到端结果之间存在明显落差,例如 Claude Opus 4.7 在单个检查点上能答对 57%,但完整任务成功率只有 39.8%。文章还指出,仅仅在系统提示里要求模型“注意歧义”并不够,而如果模型一开始就走错理解方向,继续搜得越多,往往反而比直接猜测更糟。

资讯正文
AI 搜索代理并不是在“搜索”这件事上失败,而是在查询变得含糊时没有问对问题
AI 搜索代理在多步骤研究任务中很少因为搜索本身而失败。它们真正的问题,是在查询含糊不清时没有向用户请求澄清。这是腾讯混元和清华大学团队发布的一项新基准得出的结论。反复搜索往往比直接猜测表现更差。
借助 DiscoBench,研究人员构建了一个测试框架,用来检查语言模型在深度搜索链中能否自主识别歧义、提出有针对性的后续问题,并修正自己的研究路径。此前像 GAIA 或 BrowseComp 这样的基准,都假定用户查询是完整且没有歧义的。
但现实世界中的查询往往含糊、不完整,甚至完全错误。在长推理链中,每一个未解决的歧义都会不断累积,把代理引向错误方向。如果模型在早期节点选错了实体,它就会继续用看似正确的语法搜索,却从根本上错过真正的目标。
四种歧义类型
DiscoBench 包含 211 个任务,在视频游戏、体育、音乐、电影、科学和政治等 11 个知识领域中总计有 463 个歧义点。每个任务被拆分为多个检查点。在每个检查点,代理可以在三种动作中选择一种:继续搜索、向用户请求澄清,或者直接给出答案。
研究人员将歧义定义为四种类型。一个描述可能对应多个实体,可能适用于不同的时间段或版本,可能允许多种有效的排名或评估标准,或者干脆包含明显的事实错误。该数据集主要用中文编写,以反映中文互联网中的典型搜索模式。
当代理提出一个有用的后续问题时,基于 LLM 的用户模拟器会释放一个预设线索,帮助缩小搜索范围。所有搜索请求都通过代理搜索引擎 Tavily 运行,而 Gemini 3 Flash 则作为模拟器使用。
即便是大模型也难以超过 50%
单步得分和整体结果之间存在差距。比如,Claude Opus 4.7 在检查点上的正确率为 57%,但端到端仅达到 39.8%。单个研究步骤本身运行正常,但只要有一个歧义没有解决,整条链路就可能崩塌。
仅靠警告提示并不够
作者还测试了这样一种情况:系统提示明确告诉代理要留意歧义,并在拿不准时提出后续问题。这种“Guided”模式旨在展示一种上限——当模型不必自己判断问题是否表述不充分时,它能达到的最佳表现。
搜索更多不如直接猜测
识别歧义和提出好问题是两种不同的能力
一个有用的研究代理需要同时具备这两种能力:既能识别何时该提出后续问题,也能把问题问到足以真正推动搜索向前。
按歧义类型来拆分,事实性错误最容易被发现,因为它们会在研究过程中造成直接矛盾。实体歧义和标准歧义更难处理,因为多个看似合理的候选项,或不够明确的评估标准,可以同时存在,而不会出现任何明显矛盾。
AI 代理需要更好的追问策略
其他近期研究也证实,当前的搜索代理在研究方式上存在基础性弱点。一项研究发现,在 BrowseComp 这类基准上,领先模型往往只是确认自己已经知道的内容。在专门构建、且包含知识截止时间之外事实的 LiveBrowseComp 上,所有系统都下降了 25 到 40 分。Halluhard 基准还显示,使用网页搜索的 Claude Opus 4.5 约有 30% 的情况会产生幻觉,主要是在核实被引用来源内容时。
Anthropic 在其最新模型更新 Claude Opus 4.8 中着手解决这一问题。该模型据称会更频繁地标记不确定性,而且与前代相比,它在自己代码中遗漏注释的 bug 数量大约减少了四倍。Perplexity 则采取了不同的方法,通过 Search as Code 让模型把搜索工作流写成 Python 程序,而不是调用预置 API。
不夸大热度的 AI 新闻——由人类精选
订阅 THE DECODER,获取无广告阅读、每周 AI 新闻简报、我们一年六次的独家“AI Radar”前沿报告、完整归档访问权限,以及评论区访问权限。
来源与参考
收录于 2026-07-06