AI代理承担更多模型开发工作,但决策仍由人类掌控
The Decoder··作者 Jonathan Kemper
关键信息
在审查的任务中,96.5%使用了AI;四周内,代理操作与人类输入的中位数比例从11上升到28.5,但在被认为没有AI就无法完成的任务中,人类仍有95.4%的比例选择了目标。Atria Dawn Preview采用混合专家架构,据称在16项基准中的5项领先,但这项研究由模型开发团队自行报告,不能证明该模型整体优于竞争模型。
资讯摘要
复旦大学相关研究人员记录了56名人员与AI代理协作开发Atria Dawn Preview的过程,这是一款拥有7440亿参数的智能体语言模型。团队将700多条人类任务日志与代理日志结合分析,代理的工作连接到真实执行环境,并会调用工具、生成中间结果,再通过测试、指标或来源证据进行检查。据团队称,该模型在包括网络搜索和网络安全在内的16项基准中的5项领先,但总体上并未胜过竞争模型。在审查的任务中,96.5%有AI参与,四周内每次人类输入对应的代理操作中位数从11次增加到28.5次。研究人员提醒,这一增长反映的是每个人类决策之后代理执行了更多步骤,并不一定表示代理拥有了更高的自主性。
在455项已完成的AI辅助任务中,参与者认为其中151项若没有AI就无法以相同范围和质量完成,而且这些任务涉及27名参与者,并非只来自少数高级用户。根据决策类型不同,AI提出的选项占17%至55%,但其最终决策占比始终只有个位数;在被认为没有AI就无法完成的任务中,人类有95.4%的比例选择了目标。任务遇到困难时,人类通常通过补充背景、澄清要求,或诊断问题并更换方法来介入,亲自修改部分内容或完全接管的情况很少。作者警告,越来越长的代理工作链可能使有效监督变得困难,最终让人类只能对结果盖章;与此同时,模型能否提出并评估真正有价值的后继模型改进方向,仍是开放问题。

资讯正文
AI 代理在模型开发中承担了更多工作,但决策仍由人类做出
一个研究团队记录了人类与 AI 代理如何协作构建新 AI 模型的过程。这些发现对代理能够多大程度上独立工作的一些预期提出了挑战。
当 AI 代理帮助构建新的 AI 模型时,究竟由谁做决策?一个由中国复旦大学研究人员参与的团队研究了自身的项目,以找出答案。该团队分析了 56 名参与者的 700 多份任务日志,以及他们所使用代理的日志。
该项目围绕开发一款名为 Atria Dawn Preview 的代理式语言模型展开。该模型采用混合专家架构,拥有 7440 亿个参数,面向研究和工程任务设计。
该模型通过一条将每项任务与真实执行环境关联起来的流水线进行训练。它会调用工具、生成中间结果,并根据测试、指标或源证据等外部信号接受检查。团队表示,该模型在 16 项基准测试中的 5 项领先,包括网页搜索和网络安全,但在总体表现上并未领先于竞争对手。
三分之一的已完成 AI 辅助任务,如果没有 AI,原本不会被尝试
在接受审查的任务中,有 96.5% 使用了 AI。随着项目推进,参与者逐渐将越来越多的工作交给代理。在四周时间里,代理操作与人工输入的中位数比值从 11 上升到 28.5。团队提醒,不应将这一变化解读为代理自主性增强。每一个人类决策都会带来更多代理步骤,但这并不意味着代理自身做出了更多决策。
研究人员还询问参与者:如果没有 AI,他们是否仍能以相同的范围和质量完成自己在任务中负责的部分。在 455 项已完成的 AI 辅助任务中,有 151 项被评定为在没有 AI 的情况下不可行,约占三分之一。这些任务分布在 56 名参与者中的 27 人身上,因此并非仅来自少数重度用户。在这些情况下,AI 并不是加快了原有工作,而是让原本根本不会开始的工作成为可能。
AI 提出方案,人类做出选择
根据决策类型的不同,AI 提议方案的比例介于 17% 到 55% 之间,但它最终决策所占的比例始终为个位数。提出选项的主体差异很大,但人类始终做出了大多数最终选择。即使在那 151 项被评定为没有 AI 就不可行的任务中,95.4% 的情况下仍由人类选择目标。
人类提供上下文,而非亲自进行手工劳动
当事情出错时,也会呈现出同样的模式。在 588 项有记录难度的任务中,76% 通过人类干预得以推进,另有 23% 由代理自行解决问题。人类提供的帮助几乎总是以信息的形式出现:要么补充上下文或澄清要求(35.2%),要么诊断问题并更换方法(34.7%)。人类很少亲自完成工作。部分编辑仅占 3.2%,完全接管任务则只有 0.7%。
当 AI 的输出需要修改时,在获得人类反馈后,AI 有 75.4% 的时间会自行处理修改。瓶颈在于人类判断,而不是执行。
AI代理在模型开发中承担更多工作,但人类仍然做出决策
该团队将AI所扮演的角色分为三个阶段:从研究对象,到处理个人任务的工具,再到如今的项目合作伙伴。在当前阶段,AI会根据人类设定的目标起草并调整计划。一个具有推测性的第四阶段将涉及递归式自我改进,即由更强大的模型生成更强大的后继模型。
作者表示,模型可以在训练任务上取得进步,却不一定会因此更擅长开发自己的后继模型。在结果尚未出现之前,AI如何提出多样化的研究方向并评估其价值,仍然是一个悬而未决的问题。
橡皮图章式批准的风险
当每一项决策都建立在一条长到任何人类都无法审查的代理工作链上时,监督就会变得困难。该团队写道,在最糟糕的情况下,人类会变成只能对自己看到的内容盖章批准的审阅者。许多参与者还让代理以自主模式运行,以免通过持续审批不断打断长时间运行的任务。这一权限边界是出于便利而形成的,而不是基于对AI应拥有多大权限的任何有意决策。
这篇论文正值一场围绕递归式自我改进展开的争论之际。Anthropic认为,AI自行开发后继模型可能会比预期更早成为现实,因此其CEO Dario Amodei呼吁为整个行业设定速度上限。据Anthropic称,目前公司研究方向相关的决策中,只有个位数百分比仍由人类做出。OpenAI在整个开发周期中使用GPT-5.6 Sol;Google和DeepMind则通过Dream-RSI让AI代理借助记录下来的搜索轨迹探索替代策略,不过它们改进的只是搜索策略,而不是模型本身。
最近,领先AI公司的1000多名员工警告称,他们所在的组织可能已经接近实现AI研究自动化。普林斯顿大学和英国人工智能安全研究所开展的另一项研究得出了与Atria团队发现更为一致的结论:前沿模型能够处理研究工程工作,却无法完成真正重要的那些判断。
来源与参考
收录于 2026-09-28