AI代理为何受益于可复用技能

The Decoder··作者 Maximilian Schreiner

关键信息

研究指出,在技能优于无技能代理的案例中,“程序性引导”解释了65.7%的情况,而直接提供知识只解释了4.5%。研究还发现,在10%的案例里,代理会机械地或在错误场景中使用技能;当技能库从5项扩大到100项时,检索精度从29.6%下降到3.3%。

资讯摘要

技能正越来越多地被用于提升AI代理能力,而不必重新训练模型。在这项研究中,技能被定义为一组紧凑的指令,用来告诉代理如何完成任务、需要检查什么,以及要避免哪些常见错误。此前,技能的价值主要只看它是否提高了任务成功率,但并不清楚它为什么有效。来自普林斯顿大学、加州大学圣迭戈分校等学校的研究人员通过控制实验来回答这个问题。研究团队在相同任务上对有无技能的代理进行了比较,共进行了8,135次测试运行。

结果显示,技能之所以有效,主要是因为它们给代理提供了可依赖的执行流程,而不是因为它们补充了缺失的事实知识。论文指出,这种“程序性引导”解释了技能更优的案例中65.7%的情况,而直接提供知识只占4.5%。技能确实能减少环境配置、工具调用顺序和输出格式等方面的错误,但当代理过于机械地执行某个操作流程,或者任务本身需要完全不同的解决方案时,技能也可能被误用。研究还发现,随着技能库从5项扩大到100项,检索精度会从29.6%骤降到3.3%,说明找到合适技能本身就是一个重要瓶颈。研究者认为,技能使用应该被看作一个完整生命周期,真正的挑战不只是存储更多经验,而是更可靠地创建、检索和应用这些技能。

AI代理为何受益于可复用技能

资讯正文

研究解释了为什么 AI agents 会受益于“skills”,以及它们何时会失败

Skills 被视为一种实用方式,可以在不重新训练 AI agents 的情况下让它们变得更强大。一项新研究揭示了它们为何有效,以及它们在哪些方面力有未逮。

从本质上说,skill 是一组紧凑的指令。它会明确 AI agent 在执行某项任务时应遵循的步骤、需要检查的内容,以及应避免的常见错误。agent 不必在每一项新任务上都从零开始,而是从这些存储下来的经验中调用。根据一项新研究,直到现在,它们的价值一直只通过这样一个问题来衡量:带有 skills 的 agent 是否解决了更多任务。为什么会这样,仍然不清楚。

普林斯顿大学、加州大学圣地亚哥分校以及其他学校的研究团队通过受控实验深入探究了这一问题。作者比较了 agents 在相同任务上有 skill 和没有 skill 时的表现,共进行了 8,135 次测试运行。

Skills 是一本行动手册,而不是知识库

主要发现是:skills 之所以有帮助,主要因为它们给 agent 提供了一个可靠的执行流程,而不是因为它们补充了缺失的事实信息。这种“程序性锚定”(procedural grounding)解释了在带有 skill 的 agent 表现优于不带 skill 的 agent 的案例中 65.7% 的情况。直接提供知识只在受测案例中的 4.5% 起到了帮助作用。

因此,skills 主要是在稳定 agent 的动作:要运行哪些设置步骤、工具应按什么顺序使用、需要哪些中间检查。这显然能减少某些执行错误,比如工作环境配置不当或输出格式出错。

但 skills 也会带来一种新的错误来源:研究发现,在 10% 的案例中,agent 会机械地套用原本有用的行动手册,或者以不合适的方式使用它。对于那些需要根本不同解决方案的任务,错误的 skill 显然无济于事。不过,严格匹配既不是充分条件,也不是必要条件。相关的 skills 往往单独就能提供足够的指引。

第二个瓶颈是先找到合适的 skill。当天 skill 库从 5 个条目扩展到 100 个条目时,测试中的实际检索精度从 29.6% 下降到 3.3%。那些听起来尤其相似的选项会让选择更困难。

研究人员认为,skill 的使用应该被视为一个生命周期。更好的自学习 agents 不是来自存储更多经验,而是来自更可靠的创建、检索和应用这些经验的方法。

来源与参考

  1. 原始链接
  2. Study explains why AI agents benefit from "skills" and when they fail

收录于 2026-08-23