失控的 AI 代理可能突破成本控制

ZDNET AI··作者 Joe McKendrick

关键信息

Revenium 提到一个内部案例:一个编程助手被放在电脑上运行了四天,完成 4,819 次调用,花费 3,762 美元,却没有触发任何告警。另一家客户的代理基础设施成本据称从原型阶段每月 5,000 美元飙升到预发布阶段每月 50,000 美元,原因是未优化的 RAG 查询和递归循环;还有一个团队在 11 天的无限对话循环中烧掉了 47,000 美元。

资讯摘要

ZDNET 报道称,AI 代理正在快速扩散,但许多组织仍然没有真正控制这些系统的行为方式以及它们会花多少钱。StackGen 最新的《可靠性状态报告》发现,缺乏监管或仅受轻度监督的代理正在可靠性、安全性和成本管理方面制造问题。报告称,过去一年里至少有 9 起已记录案例中,代理在使用有效凭据的情况下清空数据或删除数据库,直接破坏了企业生产系统,而标准监控直到损害已经显现才发现异常。该研究还分析了 109,000 多起事故,发现自 2023 年以来恢复时间并没有明显改善,最常见的处理方式仍然是等待另一家公司的工程师来修复。成本方面,Revenium 提到一个案例:一名开发者把 AI 编程助手留在笔记本电脑上运行了四天,系统共发起 4,819 次调用,费用达到 3,762 美元,却无人察觉。

Revenium 还引用了一家中型电商客户的经历:由于未优化的 RAG 查询和高峰期的递归代理循环,其 AI 代理基础设施成本从原型阶段每月 5,000 美元上升到预发布阶段每月 50,000 美元。另一个案例中,一支团队让代理陷入长达 11 天的无限对话循环,直到花掉 47,000 美元后才被发现。Revenium 的工程师表示,当前预算模型的问题在于,AI 会话通常像 SaaS 席位或平均 token 用量那样定价,但平均值并不能反映真实运行中的工作负载。文章强调,组织如果想保护预算和生产系统,就必须监控高端和失控的代理行为,而不能只看平均使用量。

失控的 AI 代理可能突破成本控制

资讯正文

关注 ZDNET:将我们添加为 Google 的首选来源。ZDNET 的要点

AI 代理可能会失控并产生高额费用。

一位提供商讲述了其对失控代理的困扰。

应关注高端 AI 使用场景的成本,而不是平均值。

AI 代理正在激增,而且往往超出 IT 管理人员的控制,近期一项分析显示,未被察觉的代理式活动所产生的成本会迅速累积。

StackGen 最新发布的《Reliability 状况报告》发现,无监管或半监督的代理在许多层面都已证明是个问题。

另:根据 Andrew Ng 的说法,你需要掌握的 4 项 AI 开发技能——以及专家认为他遗漏了什么

在过去一年中,至少有 9 起有记录的案例显示,AI 代理使用有效凭据自行清空数据并删除数据库,从而破坏了公司的生产系统。直到损失显现之前,它们的行为都未被标准监控系统发现。

这项研究分析了 109,000 多起事件,还发现随着故障模式不断增加,恢复速度并没有加快:自 2023 年以来,中位解决时间大体保持不变,而最常见的单一修复方式是等待其他公司的工程师来处理。

累计成本

从财务角度看,AI 代理的成本可能会迅速攀升。最近,AI 支出解决方案提供商 Revenium 的工程师报告了一次代理式 AI 会话:一名开发者让某个 AI 编程助手在他的笔记本电脑上连续运行了四天。等到有人发现时,这个代理已经调用了 4,819 次,总成本达到 3,762 美元,而且无人知晓。

尽管费用会因使用场景而有很大差异,BakedWith 整理的基本指南显示,基础聊天机器人的成本为每月 20 至 50 美元,中级代理式助手为每月 100 至 500 美元,而定制的企业级代理式解决方案的前期费用则超过 10,000 美元。

不过,这些还只是前期成本,定价并没有考虑监管不足的代理可能失控带来的额外费用,而这当然会压缩投资回报率。

这一潜在问题说明了组织必须管理其部署的 AI agents,并强调了它们不受约束地泛滥所带来的风险。另见:如今不再需要“专家”了:在今天的 AI agent 工作场所如何保持价值

Revenium 引用了其一位客户——一家中型电商公司——的一个案例:该公司“看到 AI agent 基础设施成本从原型阶段每月 5,000 美元飙升到 staging 阶段每月 50,000 美元,增幅达到 10 倍,原因是在高流量时段,未优化的 RAG 查询和递归 agent 循环推动了成本上涨。”每一次单独的 agent 操作看起来都是合理的工程行为:“每个动作单独看都合乎逻辑,但累积成本并不合理。”

在另一个案例中,一个团队的 AI agents“进入了一个无限对话循环,连续 11 天未被发现,在有人注意到之前就烧掉了 47,000 美元,”该报告补充道。另见:为什么用 AI 取代员工会适得其反——以及精明的领导者如何创造真正价值的 5 种方式

“两名 agents 在团队睡觉时、工作时、以及他们以为系统一切正常运行时,一直卡在彼此对话中。”

经验教训

在最近的一项内部研究中,Revenium 的工程团队把注意力转向了自身的 agentic AI 实践,也发现了代价高昂的活动。以下是团队从一次未受监控的 AI agent 事件及相关审计中学到的内容:

一次持续四天、由一个失控 AI agent 参与的会话花费了 3,762 美元:“5 月 13 日,我们的一名开发者在他的笔记本电脑上打开了一个 AI 编码会话,”公司工程团队成员报告说。“它一直保持开启了四天。到它关闭时,已经运行了 4,819 次调用,花费了 3,762 美元。没人为此做预算。也没有触发警报。” 他们补充说,这类会话实际上并不罕见。问题之所以出现,是因为 AI 会话的预算方式与 SaaS 会话类似,按席位或按 token 收取固定费用,并以平均值来跟踪。“一旦你看清人们实际在运行什么,这种模式就会失效,”工程师们补充道。

平均值会掩盖 AI 的真实成本:在 90 天内完成的 557 项代码实现任务中,基于 agent 的工作的中位成本为 2.24 美元,这看起来显然非常可持续。最昂贵的单项任务为 300.97 美元。然而,跟踪平均值掩盖了 AI agent 成本失控的可能性,正如上面提到的 3,762 美元会话成本所示。“如果你是按平均值来管理 AI 账单,你就无法看到明天早上可能发生什么,”工程师们警告说。

要警惕最顶端 1% 的 agentic 运行:工程师们观察到,最顶端 1% 的运行贡献了近一半的支出。在 90 天内跟踪的 14,680 次 AI 运行中,最顶端 1% 占总支出的 46%。最顶端 5% 的运行占支出的 77%。底部 90% 的运行仅占 AI 支出的 12%。“AI 支出集中在分布的尾部。SaaS 成本控制盯错了曲线的部分,”工程师们表示。

成本来自交互式 AI,而不是自动化 AI:在研究的 10,005 个交互式 agentic 会话中,账单总额为 109,118 美元;而在研究的 4,171 个自动化软件开发生命周期任务中,成本为 6,723 美元。

“实现并审核 pull request 的自动化流水线成本不到账单的 6%。”工程师们报告说,“另外 94% 是工程师白天通过 AI 进行工作的成本。这个类别很少会被单独拆分成一项明细。”

AI pull request 的成本会因一些未被衡量的情况而变化:在 30 天内,团队中的 12 名工程师每人至少合并了 10 个 pull request,总数达到 1,721 个。每个已合并 pull request 的成本从最低 4.05 美元到最高 103.66 美元不等,中位数为 16.59 美元。团队成员表示:“这种跨度反映的是不同的工作内容以及不同的 AI 使用模式。我们并不是在说某些工程师‘好’,而另一些‘差’。我们要指出的是,这种差异存在于几乎没人衡量的预算维度里,而且它比企业与供应商之间任何按席位谈判都要大。”

成本的增长取决于使用深度,而不是员工人数:使用 AI 的团队从 1 月到 5 月增长了四倍,从 7 人增至 28 人。消耗的 AI 价值增长了 420 倍,而人均消耗大约增长了 100 倍。“按席位预算看不到这种加速。”最初,7 名使用 AI 的工程师所看到的 API 等效价值——即通过订阅定价工具消耗、并按公开 API 费率计价的 token——为 109 美元。到 5 月,28 名工程师使用 AI 时,这一 API 等效价值达到 45,728 美元。

尽管这些数字只代表一家工程组织,Revenium 团队仍认为“分布形态在更广泛范围内成立,而且与我们在早期客户部署中看到的模式一致”。

同时,“每个 pull request 的较低成本并不意味着更好的工程质量。我们并不是建议任何人用更贵的工程师替换现有工程师。重点在于衡量:这种差异目前对预算所有者来说是不可见的,而这种不可见性才是问题所在。”

来源与参考

  1. 原始链接
  2. Even an AI cost-management vendor can lose control of its agent spending

收录于 2026-08-29