企业对AI代理评测的信任落后于部署

VentureBeat AI··作者 VentureBeat AI

关键信息

只有 5% 的组织表示他们完全信任自动化评测,而最常见的弱点是评测与真实世界结果对不齐(29%)。三分之二的企业已经允许低风险代理在零人工介入下上线,或正在构建这种流程,但只有大约四分之一会对线上流量进行实时质量检查。

资讯摘要

VentureBeat 的 Pulse Research 调查认为,企业 AI 正面临一个“评测缺口”:企业赋予 AI 代理的自主权,已经超过了他们对这些测试本身的信任程度。此次调查覆盖 157 家企业,结果显示,50% 的受访者表示,过去一年里他们部署过通过内部评测却在面向客户的生产环境中出错的代理或 LLM 功能,另有 25% 表示这种情况发生过不止一次。对自动化评测的信心非常低,只有 5% 的组织表示他们现在完全信任自动化评测。被提及最多的问题是评测与真实世界结果不够一致,29% 的受访者都指出了这一点。

尽管如此,66% 的组织已经允许,或者正在积极构建,让低风险代理在没有人工介入的情况下自动上线。报告还指出,当前工具链仍然碎片化且不成熟,最常见的主力选择要么是模型提供商自带的评测,要么根本没有专门工具,两者各占 17%。只有大约四分之一的企业会对线上生产流量做实时质量检查,而真正的问题通常 სწორედ在生产环境中暴露。VentureBeat 将这一现象概括为“自主性”与“保障能力”之间的错配:代理上得越来越快,但评测体系还不足以证明这种速度是安全的。

企业对AI代理评测的信任落后于部署

来源与参考

  1. 原始链接
  2. The AI context gap: Enterprise AI organizations have a trust problem, not a retrieval problem — and most are still building the fix
  3. The agent evaluation gap: Enterprise AI organizations have a reality-alignment problem, not a coverage problem — and most are shipping to production anyway

收录于 2026-07-17