OpenAI推出快速智能体路由的决策API
TechCrunch AI··作者 Tim Fernholz
关键信息
该API仍处于有限预览阶段,其技术设计、基准测试、可用性和概率校准情况尚未得到独立验证。公开比较显示,决策API可以接收图像输入并返回带概率的类型化选项,而Jev主要处理基于文本的状态、文档化选项、评分标准和是非概率。
资讯摘要
在OpenAI的DevDay活动上,首席执行官Sam Altman在发言中透露了公司的新决策API。他表示,开发者可以让Luna模型在预定义选项中进行选择,例如图像类别或智能体行为,同时保留图像理解、广泛语言支持和安全防护能力。这个概念类似于TypeSafe AI在本月早些时候发布、面向软件自动化的Jev模型。Jev可以看作一种基于大语言模型的分类器,能够以较低成本和较高速度,为开发者指定的选项输出概率。OpenAI目前仅以有限预览形式发布决策API,因此它与Jev的实际相似程度和性能仍不确定。
其背后的动机是,传统大语言模型对于许多软件决策来说可能过慢且过于昂贵,尤其是在需要检查智能体每个动作时。网络安全从业者Shapor Naghibzadeh在一次黑客松演示中使用Jev,根据智能体动作是否符合任务要求来放行、标记或拦截动作。文章称,这类监控使用Jev的估算成本为2.94美元,而使用前沿大语言模型则为372美元,但这些数字并不能独立验证OpenAI的新产品。当前仍待解决的关键问题是,这些模型能否提供校准良好的概率,以及能否以足够高的每美元智能水平可靠地监督智能体。

资讯正文
周二举行的 OpenAI Dev Day 活动上,最引人关注的公告之一来自 CEO Sam Altman 的一段顺带提及。他透露,公司推出了新的“Decisions API”。
据称,该 API 提供的功能与 TypeSafe AI 本月早些时候发布的 Jev 类似;后者明确针对软件自动化而设计。Jev 是一种构建在 LLM 之上的超强分类器,开发者可以向它提供一组选项,由它以较低成本和极高速度输出各选项对应的概率。
OpenAI 的 Decisions API 似乎也是同类产品。在活动上,Altman 将该 API 描述为一种让该实验室的 Luna 模型在预先设定的一组选项中进行选择的方式,例如选择用于图像分类的类别,或选择不同的智能体行为。
Altman 说:“通过让模型专注于这一选择,我们可以在保留图像理解、广泛语言支持和安全防护等能力的同时,让它达到极高的速度。”
TypeSafe 没有回应 TechCrunch 就这款新产品提出的问题,但该公司 CEO Diogo Almeida——一名前 OpenAI 工程师,也是强化学习的共同发明者——在 X 上开玩笑称,克隆大战已经开始。
他还补充说,OpenAI 对此感兴趣可能是“一个迹象……表明以兼容系统一的方式构建产品就是未来”。(“系统一”是 TypeSafe 对快速、直觉式思考的专业称呼;相比之下,该公司用“系统二”指代审慎的推理过程。)
这里的潜台词是:就许多软件而言,我们所熟知的 LLM 并不是正确的解决方案,因为它们相对缓慢且成本高昂。开发者一直在使用 Jev 来增强 LLM,而在这一过程中,他们发现这样做能够让系统更快、成本更低。
目前还不清楚 Decisions API 与 Jev 的相似程度究竟有多高,因为 OpenAI 发布的只是有限预览版;到目前为止,TechCrunch 也没有发现开发者对它进行充分测试。不过,从 X 上的相关讨论来看,人们显然对此很感兴趣。
Decisions API 并不是互联网上唯一类似 Jev 的 API——其他初创公司也在推出类似模型,OpenAI 不会是最后一家做出这类产品的科技巨头。一个关键问题在于,这些决策模型输出的结果与现实情况的匹配程度,也就是校准效果究竟如何。
Almeida 表示,他所在公司的护城河在于其创建的合成数据,而这些数据能够用于生成具有统计实用性的输出。
上周,Almeida 对 TechCrunch 说:“快速且便宜非常容易,你知道的。如果你想要它真的又快又便宜,那就用骰子,对吧?真正困难的部分是智能,而我的北极星始终是推动‘每美元智能量’的帕累托曲线。”
仅仅几周之后,这些模型显然已经展现出未来的发展空间,而一个很可能的应用方向就是监控和保护 AI 智能体。此前,OpenAI 的智能体在开放互联网中出现一系列行为失当事件;该公司随后采取的一项新安全措施,就是使用一个独立模型来监测不良行为,但代价是“相当高的计算资源”。
长期从事网络安全工作的 Shapor Naghibzadeh 目前领导着初创公司 QueryStory。他认为,像 Jev 这样的模型可以让这一过程的成本大幅降低。
上周末举行的一场黑客松中,他制作了一个演示项目:利用 Jev 根据智能体被赋予的任务,检查智能体的每一项行动;对于它高度确信有问题的行动予以阻止,将其他行动标记出来供审核,并允许剩余行动通过。
理论上,这种监控或许能够阻止 Hugging Face 事件的发生——而使用 Jev 进行这类监控的成本为 2.94 美元,相比之下,使用前沿大语言模型则需要 372 美元。
一个关键观察是,Jev 的成本可能已经低到足以对每一项智能体行动进行运行,这就提供了一层审核机制,有望从整体上提升智能体的可靠性。这正是 TypeSafe 希望实现的目标——如今,OpenAI 也看到了它的价值。
来源与参考
收录于 2026-10-01