TypeSafe推出快速结构化判断模型Jev

The Decoder··作者 Maximilian Schreiner

关键信息

开发者负责定义问题和允许的答案,Jev返回标签及评分,软件再将其连接到固定规则;但它不会自行确认例如一笔付款是否确实重复扣款。TypeSafe的测试只覆盖其自行设计的四个工作流,并以其他人工智能模型的回答作为参照,因此性能尚未得到独立验证;输出被限制在预设选项内,也不代表选择一定正确。

资讯摘要

TypeSafe AI发布了Jev,这是一种面向软件内部狭窄判断的人工智能模型,而不是用于撰写聊天回复、电子邮件或代码。其联合创始人兼首席执行官Diogo Almeida曾在OpenAI工作,也是InstructGPT研究论文的作者之一,该研究为ChatGPT的发展奠定了基础。开发者可以预先定义问题和可能的答案,再将用户输入交给Jev评分。在网上商店的示例中,Jev可以把客户消息归类为支付问题,并估计客户是否要求退款,随后由程序规则将案件转给财务部门、标记出来,或交给人工审核。

Jev不会核实实际交易,也不会直接解决客户问题;这些工作可以由其他系统或聊天机器人随后完成。TypeSafe称,Jev的响应时间为70至500毫秒,原因之一是它跳过逐步文本生成,并行计算多个输出。公司认为,这种速度可以支持在人工智能助手每次回复前进行一致性或账户状态检查,但通用语言模型已经支持结构化输出,因此Jev仍需证明自己在速度、成本或质量上具有明显优势。TypeSafe公布的价格为每百万输入词元0.042美元,输出不收费;不过现有测试范围有限,而且“不会产生幻觉”只意味着它不会输出预设选项之外的内容,并不意味着它不会在选项之中作出错误判断。

TypeSafe推出快速结构化判断模型Jev

资讯正文

初创公司 TypeSafe AI 推出了一款名为 Jev 的 AI 模型,其采用了不同于典型聊天机器人的方法。Jev 并不生成文本、电子邮件或代码,而是用于在其他程序中提供范围明确的判断和概率。联合创始人兼 CEO Diogo Almeida 曾就职于 OpenAI,也是 InstructGPT 研究的作者之一;这项研究为 ChatGPT 奠定了基础。

Jev 的核心理念是:由开发者定义问题和可能的答案,再由模型为各个选项评分。

对请求进行分类,而不是回复客户

文档中的一个示例展示了这种模型在实践中的运作方式。一位客户致信某家在线商店,称自己的一笔订单被扣款两次,并要求退还第二笔款项。在任何人处理这项请求之前,必须先对其进行分类。它涉及的是付款、配送还是退货?客户是想要退款,还是只想得到解释?

这时,开发者会将商店软件接入 Jev,并定义这些问题及允许的答案。每当收到一条新消息时,软件就会把客户的文本交给 Jev。它得到的并不是一封回复信,而是诸如“付款问题”这样的标签,以及客户想要退款的概率。

随后,商店软件可以附加固定规则:付款问题转交会计部门,退款请求则加上标记。如果标签不明确,就由工作人员审核该请求。Jev 负责提供评估,软件则根据预先编写的规则决定下一步如何处理。

但这并不意味着款项已经退回。是否真的发生了重复扣款,还需要之后对照实际交易记录进行核查。另一个独立的聊天机器人可以把经确认的处理状态告知客户。若只是进行分类,则不需要聊天机器人。

亚秒级响应时间或可开启新的用途

TypeSafe 表示,Jev 可在 70 至 500 毫秒内给出答案,比目前速度最快的语言模型还要快许多倍。该公司称,为实现这一速度,模型跳过了逐步生成文本的过程,转而并行计算多个输出。在同一次调用中增加更多问题,几乎不会延长响应时间。

这种速度可以让系统在 AI 助手每次回复前都进行检查:回复草稿是否与此前的对话相矛盾?它是否声称已经退款,但客户账户中并没有相应记录?TypeSafe 在其示例工作流中介绍了此类检查。该公司还列出了更多可用于销售和客户服务的场景,例如识别购买意向、按主题对请求进行分类,或者判断何时应由人工接手。

不过,普通语言模型也可以输出预设类别和数据结构。OpenAI 就为此提供了 Structured Outputs。单凭结构化响应格式,并不足以让 Jev 在竞争中脱颖而出。要想胜出,该模型不仅需要以更快速度或更低成本处理这些任务,还必须达到足够好的质量。

已公布的性能测试存在局限。TypeSafe 比较了四种由其自行构建的工作流程,并以其他 AI 模型的回答作为参照,而非采用经过独立验证的正确答案。评估中也没有 GPT-6 Astra。不过,这款模型的价格非常低廉。TypeSafe 标出的价格是每 100 万个输入 token 0.042 美元,并称输出不收取任何费用。

不会产生幻觉,并不意味着不会出错

TypeSafe 将 Jev 宣传为一款不会产生幻觉的模型。但这一保证仅适用于获准的输出结构。该模型不会给出预设选项之外的答案,但仍有可能在这些选项中作出与事实不符的选择。

这款模型旨在降低后台执行大量微小判断的成本。至于这些判断是否足够可靠,各家公司仍需针对自己的任务进行测试。开发者最初需要通过候补名单获得访问权限。

来源与参考

  1. 原始链接
  2. Former OpenAI researcher builds an AI model that judges options instead of writing text

收录于 2026-09-17