Jev推出以概率输出为核心的决策模型
Simon Willison··作者 Simon Willison
关键信息
Jev支持三类问题:返回0到1概率的Noul是非问题、针对给定选项返回整体置信度及各选项概率分布的选择问题,以及在所描述数值范围内给出分数的评分问题。当前模型处理数字、日期和对抗性内容的能力较弱,而且数值输出不会解释哪些输入信号导致了该决策。
资讯摘要
TypeSafe AI最近发布了Jev,这是其所谓System One模型的首个实例,也可以理解为一种决策模型。Jev仍然接收文本输入,但输出不是自然语言,而是针对类别、二元问题、评级以及相关置信信息的浮点数。TypeSafe将其描述为一种前沿智能函数调用:输入非结构化状态,输出带有类型的概率决策。调用者可以使用字符串、字符串数组或名称—值对构造状态,用来描述文章、客户或其他记录,然后通过API提交多个问题。
Noul问题返回某个陈述为真的置信度,选择问题返回一个选项以及所有候选项的概率分布,评分问题则根据带有文字描述的数值范围返回一个分数。多个问题可以并行评估,因此针对同一文档提出许多问题,耗时应当与只提出一个问题大致相近。Jev只对输入收费,输出免费,首个模型的输入价格为每百万个标记0.042美元,但文档指出它目前不擅长处理数字、日期和对抗性内容。决策模型的定位使它适合垃圾邮件检测、标签建议、优先级排序、排名和搜索重排,但它也带来透明度问题,因为单独的概率数值无法说明哪些内容信号促成了结果。
资讯正文
上周,TypeSafe AI 发布了 Jev,这是他们所谓“System One 模型”这一全新模型类别的首个范例(我赞同 Maggie Appleton 的看法,认为称其为“决策模型”更合适)。Jev 是常见 LLM 形式的一种有趣变体:它仍然接收文本输入,但输出的不是文本,而是与类别、是非问题、评分及相应置信度对应的浮点数。
TypeSafe 是这样描述 Jev 的:
“可以把 Jev 看作一次具备前沿智能的函数调用:输入非结构化状态,输出具有明确类型的概率性决策。”
它的速度也非常快,而且确实非常便宜。常规 LLM 按输入和输出 token 计费,输出的收费标准通常明显更高。Jev 只对输入收费,输出免费;其首个模型的输入价格为每百万 token 0.042 美元,甚至比 OpenAI 的 GPT-5 Nano(每百万 token 0.05 美元)还便宜。
Jev 允许你针对文本或半结构化数据提问。你可以构建一个名为“state”的对象,其中包含一个字符串、字符串数组或一组名称—值对——它可以描述一篇文章、一位客户或任何其他类型的记录。然后,你将该对象连同一个或多个问题发送至其 API,并获得每个问题的回答。
你可以提出三类问题:
• 是非问题,Jev 将其称为“Noul”问题。他们的 CEO 在 Hacker News 上确认,这个名称是 Bernoulli(伯努利)的缩写,源自伯努利分布。你提出一项陈述,模型会返回一个介于 0 和 1 之间的浮点数,表示它对该陈述为真的置信程度。
• 选择题,模型会从一组给定选项中选出一个;准确地说,它会返回一个置信度分数,以及涵盖所有选项的概率分布。
• 评分题,你需要提供一系列带有说明的数值等级,模型则会给出一个落在该范围内的浮点评分。
Jev API 可以接收单个文档(即“state”),以及在上下文窗口容量范围内尽可能多的问题。所有问题都会并行评估,因此发送多个问题所需的时间应该与只发送一个问题相近。
Jev 1.13 的“jaggedness”文档针对 Jev 的优势和弱点提供了实用说明。目前,它还不太擅长处理数字、日期或“对抗性内容”。
我认为,以“决策模型”来理解 Jev,有助于判断它适合用在哪里。对于任何可以表述为分类任务的工作,它都很擅长,例如垃圾信息检测、标签建议、优先级划分和排序。
我还一直在尝试将它用于搜索结果重排:先使用 BM25 这类廉价算法获取 100 个可能匹配的结果,然后让 Jev 根据原始查询对这 100 个候选结果的相关性进行评分。
黑箱重新流行起来
让我对 Jev 感到有些不安的一点是,它在很大程度上代表着向黑箱机器学习系统进一步倒退。
大型语言模型(LLM)本身已经是黑箱了——你可以要求它们解释自己的决策,但无法保证它们给出的解释有用或准确。
而 Jev 连这一点都不提供:无论你输入多少文本,最终得到的唯一结果就是一个浮点数。如果 Jev 将某项内容标记为垃圾信息,究竟是哪些内容信号导致了这个判断?
这也意味着,我们必须高度重视偏见问题。我真心希望没人会用 Jev 对求职者进行排序——那个浮点数可能掩盖模型中根深蒂固、却未被察觉的各种偏见,而通过实验把这些偏见逐一剖析出来,将是一件棘手的工作。
(我做过一次实验,让 Jev 对旧金山湾区的每个城市进行评分,问题是它们是否属于“好城市?”结果它把 Cupertino 排在第一,把 East Palo Alto 排在最后。呃。)
实际上,这意味着评估测试和结构化实验对于 Jev 项目来说,比对于普通 LLM 项目更加重要。值得庆幸的是,Jev 的成本非常低,因此让它运行数百甚至数千条实验性提示词,只需花费几美分。
Jev 的非传统用途
过去几天里,看着更广泛的社区不断提出 Jev 的潜在应用场景,真的很有趣。下面是一些引起我注意的创意用法:
- Kyle Pena 制作的 jevchat 将 Jev 变成了一个(很糟糕的)聊天模型。“在每一步,它都会向 Jev 提出一个问题:给定用户的问题以及目前已经写出的回复,接下来会出现哪个符号?” Hacker News 上的 ericpruitt 评论道:“这相当于数字版的 Morty 和死亡水晶对话。”
- Fatih Kadir Akın 制作的 jev-leftpad 使用提示词“在 value 前面需要多少个空格才能达到 targetLength?”实现了 left-pad,并通过一个选择查询提供从“需要 0 个空格”到“需要 10 个空格”的选项。
- Andy Gayton 制作的 jev-2048 使用 Jev 来玩 2048 滑块益智游戏。
开放权重模型的复刻版本
此外,近期还涌现出大量项目,尝试基于开放权重模型打造类似 Jev 的模型。Kev 就是一个有趣的例子,它使用 Qwen 3.5 构建了参数规模分别为 0.8B、4B 和 9B 的模型。这里还有相关的 Hacker News 讨论帖,其中有人链接到了 JevBench 基准测试;该测试已经开始用于比较“Jev 级决策模型”。
考虑到 Jev 发布还不到一周,围绕它展开的活动之多令人印象极为深刻。
来源与参考
收录于 2026-09-23