Jev:一个只做决定、不说话的模型

生产环境里的大部分 AI 代码,说穿了就是一条伪装起来的 if 语句。

这张工单是账单问题还是 bug?这条评论是不是垃圾信息?这条回复有没有泄露电话号码?这个线索该转给销售还是客服?我们把这些问题丢给聊天模型,客客气气地请它用 JSON 回答,再解析结果,然后祈祷它别自己发明出第四个分类。这样能用,但又慢又贵,还有点荒唐:我们只想从五个词里挑一个,却在花钱请一个模型写文章。

TypeSafe AI 推出的 Jev 押注的是:这类工作值得一种专门的模型。它于 2026 年 9 月 15 日开放有限的抢先体验。我还没有真正用它做过东西,所以这篇不是实战报告,而是对发布资料和早期评测的解读。但它依然值得了解,因为这个想法比产品本身更大。

它是什么

Jev 不生成文本。你给它一段状态(字符串、对象或数组)和一组类型化的问题,它为每个问题返回一个类型化的答案,外加概率分布和置信度分数。

问题有三种类型:

  • Choice:从你定义的列表中选一个。“这张工单属于账单、bug、功能需求还是其他?”
  • Score:把输入放到你定义的有序量表上。“紧急程度从低到致命,算哪一档?”
  • Noul:是或否。“这条消息里包含个人联系方式吗?”

答案只可能是你允许的值之一。TypeSafe 说,类型错误不是“罕见”,而是从结构上“不可能”。它根本没有字符串输出,也就无处产生幻觉。

TypeSafe 把它称为 System One 模型,名字取自丹尼尔·卡尼曼所说的快速、直觉式的“系统 1”思维。聊天模型是缓慢、审慎的系统 2:一个 token 接一个 token 地出声推理。Jev 则负责瞬间判断。用他们自己的话说,这是“一次具备前沿智能的函数调用”:输入非结构化的状态,输出类型化的概率决策。

名字致敬的是经济学家威廉·斯坦利·杰文斯。他发现,蒸汽机烧煤的效率提高之后,煤的消耗不减反增。寓意很明白:把判断做得足够便宜,人们就会把它放到每一个角落。

它有什么不同

据 TypeSafe 介绍,有三点:

所有答案并行采样。 聊天模型逐个生成 token。Jev 的采样器一次性产生全部输出(非自回归),所以对同一个输入问五个问题,成本和问一个差不多。速度就来自这里:TypeSafe 给出的端到端耗时是 70 到 500 毫秒。

为校准而训练,而不是为偏好。 聊天模型用 RLHF 调优,奖励的是人们喜欢的回答。Jev 用的是 TypeSafe 所说的 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习),奖励的是诚实的概率。目标是:Jev 说 90% 的时候,它确实有大约 90% 的概率是对的。这一点比听起来更重要:只有置信度可信,你才能决定什么时候放手自动化,什么时候交给人来判断。

价格像水电煤一样。 发布定价是每百万输入 token 0.042 美元,输出免费。TypeSafe 的说法是“便宜到不值得计量”,既然输出只是几个数字,这话也不算夸张。

综合起来,他们的核心主张是:在这类任务上比前沿 LLM 快 40 到 200 倍、便宜 40 到 400 倍,在内部工作流评测中最高达到快 193.6 倍、便宜 444.6 倍。请把这些当作厂商数据来看。TypeSafe 自己也承认,这些工作流是内部搭建的,结果很可能偏向上限。

它适合放在哪里

Jev 不是聊天机器人,也不是智能体。它是一个组件,放在你代码里需要做判断的地方:

  • 路由与分流:交给哪个队列、哪个团队、哪个模型处理。
  • 护栏:在 LLM 的输出发出去之前,检查有没有违规内容或数据泄露,速度快到每条回复都可以跑一遍。
  • 打分:给销售线索、内容质量、相关性排序。
  • 大规模批处理:给数百万条记录分类,这种任务里单次调用的成本决定了它到底做不做得起来。
  • 实时链路:任何用户能感觉到两秒模型调用延迟的地方。

早期评测推荐的用法很巧妙。互相独立的问题一次调用全部问完,反正它们是并行跑的。与其问一个含糊的“总体评分”,不如问几个 Score,再在自己的代码里组合。用置信度来把关动作:比如低于 0.5 的交给人工,执行任何破坏性操作前要求 0.9 左右。真正放权之前,先让它在现有逻辑旁边以影子模式跑一段时间。

它在哪里会失灵

局限和优点一样重要,而且都直接源自它的设计:

  • 不会写。 不能写摘要、回复或草稿。只要输出是文字,你还是需要 LLM。
  • 不会数数,也不会算术。 计数、算术和精确测量都不可靠。Score 适合排序,不适合衡量大小。
  • 日期和先后顺序是弱项。 别问它两个日期哪个在前。
  • 只会挑,不会起名。 你给它候选项让它选,抽取就能用;要它自己产出一个新值,就不行。
  • 只支持文本。 不能输入图片或音频。
  • 答案空间有限。 每个问题最多 255 个选项,更多的话需要两阶段方案。schema 必须事先定义好。

一篇早期评测给出的坦率总结,是我最想记住的:事实交给确定性的代码,Jev 只用在夹在中间的那些模糊判断上。还有,你实际能省多少钱,取决于你的 AI 账单里本来有多大比例花在分类上。很多应用里这是大头,也有些应用几乎为零。

为什么我觉得它重要

过去几年,我们养成了一个习惯:任何 AI 任务都先搬出最大的聊天模型,再从它嘴里挤出结构化数据。Jev 干净利落地指出,这只是习惯,不是定律。我们口中的“AI 功能”,很多其实是决策,而决策和对话的要求不同:要快、要便宜、要有边界,还要诚实地说明自己有多确定。

Jev 本身能不能胜出还很难说。它还在抢先体验阶段,基准测试是自家做的,大厂也可能推出类似的东西。但它指向的分工让人觉得是对的:一个慢模型负责思考和写作,一个快模型只负责做决定。如果这种分工真的普及开来,名字里的杰文斯悖论也许会成为这次发布中最准确的部分。便宜的判断不会让 AI 用得更少,只会让每一个 if 背后都站着一个小模型。

参考资料