正式環境裡的大部分 AI 程式碼,說穿了就是一條偽裝起來的 if 敘述。
這張工單是帳單問題還是 bug?這則留言是不是垃圾訊息?這則回覆有沒有洩漏電話號碼?這個潛在客戶該轉給業務還是客服?我們把這些問題丟給聊天模型,客客氣氣地請它用 JSON 回答,再解析結果,然後祈禱它別自己發明出第四個分類。這樣能用,但又慢又貴,還有點荒謬:我們只想從五個詞裡挑一個,卻在花錢請一個模型寫文章。
TypeSafe AI 推出的 Jev 押注的是:這類工作值得一種專門的模型。它在 2026 年 9 月 15 日開放有限的搶先體驗。我還沒有真正用它做過東西,所以這篇不是實戰報告,而是對發表資料和早期評測的解讀。但它依然值得了解,因為這個想法比產品本身更大。
它是什麼
Jev 不生成文字。你給它一段狀態(字串、物件或陣列)和一組型別化的問題,它會為每個問題回傳一個型別化的答案,外加機率分布和信心分數。
問題有三種型別:
- Choice:從你定義的清單中選一個。「這張工單屬於帳單、bug、功能需求還是其他?」
- Score:把輸入放到你定義的有序量表上。「緊急程度從低到致命,算哪一級?」
- Noul:是或否。「這則訊息裡包含個人聯絡方式嗎?」
答案只可能是你允許的值之一。TypeSafe 表示,型別錯誤不是「罕見」,而是在結構上「不可能」。它根本沒有字串輸出,也就無處產生幻覺。
TypeSafe 把它稱為 System One 模型,名稱取自丹尼爾·康納曼所說的快速、直覺式的「系統一」思考。聊天模型是緩慢、審慎的系統二:一個 token 接一個 token 地出聲推理。Jev 則負責瞬間判斷。用他們自己的話說,這是「一次具備前沿智慧的函式呼叫」:輸入非結構化的狀態,輸出型別化的機率決策。
名字致敬的是經濟學家威廉·史丹利·傑文斯。他發現,蒸汽機燒煤的效率提高之後,煤的消耗不減反增。寓意很明白:把判斷做得夠便宜,人們就會把它放到每一個角落。
它有什麼不同
根據 TypeSafe 的說法,有三點:
所有答案平行取樣。 聊天模型逐一生成 token。Jev 的取樣器一次產生全部輸出(非自迴歸),所以對同一個輸入問五個問題,成本和問一個差不多。速度就來自這裡:TypeSafe 給出的端到端耗時是 70 到 500 毫秒。
為校準而訓練,而不是為偏好。 聊天模型用 RLHF 調校,獎勵的是人們喜歡的回答。Jev 用的是 TypeSafe 所稱的 RLCD(Reinforcement Learning for Calibrated Decisions,針對校準決策的強化學習),獎勵的是誠實的機率。目標是:Jev 說 90% 的時候,它確實有大約 90% 的機率是對的。這一點比聽起來更重要:只有信心分數可信,你才能決定什麼時候放手自動化,什麼時候交給人來判斷。
價格像水電一樣。 發表時的定價是每百萬輸入 token 0.042 美元,輸出免費。TypeSafe 的說法是「便宜到不值得計量」,既然輸出只是幾個數字,這話也不算誇張。
綜合起來,他們的核心主張是:在這類任務上比前沿 LLM 快 40 到 200 倍、便宜 40 到 400 倍,在內部工作流程評測中最高達到快 193.6 倍、便宜 444.6 倍。請把這些當作廠商數據來看。TypeSafe 自己也承認,這些工作流程是內部建置的,結果很可能偏向上限。
它適合放在哪裡
Jev 不是聊天機器人,也不是 AI 代理。它是一個元件,放在你程式碼裡需要做判斷的地方:
- 路由與分流:交給哪個佇列、哪個團隊、哪個模型處理。
- 護欄:在 LLM 的輸出送出之前,檢查有沒有違規內容或資料外洩,速度快到每則回覆都能跑一遍。
- 評分:替潛在客戶、內容品質、相關性排序。
- 大規模批次處理:替數百萬筆紀錄分類,這種任務裡單次呼叫的成本決定了它到底做不做得起來。
- 即時流程:任何使用者感覺得到兩秒模型呼叫延遲的地方。
早期評測推薦的用法很巧妙。彼此獨立的問題一次呼叫全部問完,反正它們是平行跑的。與其問一個含糊的「整體評分」,不如問幾個 Score,再在自己的程式碼裡組合。用信心分數來把關動作:例如低於 0.5 的交給人工,執行任何破壞性操作前要求 0.9 左右。真正放權之前,先讓它在現有邏輯旁邊以影子模式跑一段時間。
它在哪裡會失靈
限制和優點一樣重要,而且都直接源自它的設計:
- 不會寫。 不能寫摘要、回覆或草稿。只要輸出是文字,你還是需要 LLM。
- 不會數數,也不會算術。 計數、算術和精確測量都不可靠。Score 適合排序,不適合衡量大小。
- 日期和先後順序是弱項。 別問它兩個日期哪個在前。
- 只會挑,不會命名。 你給它候選項讓它選,擷取就能用;要它自己產出一個新值,就不行。
- 只支援文字。 不能輸入圖片或音訊。
- 答案空間有限。 每個問題最多 255 個選項,更多的話需要兩階段方案。schema 必須事先定義好。
一篇早期評測給出的坦率總結,是我最想記住的:事實交給確定性的程式碼,Jev 只用在夾在中間的那些模糊判斷上。還有,你實際能省多少錢,取決於你的 AI 帳單裡原本有多大比例花在分類上。很多應用程式裡這是大宗,也有些應用程式幾乎為零。
為什麼我覺得它重要
過去幾年,我們養成了一個習慣:任何 AI 任務都先搬出最大的聊天模型,再從它身上擠出結構化資料。Jev 乾淨俐落地指出,這只是習慣,不是定律。我們口中的「AI 功能」,很多其實是決策,而決策和對話的要求不同:要快、要便宜、要有邊界,還要誠實地說明自己有多確定。
Jev 本身能不能勝出還很難說。它還在搶先體驗階段,基準測試是自家做的,大廠也可能推出類似的東西。但它指向的分工讓人覺得是對的:一個慢模型負責思考和寫作,一個快模型只負責做決定。如果這種分工真的普及,名字裡的傑文斯悖論也許會成為這次發表中最準確的部分。便宜的判斷不會讓 AI 用得更少,只會讓每一個 if 背後都站著一個小模型。
參考資料
- Introducing System One Models & Jev,TypeSafe AI
- Jev (AI model),Wikipedia
- A deep dive into Jev, TypeSafe’s System One model,Flavio Copes