ChatGPT 共同發明人的新模型 Jev:不輸出文字,只回傳型別安全的判斷

Read this article in English →

ChatGPT 共同發明人的新模型 Jev:不輸出文字,只回傳型別安全的判斷

過去三年,幾乎所有新模型的賣點都是「更會講話」。9 月 15 日出關的 Jev 走了完全相反的方向:它不會跟你聊天,也不輸出任何一段自然語言。你丟一段狀態進去、附上一道結構化的問題,它回給你一個帶機率分布與信心值的型別結果——一個布林機率、一個從清單裡挑出來的選項,或是一個落在你自訂級距上的分數。開發這顆模型的 TypeSafe AI 把它定位成「給軟體用的 AI」,而不是給人讀的 AI。

這家公司憑什麼被看見

TypeSafe AI 是一家 2024 年成立的舊金山公司,共同創辦人兼執行長 Diogo Almeida 在 OpenAI 待了大約四年,經手過 RLHF、InstructGPT、ChatGPT 與 GPT-4 這一串專案;另外兩位共同創辦人 Erik Gafni 與 Sasha Sheng 同樣有相當深的 AI 資歷。公司在隱身兩年後,於 9 月 15 日同步宣布出關與 4,000 萬美元的種子輪,由創投 DCVC 領投;Forbes 引述知情人士報導,這輪投後估值約 2 億美元。DCVC 合夥人 James Hardiman 給的理由是,TypeSafe 處理的是「AI 目前最大的未解難題之一」——怎麼讓模型可靠地、大規模地被嵌進其他軟體裡。

Almeida 對現有生成式模型的評語相當直接:「我們一直在為人類最佳化,而我們現在非常擅長取悅人類。」言下之意是,把一顆為了討好人類讀者而訓練出來的模型,硬塞進一條需要穩定輸出的程式流程裡,本來就不是同一件事。

「System One 模型」是什麼意思

TypeSafe 把 Jev 稱為第一顆「System One 模型」,典故來自 Kahneman 那組快思/慢想的區分:System 1 負責快速、直覺、不需要展開推理的判斷。Jev 要接手的就是這一段——那些「一個懂行的人看一眼就能回答」的原子級問題,而不是需要長篇推理的任務。

模型名字本身也是個小彩蛋:Jev 取自 19 世紀經濟學家 William Stanley Jevons,也就是「Jevons 悖論」的那位——技術讓某項資源用起來更便宜,總消耗量反而會上升。TypeSafe 顯然預期,判斷一旦變得夠便宜,它會被塞進遠比現在更多的地方。

三種問題原語:Choice、Score、Noul

Jev 的 API 只認三種問題,官方文件稱之為 primitive:

原語問的問題回傳什麼
Choice從一份清單裡選一個選中的選項、每個選項的機率、一個信心值
Score依照你給的評分標準打分分數、每個級距的機率、一個信心值
Noul這句敘述成立嗎?一個 0 到 1 的機率值

Choice 最多支援 255 個離散選項,採兩階段獨立評分。Noul 沒有獨立的信心欄位,因為那個 0 到 1 的值本身就是確信程度——0.5 就代表模型完全無法判斷。Choice 與 Score 的信心值則是從機率分布推導出來的:分布越集中,信心越高;分布越平坦,信心越低。

所有問題都是針對同一份狀態、平行且彼此隔離地各跑一次。這是個重要的設計取捨:你沒辦法叫它「綜合考量三個因素之後給我結論」,官方的建議是把多因素問題拆成多道獨立問題,再用你自己的程式邏輯把答案組起來。

這也是信心值真正的用途。TypeSafe 的訓練方法叫 RLCD(Reinforcement Learning for Calibrated Decisions,面向校準決策的強化學習),目標是讓回傳的信心值和實際正確率對得上,而不是像傳統 RLHF 那樣訓練出一顆過度自信的模型。對得上之後,你就能在程式裡設門檻:高於某個信心值直接放行、中間帶去要更多資訊、低於門檻轉人工。

速度與價格:官方數字,以及該打的折扣

TypeSafe 給出的數字確實很誇張。端到端延遲落在 70 到 500 毫秒之間,對照前沿對話模型在同類工作上的 3 到 329 秒;定價是輸入每百萬 tokens 0.042 美元,輸出不計費——因為它用的是硬體感知的平行取樣,並不是自迴歸地逐 token 生成。換算成實際工作量,SiliconANGLE 列出的對照是每 1,000 次工作流程 0.39 美元,同樣的工作用 OpenAI GPT-5.6 Luna 要 3.31 美元、用 Anthropic Claude Haiku 4.5 要 19.49 美元。速度與成本的峰值倍數則被官方寫成最快 193.6 倍、最省 444.6 倍。

但這些數字要打幾個折扣,而且是 TypeSafe 自己先說的:整套 benchmark 由 TypeSafe 的能力團隊自行設計,「標準答案」取的是 GPT-6 Astra 與 Fable 5.1 兩顆模型答案的平均;官方明講這些倍數「預期會落在真實使用情境的高標」,也就是你自己接起來大概率沒這麼漂亮。更坦白的一句是,TypeSafe 表示它沒辦法證明目前的價格沒有被補貼。截至目前,還沒有獨立第三方複現過這組數字。

「零幻覺」指的是什麼,不是什麼

TypeSafe 的行銷語彙裡有「零幻覺」這個說法,但它的意思比字面窄得多:因為輸出被結構性地約束在你宣告的型別裡,Jev 保證回傳值一定符合 schema,不會吐出無法解析的東西、也不需要外掛一層 JSON 修復或 guardrail。但官方自己也寫得很清楚——答案本身還是可能是錯的。schema 正確不等於判斷正確,這兩件事在這裡被刻意分開講。

怎麼接,以及目前的限制

Jev 目前只有託管 API 一條路,走早期存取候補名單,官方提供 Python(3.10 以上)與 JavaScript SDK。模型權重、參數量都沒有公開,也不提供自架選項。分發上已經有兩個現成入口:Cloudflare Workers AI 以 typesafe/jev 這個 model ID 提供,文件標示的上下文長度是 32K tokens;Java 生態這邊,Spring AI 也在 9 月 21 日發文介紹了對應的整合方式。目前的穩定版本是 jev-1.13.0。

架構上,Jev 是 transformer-based,但據稱完全用合成資料訓練。技術細節沒有公開,部分觀察者推測底層可能建立在某個開放權重的 LLM 上——這點 TypeSafe 沒有證實。

什麼時候該用它,什麼時候不該

官方與媒體列出的典型場景,幾乎都落在同一個形狀上:判斷很頻繁、單次判斷很簡單、但用手寫規則會很脆弱。例如客服工單分類與路由、業務名單評分、信任與安全審查、文件分類、履歷初篩、發票稽核、資安告警分級,甚至保險核保裡的火災風險評估。還有一個越來越常見的用法是拿它當驗證層——去審查另一顆 LLM 或 AI agent 吐出來的結果,因為這種審查本身就是高頻、原子、而且只需要一個布林值或分數的工作。

反過來說,需要展開推理、需要解釋理由、需要生成內容,或是必須一次權衡多個彼此獨立因素的任務,就不是 Jev 的守備範圍——官方文件的建議是把問題拆開,或乾脆交給對話模型。

對開發者來說,Jev 真正想取代的其實不是 GPT,而是那一大坨介於「寫死的 if-else」與「呼叫 LLM 再想辦法把 JSON 挖出來」之間的膠水程式。這塊確實痛、也確實值得有更好的解法;只是在獨立評測出現之前,那些四百倍的數字最好還是先當成廠商的最佳情境,而不是你的預算依據。

關於作者

我是 Ryan,RyanOps 的站主。平日的工作是軟體開發與自動化,在這裡整理 AI 模型、開發工具與軟體工程的重要變化,也記錄自己實際除錯、實作過的技術筆記。

關於本站與編輯流程 →