Jev 是什麼?直接給出決策與信心值的 AI 決策模型
TypeSafe AI 在 2026 年 9 月推出的 Jev,不像 LLM 一個字一個字寫答案,而是直接回傳選項、分數或是非機率,並附上校準過的信心值。本文說明它適合哪些營運決策、和 LLM 怎麼分工,以及導入前該怎麼用自己的資料驗證。

重點摘要
- Jev 不產生文字,而是針對你事先定義的問題,直接回傳選項、分數或是非機率,並附上信心值,程式可以直接接著用。
- 營運流程裡大多數步驟其實是決策:走哪個佇列、准不准、屬於哪一類、是不是例外 —— 這正是 Jev 瞄準的工作。
- 信心值要經過校準才能設門檻:有把握的自動處理,沒把握的轉給人,門檻由你依錯誤的代價決定。
- Jev 剛上市、仍在早期存取,速度與成本數字來自原廠自己的測試;先用自己的歷史決策做影子測試,再決定要不要上線。
文章目錄
每天早上,業務助理打開信箱,面對的是一連串小判斷:這張訂單可以直接建單,還是要先問業務?這位客戶的付款條件要不要再審一次?這則 LINE 訊息是詢價、催貨,還是客訴?每個判斷只花幾十秒,但一天幾百件累積起來就是好幾個小時,而且大多靠資深同事的經驗。
這兩年,很多公司試著把這類判斷交給大型語言模型(LLM)。它確實判斷得出來,但會先寫一段話,程式還得從文字裡把答案挑出來;它說「我很確定」,也不代表真的比較可能對。
2026 年 9 月 15 日,美國新創 TypeSafe AI 發表了 Jev,走的是另一條路:不寫文字,直接回傳決策與信心值。這篇整理它是什麼、適合哪些工作、和 LLM 怎麼分工,以及想試用時該怎麼驗證。
Jev 是什麼?一個「不說話」的 AI 模型
Jev 是 TypeSafe AI 的第一個模型。這家公司位於舊金山、2024 年成立,執行長 Diogo Almeida 曾在 OpenAI 參與 RLHF、InstructGPT 與 ChatGPT 的研究。公司在 9 月 15 日結束隱身期,同時宣布由創投 DCVC 領投的 4,000 萬美元種子輪,Jev 也以有限的早期存取(early access)方式推出(SiliconANGLE)。
TypeSafe 把這類模型稱為 System One 模型(見官方發表文):名稱來自心理學家康納曼所說的「系統一」—— 快速、直覺的判斷,相對於慢慢推理的「系統二」。Jev 這個名字則取自經濟學家 Jevons,也就是「成本下降、用量反而暴增」的傑文斯悖論。
使用方式很單純:交給它一份「狀態」(一則客戶訊息、一筆訂單的 JSON 資料),再附上幾個事先定義好的問題。它會在一次呼叫裡同時回答所有問題,每個答案都是程式能直接使用的型別,而且只會從你給的選項裡選。問題有三種:
| 題型 | 回傳什麼 | 例子 |
|---|---|---|
| Choice(選擇) | 從你列出的選項中挑一個,附上每個選項的機率與信心值 | 這張訂單該走:直接建單/業務確認/信用審核/退回補資料 |
| Score(評分) | 在你用文字描述的等級上打分數,附上各等級的機率與信心值 | 這則客訴的急迫程度,1 到 5 級 |
| Noul(是非) | 一個 0 到 1 之間、答案為「是」的機率 | 這筆退貨符合退貨條件嗎? |
和用 LLM 做同一個判斷,差在哪?
LLM 是一個字一個字產生文字的模型。拿它來做判斷,通常要請它「只回答 A、B、C 或 D」,再寫程式解析;答案越長越慢,費用也跟著字數走。Jev 則把結果直接放進你定義好的格式裡,不需要解析,也不會回出清單以外的答案。

| 用 LLM 做判斷 | 用 Jev 做判斷 | |
|---|---|---|
| 輸出 | 一段文字,要再解析 | 選項、分數或是非機率 |
| 信心 | 通常沒有,或是它自己「說」的 | 每個答案附機率與信心值 |
| 多個問題 | 常要分次問或寫長提示 | 一次呼叫、平行回答 |
| 速度與成本 | 隨輸出字數增加 | 原廠宣稱快很多、便宜很多(見下文) |
| 能不能寫字 | 能:回信、摘要、解釋 | 不能 |
速度與成本方面,TypeSafe 宣稱在它挑選的判斷類工作上,Jev 比前沿 LLM 快、便宜約兩個數量級;在它自建的四個工作流程測試中,最高約 193 倍快、445 倍便宜(Tom's Hardware)。但請注意,這些都是原廠自己的數字:TypeSafe 在發表文中也承認,測試流程由自家團隊設計、可能有偏差,數字大概落在實際效益的高端。Forbes 的報導則提到,早期測試顯示速度與成本優勢明顯,但準確度略遜於最大型的模型。
LLM 仍然不可少的地方
Jev 不寫回信、不做摘要,也不做開放式的多步驟推理;它的輸入是文字或結構化資料,不直接看 PDF 或照片。這些仍然是 LLM 與 AI Agent 的工作。比較實際的組合是:
- LLM 讀懂:從客戶的訂單 PDF 或訊息中擷取欄位(見〈AI 讀懂訂單與報價單〉)。
- Jev 決定:這張單走哪條路、要不要人看。
- 系統執行:寫入 ERP、通知業務,或放進人工確認清單。
為什麼「信心值」是自動化的關鍵?
仔細看公司的日常流程,會發現大部分步驟其實是決策,而不是寫作:這張訂單該進哪個佇列?這筆退貨准不准?這則訊息屬於哪一類、該給誰?這筆交易是不是例外、需要主管看?
這類決策要自動化,難的從來不是「給出答案」,而是知道哪些答案可以放心交給系統。這就是校準(calibration)的意義:一個校準良好的模型說「0.8」時,在大量類似的判斷中,大約八成是對的。TypeSafe 說它用一種叫 RLCD(Reinforcement Learning for Calibrated Decisions)的訓練方法,目標就是讓機率「說實話」;不過在 Latent Space 的訪談中也提到,這個方法的細節尚未公開發表。
有了可信的信心值,就能設一條門檻:高於門檻的自動處理,低於門檻的轉給人。MarkTechPost 的程式教學示範的「依信心分流」就是這個模式。門檻設多少,取決於錯誤的代價:
- 錯了代價小:例如分類客服訊息,分錯只是多轉手一次,門檻可以低一點。
- 錯了代價大:例如核准退款或放寬付款條件,錯了會直接損失,門檻要高,甚至永遠保留人工覆核。

量大時,速度與成本也會變成關鍵:一天幾千筆訊息或訂單,每筆都要等 LLM 生成一段文字、付一次生成的費用,累積起來很可觀。TypeSafe 公布的回應時間是每次 70 到 500 毫秒;上市時的價格是每百萬輸入 token 0.042 美元、輸出不另計費(原廠數字,早期存取期間可能調整)。
傳統產業可以怎麼用?(示意情境)
以下是我們整理的示意情境,不是實際客戶案例:
| 流程 | 要做的決策 | 題型 | 有把握時 | 沒把握時 |
|---|---|---|---|---|
| 訂單分派 | 直接建單/業務確認/信用審核/退回補資料 | Choice | 自動寫入 ERP | 業助確認 |
| 客戶訊息分流 | 詢價、催貨、客訴或其他;是否需要主管 | Choice+是非 | 分給對應窗口 | 客服主管分派 |
| 退貨/理賠審核 | 是否符合退貨條件 | 是非 | 小額退貨自動核准 | 專人審核 |
| 品檢放行 | 依量測數據與檢驗紀錄判定是否放行 | 是非 | 放行 | 品管複檢 |
| 信用與付款條件 | 客戶風險等級 1 到 5 | Score | 套用標準條件 | 財務主管決定 |
共同點是:選項事先說得出來、量大、錯了有機會補救,這和我們在〈傳產導入 AI 先別急著買工具〉裡建議的挑選標準一致。品檢如果要看影像,則要先由影像模型把結果轉成數據,Jev 再做判定。
導入前,用自己的歷史決策驗證
「有校準」不能只聽原廠說,要用你自己的資料測。我們建議這樣做:
- 整理歷史決策:挑一個流程,收集過去幾個月已經有結果的案例,包含當時的輸入資料與最後的正確答案。
- 看準確度,也看校準:把 Jev 的答案依信心分組,看每一組實際答對的比例。如果「信心 0.9 以上」那組只對了七成,代表它在你的業務上並沒有校準好。
- 影子模式:上線初期讓 Jev 在旁邊判斷、不執行,人照常作業,每週比對兩邊的差異。
- 設門檻:依錯誤的代價,選一個「自動處理比例」和「漏網錯誤」都能接受的門檻。
- 持續監控:追蹤自動比例、被人工推翻的次數,定期抽查自動處理的結果;換了新產品線或新客群,就重新驗證。
驗證結果可以整理成這樣的表(數字為示意):
| 信心區間 | 筆數 | 實際答對 | 判讀 |
|---|---|---|---|
| 0.95 以上 | 620 | 97% | 可以自動處理 |
| 0.85–0.95 | 210 | 90% | 依錯誤代價決定 |
| 0.85 以下 | 170 | 68% | 交給人 |
另外,中文資料一定要自己測:截至本文撰寫時,我們沒有找到原廠公布的中文評測數據。
現況與注意事項
- 仍在早期存取,開放方式還在變:Jev 上市時採候補名單,約一週後一度開放所有人註冊,隨即又因需求太大暫停新註冊。能不能申請到、條件如何,都還會變動。
- 新公司、新模型:Jev 上市不到兩週,效能數字主要來自原廠,獨立的大規模驗證還不多。
- 「不會亂回答」要正確理解:它不會回出選項以外的答案,但仍可能選錯,信心也可能偏高;Forbes 也提醒,它一樣要防範提示注入 —— 客戶寄來的內容,可能夾帶想操弄判斷的文字。
- 資料會送到雲端:Jev 目前透過 TypeSafe 的雲端 API 使用,沒有可以自架的版本。處理個資或機密資料前,要先確認合約與資料處理條款。
- 保留替換空間:把「輸入 → 選項+信心值」做成流程中的一個獨立節點,日後要換成其他模型或規則,不必重寫整個流程。
studiox 怎麼看
我們一直在關注這類決策模型。studiox 官網首頁的訂單自動化流程示意裡,負責分派的節點就是 Jev:AI 先讀懂訂單,Jev 判斷該走哪一條路,沒把握時才轉人工確認。這個分工的價值很直接 —— 把人的時間,留給真正需要判斷的案件。
但我們不會建議你因為一則新聞就改流程。比較穩的順序是:先找出量大、選項清楚的決策,用歷史資料做影子測試,讓數字說話,再決定用 Jev、LLM 還是單純的規則。
如果你有一個每天要重複判斷幾百次的流程,想知道適不適合交給決策模型,可以參考我們的 AI 導入與整合服務;要把判斷結果接回 ERP、LINE 客服等既有系統,則是系統整合服務的範圍。也歡迎直接和我們聊聊。


