每天早上,業務助理打開信箱,面對的是一連串小判斷:這張訂單可以直接建單,還是要先問業務?這位客戶的付款條件要不要再審一次?這則 LINE 訊息是詢價、催貨,還是客訴?每個判斷只花幾十秒,但一天幾百件累積起來就是好幾個小時,而且大多靠資深同事的經驗。

這兩年,很多公司試著把這類判斷交給大型語言模型(LLM)。它確實判斷得出來,但會先寫一段話,程式還得從文字裡把答案挑出來;它說「我很確定」,也不代表真的比較可能對。

2026 年 9 月 15 日,美國新創 TypeSafe AI 發表了 Jev,走的是另一條路:不寫文字,直接回傳決策與信心值。這篇整理它是什麼、適合哪些工作、和 LLM 怎麼分工,以及想試用時該怎麼驗證。

Jev 是什麼?一個「不說話」的 AI 模型

Jev 是 TypeSafe AI 的第一個模型。這家公司位於舊金山、2024 年成立,執行長 Diogo Almeida 曾在 OpenAI 參與 RLHF、InstructGPT 與 ChatGPT 的研究。公司在 9 月 15 日結束隱身期,同時宣布由創投 DCVC 領投的 4,000 萬美元種子輪,Jev 也以有限的早期存取(early access)方式推出(SiliconANGLE)。

TypeSafe 把這類模型稱為 System One 模型(見官方發表文):名稱來自心理學家康納曼所說的「系統一」—— 快速、直覺的判斷,相對於慢慢推理的「系統二」。Jev 這個名字則取自經濟學家 Jevons,也就是「成本下降、用量反而暴增」的傑文斯悖論。

使用方式很單純:交給它一份「狀態」(一則客戶訊息、一筆訂單的 JSON 資料),再附上幾個事先定義好的問題。它會在一次呼叫裡同時回答所有問題,每個答案都是程式能直接使用的型別,而且只會從你給的選項裡選。問題有三種:

題型回傳什麼例子
Choice(選擇)從你列出的選項中挑一個,附上每個選項的機率與信心值這張訂單該走:直接建單/業務確認/信用審核/退回補資料
Score(評分)在你用文字描述的等級上打分數,附上各等級的機率與信心值這則客訴的急迫程度,1 到 5 級
Noul(是非)一個 0 到 1 之間、答案為「是」的機率這筆退貨符合退貨條件嗎?

和用 LLM 做同一個判斷,差在哪?

LLM 是一個字一個字產生文字的模型。拿它來做判斷,通常要請它「只回答 A、B、C 或 D」,再寫程式解析;答案越長越慢,費用也跟著字數走。Jev 則把結果直接放進你定義好的格式裡,不需要解析,也不會回出清單以外的答案。

左邊是 LLM 逐字產生一段文字、程式還要解析答案且沒有信心值;右邊是 Jev 直接回傳訂單分派的各選項機率、是否需主管覆核的機率與急迫程度分數
同一個訂單分派判斷:LLM 逐字寫出答案,程式還要解析;Jev 直接回傳每個選項的機率與信心值(數值為示意)。
用 LLM 做判斷用 Jev 做判斷
輸出一段文字,要再解析選項、分數或是非機率
信心通常沒有,或是它自己「說」的每個答案附機率與信心值
多個問題常要分次問或寫長提示一次呼叫、平行回答
速度與成本隨輸出字數增加原廠宣稱快很多、便宜很多(見下文)
能不能寫字能:回信、摘要、解釋不能

速度與成本方面,TypeSafe 宣稱在它挑選的判斷類工作上,Jev 比前沿 LLM 快、便宜約兩個數量級;在它自建的四個工作流程測試中,最高約 193 倍快、445 倍便宜(Tom's Hardware)。但請注意,這些都是原廠自己的數字:TypeSafe 在發表文中也承認,測試流程由自家團隊設計、可能有偏差,數字大概落在實際效益的高端。Forbes 的報導則提到,早期測試顯示速度與成本優勢明顯,但準確度略遜於最大型的模型。

LLM 仍然不可少的地方

Jev 不寫回信、不做摘要,也不做開放式的多步驟推理;它的輸入是文字或結構化資料,不直接看 PDF 或照片。這些仍然是 LLM 與 AI Agent 的工作。比較實際的組合是:

  1. LLM 讀懂:從客戶的訂單 PDF 或訊息中擷取欄位(見〈AI 讀懂訂單與報價單〉)。
  2. Jev 決定:這張單走哪條路、要不要人看。
  3. 系統執行:寫入 ERP、通知業務,或放進人工確認清單。

為什麼「信心值」是自動化的關鍵?

仔細看公司的日常流程,會發現大部分步驟其實是決策,而不是寫作:這張訂單該進哪個佇列?這筆退貨准不准?這則訊息屬於哪一類、該給誰?這筆交易是不是例外、需要主管看?

這類決策要自動化,難的從來不是「給出答案」,而是知道哪些答案可以放心交給系統。這就是校準(calibration)的意義:一個校準良好的模型說「0.8」時,在大量類似的判斷中,大約八成是對的。TypeSafe 說它用一種叫 RLCD(Reinforcement Learning for Calibrated Decisions)的訓練方法,目標就是讓機率「說實話」;不過在 Latent Space 的訪談中也提到,這個方法的細節尚未公開發表。

有了可信的信心值,就能設一條門檻:高於門檻的自動處理,低於門檻的轉給人。MarkTechPost 的程式教學示範的「依信心分流」就是這個模式。門檻設多少,取決於錯誤的代價:

  • 錯了代價小:例如分類客服訊息,分錯只是多轉手一次,門檻可以低一點。
  • 錯了代價大:例如核准退款或放寬付款條件,錯了會直接損失,門檻要高,甚至永遠保留人工覆核。
訂單、客戶訊息與退貨申請送進 Jev,信心高於門檻的自動寫入 ERP 或通知業務,低於門檻的進入人工確認佇列;下方是信心分布與可調整的門檻滑桿
用信心門檻分流(示意):高於門檻自動執行,低於門檻交給人;人工判斷的結果回存,用來定期檢查校準與調整門檻。

量大時,速度與成本也會變成關鍵:一天幾千筆訊息或訂單,每筆都要等 LLM 生成一段文字、付一次生成的費用,累積起來很可觀。TypeSafe 公布的回應時間是每次 70 到 500 毫秒;上市時的價格是每百萬輸入 token 0.042 美元、輸出不另計費(原廠數字,早期存取期間可能調整)。

傳統產業可以怎麼用?(示意情境)

以下是我們整理的示意情境,不是實際客戶案例:

流程要做的決策題型有把握時沒把握時
訂單分派直接建單/業務確認/信用審核/退回補資料Choice自動寫入 ERP業助確認
客戶訊息分流詢價、催貨、客訴或其他;是否需要主管Choice+是非分給對應窗口客服主管分派
退貨/理賠審核是否符合退貨條件是非小額退貨自動核准專人審核
品檢放行依量測數據與檢驗紀錄判定是否放行是非放行品管複檢
信用與付款條件客戶風險等級 1 到 5Score套用標準條件財務主管決定

共同點是:選項事先說得出來、量大、錯了有機會補救,這和我們在〈傳產導入 AI 先別急著買工具〉裡建議的挑選標準一致。品檢如果要看影像,則要先由影像模型把結果轉成數據,Jev 再做判定。

導入前,用自己的歷史決策驗證

「有校準」不能只聽原廠說,要用你自己的資料測。我們建議這樣做:

  1. 整理歷史決策:挑一個流程,收集過去幾個月已經有結果的案例,包含當時的輸入資料與最後的正確答案。
  2. 看準確度,也看校準:把 Jev 的答案依信心分組,看每一組實際答對的比例。如果「信心 0.9 以上」那組只對了七成,代表它在你的業務上並沒有校準好。
  3. 影子模式:上線初期讓 Jev 在旁邊判斷、不執行,人照常作業,每週比對兩邊的差異。
  4. 設門檻:依錯誤的代價,選一個「自動處理比例」和「漏網錯誤」都能接受的門檻。
  5. 持續監控:追蹤自動比例、被人工推翻的次數,定期抽查自動處理的結果;換了新產品線或新客群,就重新驗證。

驗證結果可以整理成這樣的表(數字為示意):

信心區間筆數實際答對判讀
0.95 以上62097%可以自動處理
0.85–0.9521090%依錯誤代價決定
0.85 以下17068%交給人

另外,中文資料一定要自己測:截至本文撰寫時,我們沒有找到原廠公布的中文評測數據。

現況與注意事項

  • 仍在早期存取,開放方式還在變:Jev 上市時採候補名單,約一週後一度開放所有人註冊,隨即又因需求太大暫停新註冊。能不能申請到、條件如何,都還會變動。
  • 新公司、新模型:Jev 上市不到兩週,效能數字主要來自原廠,獨立的大規模驗證還不多。
  • 「不會亂回答」要正確理解:它不會回出選項以外的答案,但仍可能選錯,信心也可能偏高;Forbes 也提醒,它一樣要防範提示注入 —— 客戶寄來的內容,可能夾帶想操弄判斷的文字。
  • 資料會送到雲端:Jev 目前透過 TypeSafe 的雲端 API 使用,沒有可以自架的版本。處理個資或機密資料前,要先確認合約與資料處理條款。
  • 保留替換空間:把「輸入 → 選項+信心值」做成流程中的一個獨立節點,日後要換成其他模型或規則,不必重寫整個流程。

studiox 怎麼看

我們一直在關注這類決策模型。studiox 官網首頁的訂單自動化流程示意裡,負責分派的節點就是 Jev:AI 先讀懂訂單,Jev 判斷該走哪一條路,沒把握時才轉人工確認。這個分工的價值很直接 —— 把人的時間,留給真正需要判斷的案件。

但我們不會建議你因為一則新聞就改流程。比較穩的順序是:先找出量大、選項清楚的決策,用歷史資料做影子測試,讓數字說話,再決定用 Jev、LLM 還是單純的規則。

如果你有一個每天要重複判斷幾百次的流程,想知道適不適合交給決策模型,可以參考我們的 AI 導入與整合服務;要把判斷結果接回 ERP、LINE 客服等既有系統,則是系統整合服務的範圍。也歡迎直接和我們聊聊。