工程師社群怎麼看 Jev 讚美 質疑 和中文圈的第一份實測
☰ 目錄 table-of-contents.md
Jev 發布那天,工程師聚集的科技討論區 Hacker News 上,討論串原本的標題寫著「新一代頂尖模型,便宜 40 到 400 倍、快 20 到 200 倍」。不到一個小時,標題就被改成平淡的「推出 System One 模型與 Jev」,有網友在留言裡特別點出這件事。接下來兩週,這種「數字很驚人,但先別急著信」的氣氛,一直是社群討論 Jev 的主旋律。
整理 Hacker News、Reddit、X、部落格和中文媒體的討論,大致分成兩邊。實際拿它做東西的開發者,多半稱讚它又快又便宜、很適合放進現有系統做判斷;懷疑的一方則認為它是把老技術重新包裝、「不會亂編答案」的說法誤導人,而且官方刻意不公布標準測驗成績。中文圈目前唯一一份實測,得到的結論很中肯:它最快也最便宜,但準確度沒有比較高。我們自己把 Jev 接進網站導覽員之後,也得到差不多的結論,下面把各方說法整理清楚。
本文引用的討論、留言與數字查證於 2026 年 9 月 27 日,留言引用皆為我們的中文翻譯,原文請見各連結。
發布當天 一則貼文三千九百萬次觀看
熱度是從 TypeSafe 執行長 Diogo Almeida 的發布貼文開始的。他自稱是 ChatGPT 的共同發明人之一,貼文寫著 Jev「快 20 到 200 倍、便宜 40 到 400 倍」,到 9 月 27 日已經有大約 3,970 萬次觀看。他也在下一則貼文先講清楚代價:Jev 不能產生文字。
同一天,科技媒體 Every 的創辦人 Dan Shipper 發文說他們已經測了大約一週,拿它當「評審」判斷答案好壞,比頂級大型模型快 25 倍、便宜 600 倍。三天後,Vercel 公布上線 24 小時就有將近 13% 的付費客戶在用。9 月 20 日,TypeSafe 宣布取消候補名單,所有人都能直接使用。
Hacker News 上吵什麼
最多人討論的是「不會亂編答案」這句話。官方的意思是,Jev 只能從你給的選項裡選,格式一定正確,不會生出不存在的答案。網友 jacobgold 一句話點破:它確實不會回傳錯誤的格式,但還是可能在合法的選項裡選錯。執行長親自回覆,說這其實是所有機器學習模型的共同問題,就像不會有人說傳統的機器學習模型「在亂編」一樣,算是承認了這是定義上的差異。
第二個焦點是那些倍數。網友 ramon156 認為,拿「0.07 到 0.5 秒」去比大型語言模型的「3 到 329 秒」,除非兩邊做的是同樣的事,否則是拿蘋果比橘子。還有人注意到,官方說明裡寫著「我們刻意不公布公開標準測驗的成績」,網友 jceg 的回應很直接:如果成績好看,他們應該早就公布了。
第三種聲音認為它沒那麼新。有人說這只是把早就存在的「文字分類模型」做得更大、更好用。不過也有人給出很具體的正面用法:比對族譜資料裡的同名人物、把一千篇文章排出優先順序、取代原本用向量相似度做的大量分類。討論串裡,執行長前後回了 24 則留言,另一位員工回了 15 則,算是很願意面對質疑的團隊。
Reddit 的反彈 只是換了包裝的分類器
在喜歡自己架 AI 的 Reddit 社群 r/LocalLLaMA,反應冷淡得多。有人發文問「有沒有能自己架的 Jev?」,底下回覆紛紛推薦早就開源的文字分類模型。另一篇「我真的不懂 Jev 在紅什麼」裡,有網友評論它的準確度跟 2018、2019 年的分類模型差不多,好處只是不用針對每個任務重新訓練。
也有人替它說話。在「Jev 不是新技術」這篇底下,網友 radarsat1 回說:重點不在它是不是全新的東西,而在它好像真的很好用。不過因為相關貼文太多,還有人請版主處理「半個論壇都是 Jev 廣告」。
Jev 沒有開放下載,也促成了一波「自己做一個」的風潮。社群陸續出現 OpenJev 這類開源仿製品,還有人整理了一份仿製品清單。Hacker News 上也有團隊把一個開源模型改造成類似 Jev 的決策模型,說準確度和速度都差不多,但也承認每次判斷的成本還是 Jev 便宜好幾倍。
實際測過的人怎麼說
知名開發者 Simon Willison 替自己的工具做了 Jev 外掛,寫下測試心得。他讓 Jev 對舊金山灣區每個城市回答「這是不是好城市」,結果 Cupertino 排第一、East Palo Alto 排最後。他的提醒很值得記下來:希望沒有人拿 Jev 來排序求職者,那一個小數點後的數字,可能藏著各種看不見的偏見;也因為這樣,用它之前做好測試,比一般 AI 專案更重要。
技術部落客 Alex Molas 從另一個角度提出質疑,文章標題就叫〈Jev 沒辦法被校準〉。他的意思是,Jev 說「九成把握」,是在 TypeSafe 自己的資料上算出來的;換到你的資料,九成可能只有七成準。他建議把 Jev 的數字當成「排序用的分數」,而不是真正的機率。
我們在上一篇整理的實作裡也有一個反例:有開發者用 2,000 封信測釣魚信判斷,Jev 的準確率輸給一般的小型語言模型,贏在快將近三倍、便宜十幾倍。
中文圈的討論與第一份實測
台灣的科技媒體 iThome 報導時一針見血:「型別正確不代表判斷正確,Jev 仍可能在合法選項中選錯答案」,也提到官方那組驚人的倍數,是 TypeSafe 自己設計的測試流程跑出來的,官方也承認可能存在偏差。INSIDE 則做了發布消息的整理,Frank Chiu 的介紹文特別提醒:「即使 confidence 為 1,仍不保證答案正確。」
目前找到最完整的中文實測,是中國科技媒體硅星人的測試,新浪財經有轉載。他們拿 50 則中文電商客服訊息,每則要同時判斷四件事:多緊急、是不是售前詢問、屬於哪一類、有多嚴重,四項都對才算答對。結果 Jev 完全答對的比例約 64% 到 65.2%,在便宜小模型這組排第二,只比第一名少 1.2 分;放到較強的模型組就排在後面。
我們之前在客服信箱自動分類用的是一般語言模型,這份測試剛好可以拿來對照。但速度和價格是另一回事:Jev 每題約 0.73 到 0.75 秒,50 題總共大約 0.002 美元,兩項都是全場最低;比它多拿一點分的模型,每題要 5.58 秒。他們還發現一個實務上很重要的細節:人工標準是「嚴重度 2.00 以上轉給真人」,Jev 給了 1.99 就被算失分;重複測 15 次,有 3 題時而及格、時而不及格。結論是:這組測試很難支持「Jev 是更聰明的模型」,它提供的是一組取捨,少等一點、少花一點,但接受一些準確度的差距。
估值與商業面
財經新聞也跟上了。付費科技媒體 The Information 報導,TypeSafe 正在洽談新一輪 10 億美元以上的募資,估值 100 億美元以上。依 AI Weekly 的整理,這大約是不到兩週前種子輪估值的 50 倍。這是洽談中的消息,公司沒有證實。
另一個常被提到的風險是「被綁住」。Jev 只能透過網路呼叫,沒有可以自己架設的版本。Hacker News 上有網友說得很直白:如果模型只有一家公司提供,哪天對方不讓你用,你就完了。
社群討論重點一覽
| 討論焦點 | 支持的說法 | 質疑的說法 | 我們的看法 |
|---|---|---|---|
| 速度與價格 | 快幾十倍、便宜幾百倍 | 倍數是拿不同的工作來比 | 便宜是真的,實測每次判斷約 0.00005 美元 |
| 不會亂編答案 | 格式一定正確 | 還是可能選錯選項 | 錯誤只是換了形式,照樣要測 |
| 準確度 | 選項清楚的判斷表現好 | 多份實測輸給一般語言模型 | 看任務,選項越清楚越適合 |
| 把握程度的數字 | 可以依把握決定要不要動手 | 換到你的資料就不一定準 | 標準要用自己的資料訂 |
| 是不是新技術 | 把分類做到大型模型的水準 | 換了包裝的分類器 | 好不好用比新不新重要 |
| 只能連網使用 | 不用自己維護主機 | 被一家公司綁住 | 一定要準備後備方案 |
我們怎麼看
這兩週的爭論,跟我們把 Jev 接進網站導覽員「小浪」的經驗幾乎完全對得上。我們沒有照抄官方建議的標準,而是用 190 題自己網站的提問去測,定出「五成把握才帶路」這條線,詳細過程寫在這篇實測裡。我們也留了一條後路:Jev 超過 1.2 秒沒回應或出錯,網站就改用原本寫好的關鍵字比對,不會因為一家服務出狀況就整個停擺。
Alex Molas 說「把它當分數,不要當機率」,我們很認同。硅星人測到的「1.99 和 2.00」問題,我們也遇過類似的情況:同一句話換一份選項清單,把握就從 0.94 掉到 0.2。所以結論很樸素:它很快、很便宜,選項清楚的判斷做得不錯,但要用在公司裡,一定要拿自己的資料測過,錯了會有損失的事,最後一步留給人。
如果你正在評估要不要讓 AI 接手公司裡的判斷工作,可以先看企業 AI Agent 導入指南,了解從試用到正式上線要注意什麼;想知道 AI 助理該開哪些權限,可以看權限指南。需要有人一起評估的話,我們的 AI Agent 開發團隊可以幫你拿實際資料測一輪。
資料來源與查證日期
以下資料查證於 2026 年 9 月 27 日。
- Hacker News:Introducing System One Models and Jev 討論串
- Hacker News:Turning GLM-5.3-Flash into a Jev-like decision model
- Diogo Almeida 的發布貼文
- Dan Shipper 的測試心得
- TypeSafe:取消候補名單
- Reddit r/LocalLLaMA:I really don't understand Jev hype
- Reddit r/LocalLLaMA:Jev isn't new tech
- Reddit r/LocalLLaMA:請版主處理 Jev 貼文
- Hugging Face:Jev 仿製品清單
- Simon Willison:Jev
- Alex Molas:Jev can't be calibrated
- iThome 報導
- INSIDE 報導
- Frank Chiu:Jev 中文介紹
- 硅星人實測(新浪財經轉載)
- The Information 募資報導與 AI Weekly 整理
延伸閱讀
- Jev 是什麼,我們把網站導覽員的帶路判斷交給它之後的實測。
- 大家拿 Jev 做了什麼,15 個網路上的實作整理。
- AI 客服一夜送出數十張退款券,替 AI 設安全關卡的三道防線。
- AI 帳單越用越貴怎麼救,大 AI、小 AI 和只做決定的 AI 怎麼分工。
常見問題
Jev 真的不會亂編答案嗎?
Jev 的中文判斷準不準?
為什麼有人說 Jev 只是換了包裝的分類器?
只能透過網路使用 Jev 有什麼風險?
這個主題的完整脈絡、選型比較與導入建議,都整理在指南裡。
訂閱免費電子報
把 AI 自動化、企業系統設計與 WordPress / Laravel 開發的真實案例和可直接照做的技巧,整理成電子報寄給你。只寄精選內容、不灌垃圾信,一鍵就能退訂。


