大家拿 Jev 做了什麼 從玩遊戲開無人機到客服分流的 15 個實作
☰ 目錄 table-of-contents.md
一個 Minecraft 角色花了 16 分半,在遊戲裡一塊一塊蓋出一面加拿大國旗。操控它的不是玩家,而是一支每秒問 Jev 大約四次「下一步做什麼」的程式:往前走、挖羊毛、放方塊,前後一共做了 2,266 次決定。這是 Jev 推出隔天,一位開發者放上 GitHub 的作品。
Jev 是 TypeSafe 在 9 月 15 日推出的 AI,不寫文章、不聊天,只回答是非題、選擇題和評分題,一次大約 0.3 秒(我們在上一篇用自家網站導覽員詳細測過)。推出不到三週,社群整理的專案清單已經收錄 163 個作品。看完一輪,大多數落在三種用法:需要連續快速做決定的,例如遊戲和機器人;需要一次分類大量東西的,例如客服訊息、影片、社群貼文;還有替其他 AI 或系統把關的。也有人認真做了比較,發現 Jev 判斷釣魚信的準確度,輸給一般的小型語言 AI。下面挑 15 個有公開資料的實作,用白話說明它們怎麼用 Jev。
本文的專案資料、GitHub 星數與各專案公布的數字查證於 2026 年 9 月 27 日。數字多半是作者自己測的,文中會標明出處;專案更新很快,實際以原始頁面為準。
先看官方示範 玩 Doom 和維基百科賽跑
TypeSafe 在發布文章裡放了兩個好玩的示範。一個是讓 Jev 玩經典射擊遊戲 Doom:它看的不是畫面,而是把遊戲狀態寫成文字,再決定下一步的動作。官方估算,每秒做 10 次決定,一小時大約 7 美元。另一個是「維基百科賽跑」:從一個維基百科頁面出發,只能點頁面裡的連結,看誰最快走到指定的頁面。Jev 每一步都要從幾百甚至幾千個連結裡挑一個,超過選擇題上限 255 個的時候,就先分兩輪篩選。
比較實用的是 OpenRouter(一個把各家 AI 模型集中起來的平台)做的 Jev Lab,每個範例都附上程式和實際跑出來的結果。其中一個是客服訊息分類:對 95 則訊息各問 5 個是非題,475 個答案 1.2 秒跑完,花費 0.0014 美元。另一個是替 AI 助理把關:AI 準備執行的 24 個動作,每個檢查 4 項,有風險的就停下來等人確認,0.5 秒、0.0004 美元。
遊戲與機器人 一秒要做好幾次決定
開頭提到的 Minecraft 機器人,每次讓 Jev 從大約 20 個基本動作裡挑一個,平均 0.137 秒回覆。值得注意的是分工:座標、國旗的藍圖、會不會撞到東西,都由程式提供和把關,Jev 只負責「現在該做哪個動作」。
另一個更有看頭的是模擬無人機 jev-drone。一台只靠機上鏡頭的無人機,要在物理模擬器裡穿過五關障礙並追著目標飛。它每 0.4 秒問 Jev 三個問題:接下來怎麼飛(選擇題)、現在有多危險(評分題)、目標是不是跟丟了(是非題)。作者公布的結果是,目標留在畫面裡的時間從 19% 提高到 82%,而且飛完全程,對照組則在半路停下來。作者也寫明這只是單次飛行的結果;最關鍵的一點是,程式保留最後否決權,有另一層反應機制每秒檢查 50 次,情況不對就直接蓋過 Jev 的判斷。
也有人拿它做交易。Jev Trader 在區塊鏈的交易所上,每出一個區塊就讓 Jev 決定買或賣,一輪大約 0.1 秒。不過作者預設只模擬、不真的下單,公開的展示版也用假的模型代替,看熱鬧就好。
生活裡的小工具
HA-Jev 把 Jev 接進智慧家庭系統 Home Assistant,口號是「問你的房子一個問題,拿回一個數字」。你可以問「洗衣機洗好了,衣服是不是忘了拿」「暖氣開著,窗戶是不是也開著」,Jev 回一個把握程度,超過你設定的標準就發通知。作者準備了 25 個一鍵匯入的範本,也可以設定每天的使用上限,避免帳單失控。
看 YouTube 的人可能會喜歡 jev-skip:它把影片字幕切成 30 秒一段,一次問 Jev 哪幾段是業配,還沒有人手動標記的影片也能自動跳過。作者在 23 支影片上測試,抓到網友社群標記的業配時間的 77%,每支影片的成本約 0.0008 美元,代價是每小時大約有 34 秒被誤跳。
做行銷的人可以看看 Jevtown。你貼一篇文案或一則商品貼文,它讓一萬個虛擬居民「讀」一遍:先判斷這篇適合哪些人,再逐一決定每個人是略過、按讚、轉發還是封鎖,模擬這篇貼文能擴散多遠。作者說每篇大約 0.01 到 0.1 美元。
中文圈也有作品。JevBystander 是一個 Android 小工具,會讀取手機聊天畫面上的對話,一次問 Jev 四件事:對方的意圖、情緒、有多急、你該用什麼態度回。它只在螢幕上跳出三個小提示,從來不替你打字,一次判斷約 0.97 秒。
公司裡的分類 分流 把關
企業用途是目前最多人做的方向,分類、分流、把關這類工作,跟我們寫過的潛在客戶自動派單是同一種問題,而且大平台都跟上了。Vercel 的 AI 助理開發工具 eve 把 Jev 設成預設的「評審」,用來打分 AI 的回答,也用來自動審核 AI 準備執行的動作:沒問題的放行,有疑慮的標記起來。LangChain 官方部落格示範了兩種用法,一種是依題目難易度決定要用哪個 AI,一種是擋下有風險的動作。Cloudflare 也把 Jev 放上自家的 Workers AI,官方範例是客服分流、退款審核和帳號風險判斷。
開發者 Ken Huang 寫了 27 個以上的測試情境,其中一個是資安事件分級:用 8 個問題判斷一則警報該直接結案、通知負責人、排進待辦,還是立刻隔離。他也在說明裡直接寫出 Jev 的弱點:數數不可靠,也不會正確比較日期先後。
速度最驚人的應該是 Browser Use 團隊的 Jev Ultrafast,一個會自己操作瀏覽器的 AI 助理。每一步由 Jev 一次決定「要做什麼動作、點哪個位置」,只有需要打字的時候才請另一個小型 AI 寫文字。在查 Google 航班這個任務上,中位數時間從 9.45 秒縮短到 7.09 秒,和瀏覽器之間的來回溝通從 1,092 次降到 101 次。作者自己也說,這只是同一個任務跑三次的結果,不代表一般情況下的可靠度。
一個重要的反例 快又便宜不代表比較準
最值得一看的,反而是一個「Jev 輸了」的實驗。開發者 anisselbd 做了釣魚信判斷測試:拿 2,000 封信,讓 Jev 和小型語言模型 Claude Haiku 4.5 分別判斷是不是釣魚信。結果 Jev 的準確率 62.6%,Haiku 是 81.3%;真正的釣魚信,Jev 只抓到 43.2%,Haiku 抓到 76.4%。Jev 贏的是速度和價格:每封 0.239 秒對 0.687 秒,每一千封 0.038 美元對 0.462 美元,便宜十幾倍。
獨立評測網站 Jevals 的結果也類似。在 300 題醫學是非題上,Jev 答對 69.0%,Google 的 Gemini 3.8 Flash 是 73.0%;在 300 題銀行客服的意圖分類上,Jev 是 67.8%,Gemini 是 74.1%,不過 Jev 的成本大約只有 28 分之一。
這跟我們自己的經驗對得上。小浪的帶路判斷,選項是清楚的頁面清單,Jev 在 190 題裡答對 187 題;但像釣魚信這種要讀懂細節、判斷意圖的題目,它就不一定贏。我們的做法是:先用自己的資料測過,把把握程度的標準訂清楚,錯了會有損失的事,最後一步留給人。
想自己動手 從哪裡開始
不寫程式的人,最簡單的是去 OpenRouter 的 Jev Lab 看每個範例的題目和結果,大概就能感覺它適合做什麼。
工程師可以從 TypeSafe 官方的 skills 開始,它讓 AI 寫程式工具學會怎麼呼叫 Jev,到 9 月 27 日已經有 2,253 顆星。常見的開發框架也都有人做了串接,包括 LlamaIndex 和 Laravel。想一次看更多作品,可以翻 fatwang2/awesome-jev 和 AnotiaWang/awesome-jev 這兩份社群清單。
15 個實作一覽
| 作品 | 在做什麼 | Jev 負責的事 | 公開的數字(作者自測) |
|---|---|---|---|
| Doom 示範(官方) | 玩射擊遊戲 | 決定下一步動作 | 每秒 10 次,一小時約 7 美元 |
| 維基百科賽跑(官方) | 只點連結走到指定頁面 | 從上千個連結挑一個 | 未公布 |
| Jev Lab(OpenRouter) | 客服分類、動作審核等範例 | 是非題與選擇題 | 95 則訊息 1.2 秒,0.0014 美元 |
| Minecraft 機器人 | 在遊戲裡蓋國旗 | 從約 20 個動作挑一個 | 991 秒做 2,266 次決定 |
| jev-drone | 模擬無人機穿越障礙 | 怎麼飛、多危險、有沒有跟丟 | 目標在畫面內 82%,對照組 19% |
| Jev Trader | 區塊鏈自動交易 | 買或賣 | 每輪約 0.1 秒,預設只模擬 |
| HA-Jev | 智慧家庭提醒 | 回答家裡的狀況 | 25 個範本 |
| jev-skip | 跳過 YouTube 業配 | 判斷哪段是業配 | 抓到 77%,每支 0.0008 美元 |
| Jevtown | 模擬一萬人讀你的貼文 | 判斷每個人的反應 | 每篇 0.01 到 0.1 美元 |
| JevBystander | 聊天時的小提示 | 意圖、情緒、急迫度 | 每次約 0.97 秒 |
| Vercel eve | AI 助理開發工具 | 評分回答、審核動作 | 未公布 |
| LangChain 示範 | AI 助理開發框架 | 挑 AI、擋危險動作 | 未公布 |
| Ken Huang 測試集 | 資安警報分級等 27 個情境 | 多題判斷後決定處理方式 | 各情境分開列 |
| Jev Ultrafast | 自己操作瀏覽器的 AI | 決定動作和點哪裡 | 中位數 9.45 秒降到 7.09 秒 |
| 釣魚信測試 | 判斷釣魚信 | 是不是釣魚信 | 準確率 62.6%,小型 AI 81.3% |
看完這些實作 我們的觀察
做得好的專案,幾乎都讓程式保留最後決定權。無人機有每秒 50 次的反應層可以蓋過 Jev,Minecraft 機器人的碰撞由程式擋,JevBystander 只給提示、從不替你回訊息。我們在小浪上的做法也一樣:訪客明說「不要換頁」,程式先攔下來,不讓 AI 的判斷蓋過去。元智大學終身教育部的排課助理也是同樣的設計,助理先提出排課建議,承辦人確認後才寫入。
Jev 也很少單獨上場。Jev Ultrafast 需要打字時交給另一個小型 AI,小浪的回答也是由另一個 AI 寫。讓 Jev 做決定、讓會寫字的 AI 寫字,是目前最常見也最穩的組合。
最後,這些數字大多是作者自己、小樣本、甚至單次測出來的,拿來看方向可以,不要當成保證。真的要用在公司裡,先拿自己的資料測一輪,比看任何排行榜都準。如果你有一個「每次都要等 AI 想半天、其實只是在選一個選項」的流程,我們的 AI Agent 開發可以幫你評估它適不適合交給 Jev;想先了解 AI 助理該開哪些權限,可以看讓 AI Agent 接上工作工具的權限指南。
資料來源與查證日期
以下資料查證於 2026 年 9 月 27 日,GitHub 星數以當天為準。
- TypeSafe:Introducing System One Models and Jev(Doom 與維基百科賽跑示範)
- OpenRouter:Jev Lab
- ellistev/typesafe-minecraft-demo
- RomanSlack/jev-drone 與專案網站
- jarrodwatts/jev-trader
- AboveColin/HA-Jev 與說明網站
- valentynkit/jev-skip
- gaborishka/jevtown 與線上版
- Nisaka520/JevBystander
- vercel/eve 與 Vercel:Auto-approve tool calls with eve and Jev
- LangChain:Building a harness with Jev
- Cloudflare Workers AI:typesafe/jev
- kenhuangus/jev-usecases
- browser-use/jev-ultrafast
- anisselbd/jev-phishing-bench
- Jevals
- typesafe-ai/skills
延伸閱讀
- Jev 是什麼,我們把網站導覽員的帶路判斷交給它之後的實測。
- AI 帳單越用越貴怎麼救,大 AI、小 AI 和只做決定的 AI 怎麼分工。
- AI 客服一夜送出數十張退款券,替 AI 助理設安全關卡的三道防線。
- 爆量客服信箱的自動分類,大量分類這件事,換成 Jev 會更快更便宜。
常見問題
Jev 可以拿來做遊戲或機器人嗎?
不會寫程式也能試 Jev 嗎?
Jev 判斷得比一般 AI 準嗎?
這些專案公布的數字可信嗎?
這個主題的完整脈絡、選型比較與導入建議,都整理在指南裡。
訂閱免費電子報
把 AI 自動化、企業系統設計與 WordPress / Laravel 開發的真實案例和可直接照做的技巧,整理成電子報寄給你。只寄精選內容、不灌垃圾信,一鍵就能退訂。


