浪花科技 Roamer Tech浪花科技 Roamer Tech
聊聊需求 ↗
roamer-tech/article.mdCUSTOM SYSTEMS + AI
~/blog/what-people-built-with-jev.md
AI 自動化與智慧應用 ·

大家拿 Jev 做了什麼 從玩遊戲開無人機到客服分流的 15 個實作

Eric,浪花科技創辦人 / AI 架構師
浪花科技創辦人 · AI 架構師
大家拿 Jev 做了什麼 從玩遊戲開無人機到客服分流的 15 個實作
☰ 目錄 table-of-contents.md
font-size:

一個 Minecraft 角色花了 16 分半,在遊戲裡一塊一塊蓋出一面加拿大國旗。操控它的不是玩家,而是一支每秒問 Jev 大約四次「下一步做什麼」的程式:往前走、挖羊毛、放方塊,前後一共做了 2,266 次決定。這是 Jev 推出隔天,一位開發者放上 GitHub 的作品。

Jev 是 TypeSafe 在 9 月 15 日推出的 AI,不寫文章、不聊天,只回答是非題、選擇題和評分題,一次大約 0.3 秒(我們在上一篇用自家網站導覽員詳細測過)。推出不到三週,社群整理的專案清單已經收錄 163 個作品。看完一輪,大多數落在三種用法:需要連續快速做決定的,例如遊戲和機器人;需要一次分類大量東西的,例如客服訊息、影片、社群貼文;還有替其他 AI 或系統把關的。也有人認真做了比較,發現 Jev 判斷釣魚信的準確度,輸給一般的小型語言 AI。下面挑 15 個有公開資料的實作,用白話說明它們怎麼用 Jev。

本文的專案資料、GitHub 星數與各專案公布的數字查證於 2026 年 9 月 27 日。數字多半是作者自己測的,文中會標明出處;專案更新很快,實際以原始頁面為準。

先看官方示範 玩 Doom 和維基百科賽跑

TypeSafe 在發布文章裡放了兩個好玩的示範。一個是讓 Jev 玩經典射擊遊戲 Doom:它看的不是畫面,而是把遊戲狀態寫成文字,再決定下一步的動作。官方估算,每秒做 10 次決定,一小時大約 7 美元。另一個是「維基百科賽跑」:從一個維基百科頁面出發,只能點頁面裡的連結,看誰最快走到指定的頁面。Jev 每一步都要從幾百甚至幾千個連結裡挑一個,超過選擇題上限 255 個的時候,就先分兩輪篩選。

比較實用的是 OpenRouter(一個把各家 AI 模型集中起來的平台)做的 Jev Lab,每個範例都附上程式和實際跑出來的結果。其中一個是客服訊息分類:對 95 則訊息各問 5 個是非題,475 個答案 1.2 秒跑完,花費 0.0014 美元。另一個是替 AI 助理把關:AI 準備執行的 24 個動作,每個檢查 4 項,有風險的就停下來等人確認,0.5 秒、0.0004 美元。

OpenRouter Jev Lab 頁面,列出客服訊息分類、AI 動作審核、資料擷取、動態過濾、追逐遊戲對手等範例,每個範例標示答案數量、秒數與花費
OpenRouter 的 Jev Lab:每個範例都寫出跑了多少題、花幾秒、多少錢。圖片來源:openrouter.ai/labs/jev

遊戲與機器人 一秒要做好幾次決定

開頭提到的 Minecraft 機器人,每次讓 Jev 從大約 20 個基本動作裡挑一個,平均 0.137 秒回覆。值得注意的是分工:座標、國旗的藍圖、會不會撞到東西,都由程式提供和把關,Jev 只負責「現在該做哪個動作」。

另一個更有看頭的是模擬無人機 jev-drone。一台只靠機上鏡頭的無人機,要在物理模擬器裡穿過五關障礙並追著目標飛。它每 0.4 秒問 Jev 三個問題:接下來怎麼飛(選擇題)、現在有多危險(評分題)、目標是不是跟丟了(是非題)。作者公布的結果是,目標留在畫面裡的時間從 19% 提高到 82%,而且飛完全程,對照組則在半路停下來。作者也寫明這只是單次飛行的結果;最關鍵的一點是,程式保留最後否決權,有另一層反應機制每秒檢查 50 次,情況不對就直接蓋過 Jev 的判斷。

jev-drone 專案網站首頁,標題寫著把判斷模型放進無人機的控制迴圈,說明無人機只靠機上鏡頭穿越五關障礙,判斷模型每秒約決定 2.5 次
jev-drone 的專案網站,有完整的飛行影片與軌跡圖。圖片來源:jev-drone.vercel.app

也有人拿它做交易。Jev Trader 在區塊鏈的交易所上,每出一個區塊就讓 Jev 決定買或賣,一輪大約 0.1 秒。不過作者預設只模擬、不真的下單,公開的展示版也用假的模型代替,看熱鬧就好。

生活裡的小工具

HA-Jev 把 Jev 接進智慧家庭系統 Home Assistant,口號是「問你的房子一個問題,拿回一個數字」。你可以問「洗衣機洗好了,衣服是不是忘了拿」「暖氣開著,窗戶是不是也開著」,Jev 回一個把握程度,超過你設定的標準就發通知。作者準備了 25 個一鍵匯入的範本,也可以設定每天的使用上限,避免帳單失控。

Jev for Home Assistant 說明網站,介紹問題可以變成感測器、四種自動化動作、AI 任務與對話助理
HA-Jev 的說明網站,把 Jev 的答案變成智慧家庭裡的「感測器」。圖片來源:jev.cdevries.dev

看 YouTube 的人可能會喜歡 jev-skip:它把影片字幕切成 30 秒一段,一次問 Jev 哪幾段是業配,還沒有人手動標記的影片也能自動跳過。作者在 23 支影片上測試,抓到網友社群標記的業配時間的 77%,每支影片的成本約 0.0008 美元,代價是每小時大約有 34 秒被誤跳。

做行銷的人可以看看 Jevtown。你貼一篇文案或一則商品貼文,它讓一萬個虛擬居民「讀」一遍:先判斷這篇適合哪些人,再逐一決定每個人是略過、按讚、轉發還是封鎖,模擬這篇貼文能擴散多遠。作者說每篇大約 0.01 到 0.1 美元。

Jevtown 網站首頁,標題寫著人們在這裡寫文,一萬個 AI 角色來讀,右側顯示一則商品貼文觸及 2,100 人、142 人私訊賣家的模擬結果
Jevtown:發文前先讓一萬個虛擬讀者看一遍。圖片來源:jevtown.ivanhabor.com

中文圈也有作品。JevBystander 是一個 Android 小工具,會讀取手機聊天畫面上的對話,一次問 Jev 四件事:對方的意圖、情緒、有多急、你該用什麼態度回。它只在螢幕上跳出三個小提示,從來不替你打字,一次判斷約 0.97 秒。

公司裡的分類 分流 把關

企業用途是目前最多人做的方向,分類、分流、把關這類工作,跟我們寫過的潛在客戶自動派單是同一種問題,而且大平台都跟上了。Vercel 的 AI 助理開發工具 eve 把 Jev 設成預設的「評審」,用來打分 AI 的回答,也用來自動審核 AI 準備執行的動作:沒問題的放行,有疑慮的標記起來。LangChain 官方部落格示範了兩種用法,一種是依題目難易度決定要用哪個 AI,一種是擋下有風險的動作。Cloudflare 也把 Jev 放上自家的 Workers AI,官方範例是客服分流、退款審核和帳號風險判斷。

開發者 Ken Huang 寫了 27 個以上的測試情境,其中一個是資安事件分級:用 8 個問題判斷一則警報該直接結案、通知負責人、排進待辦,還是立刻隔離。他也在說明裡直接寫出 Jev 的弱點:數數不可靠,也不會正確比較日期先後。

速度最驚人的應該是 Browser Use 團隊的 Jev Ultrafast,一個會自己操作瀏覽器的 AI 助理。每一步由 Jev 一次決定「要做什麼動作、點哪個位置」,只有需要打字的時候才請另一個小型 AI 寫文字。在查 Google 航班這個任務上,中位數時間從 9.45 秒縮短到 7.09 秒,和瀏覽器之間的來回溝通從 1,092 次降到 101 次。作者自己也說,這只是同一個任務跑三次的結果,不代表一般情況下的可靠度。

終端機風格示意圖,把 Jev 的實作分成三類:連續快速決定的遊戲與機器人、大量分類的客服訊息影片與貼文、替其他 AI 把關的動作審核與選擇模型,底部註明程式保留最後否決權

一個重要的反例 快又便宜不代表比較準

最值得一看的,反而是一個「Jev 輸了」的實驗。開發者 anisselbd 做了釣魚信判斷測試:拿 2,000 封信,讓 Jev 和小型語言模型 Claude Haiku 4.5 分別判斷是不是釣魚信。結果 Jev 的準確率 62.6%,Haiku 是 81.3%;真正的釣魚信,Jev 只抓到 43.2%,Haiku 抓到 76.4%。Jev 贏的是速度和價格:每封 0.239 秒對 0.687 秒,每一千封 0.038 美元對 0.462 美元,便宜十幾倍。

獨立評測網站 Jevals 的結果也類似。在 300 題醫學是非題上,Jev 答對 69.0%,Google 的 Gemini 3.8 Flash 是 73.0%;在 300 題銀行客服的意圖分類上,Jev 是 67.8%,Gemini 是 74.1%,不過 Jev 的成本大約只有 28 分之一。

這跟我們自己的經驗對得上。小浪的帶路判斷,選項是清楚的頁面清單,Jev 在 190 題裡答對 187 題;但像釣魚信這種要讀懂細節、判斷意圖的題目,它就不一定贏。我們的做法是:先用自己的資料測過,把把握程度的標準訂清楚,錯了會有損失的事,最後一步留給人。

想自己動手 從哪裡開始

不寫程式的人,最簡單的是去 OpenRouter 的 Jev Lab 看每個範例的題目和結果,大概就能感覺它適合做什麼。

工程師可以從 TypeSafe 官方的 skills 開始,它讓 AI 寫程式工具學會怎麼呼叫 Jev,到 9 月 27 日已經有 2,253 顆星。常見的開發框架也都有人做了串接,包括 LlamaIndex 和 Laravel。想一次看更多作品,可以翻 fatwang2/awesome-jev 和 AnotiaWang/awesome-jev 這兩份社群清單。

15 個實作一覽

作品在做什麼Jev 負責的事公開的數字(作者自測)
Doom 示範(官方)玩射擊遊戲決定下一步動作每秒 10 次,一小時約 7 美元
維基百科賽跑(官方)只點連結走到指定頁面從上千個連結挑一個未公布
Jev Lab(OpenRouter)客服分類、動作審核等範例是非題與選擇題95 則訊息 1.2 秒,0.0014 美元
Minecraft 機器人在遊戲裡蓋國旗從約 20 個動作挑一個991 秒做 2,266 次決定
jev-drone模擬無人機穿越障礙怎麼飛、多危險、有沒有跟丟目標在畫面內 82%,對照組 19%
Jev Trader區塊鏈自動交易買或賣每輪約 0.1 秒,預設只模擬
HA-Jev智慧家庭提醒回答家裡的狀況25 個範本
jev-skip跳過 YouTube 業配判斷哪段是業配抓到 77%,每支 0.0008 美元
Jevtown模擬一萬人讀你的貼文判斷每個人的反應每篇 0.01 到 0.1 美元
JevBystander聊天時的小提示意圖、情緒、急迫度每次約 0.97 秒
Vercel eveAI 助理開發工具評分回答、審核動作未公布
LangChain 示範AI 助理開發框架挑 AI、擋危險動作未公布
Ken Huang 測試集資安警報分級等 27 個情境多題判斷後決定處理方式各情境分開列
Jev Ultrafast自己操作瀏覽器的 AI決定動作和點哪裡中位數 9.45 秒降到 7.09 秒
釣魚信測試判斷釣魚信是不是釣魚信準確率 62.6%,小型 AI 81.3%

看完這些實作 我們的觀察

做得好的專案,幾乎都讓程式保留最後決定權。無人機有每秒 50 次的反應層可以蓋過 Jev,Minecraft 機器人的碰撞由程式擋,JevBystander 只給提示、從不替你回訊息。我們在小浪上的做法也一樣:訪客明說「不要換頁」,程式先攔下來,不讓 AI 的判斷蓋過去。元智大學終身教育部的排課助理也是同樣的設計,助理先提出排課建議,承辦人確認後才寫入。

Jev 也很少單獨上場。Jev Ultrafast 需要打字時交給另一個小型 AI,小浪的回答也是由另一個 AI 寫。讓 Jev 做決定、讓會寫字的 AI 寫字,是目前最常見也最穩的組合。

最後,這些數字大多是作者自己、小樣本、甚至單次測出來的,拿來看方向可以,不要當成保證。真的要用在公司裡,先拿自己的資料測一輪,比看任何排行榜都準。如果你有一個「每次都要等 AI 想半天、其實只是在選一個選項」的流程,我們的 AI Agent 開發可以幫你評估它適不適合交給 Jev;想先了解 AI 助理該開哪些權限,可以看讓 AI Agent 接上工作工具的權限指南。

資料來源與查證日期

以下資料查證於 2026 年 9 月 27 日,GitHub 星數以當天為準。

延伸閱讀

// FAQ

常見問題

Jev 可以拿來做遊戲或機器人嗎?
可以,已經有人做了 Minecraft 機器人和模擬無人機,Jev 每秒做兩到四次決定。不過這些專案都讓程式保留最後否決權,例如碰撞偵測、緊急反應都由程式負責,Jev 只選下一步做什麼。文中整理的例子都是遊戲或模擬環境。
不會寫程式也能試 Jev 嗎?
可以先看 OpenRouter 的 Jev Lab,每個範例都附上題目、程式和實際結果,大概就能感覺它擅長什麼。真的要接進公司系統,還是需要工程師把它串進現有流程,並先用自己的資料測試。
Jev 判斷得比一般 AI 準嗎?
不一定。有開發者用 2,000 封信測釣魚信判斷,Jev 的準確率 62.6%,小型語言模型 Claude Haiku 4.5 是 81.3%;Jev 贏在快將近三倍、便宜十幾倍。選項清楚的判斷它表現不錯,需要讀懂細節的判斷就要先測過。
這些專案公布的數字可信嗎?
大多是作者自己測的,樣本小,有些只跑一次,作者自己也在說明裡提醒。拿來了解 Jev 適合做什麼可以,要用在公司裡,最好拿自己的資料再測一輪。
#Jev #TypeSafe #AI Agent #開源專案 #OpenRouter #AI 應用案例
~/roamer-tech/newsletter FREE
// newsletter

訂閱免費電子報

把 AI 自動化、企業系統設計與 WordPress / Laravel 開發的真實案例和可直接照做的技巧,整理成電子報寄給你。只寄精選內容、不灌垃圾信,一鍵就能退訂。

$ whoami
$ subscribe
⑂ mainarticle.mdLn 1UTF-8