LLM 帳單越用越貴怎麼救:模型路由、小模型與 AI 成本治理完整指南
☰ 目錄 table-of-contents.md
每個月月初,財務把上游 API 的帳單截圖丟進群組的那一刻,氣氛通常會安靜幾秒。老闆盯著那個比上一季幾乎翻倍的數字,第一句話往往是:「我們產品又沒多幾個客戶,這個 AI 到底在燒什麼?」工程師心裡有數,功能是變多了、每個功能又都預設呼叫最貴的那顆模型,但要把這件事講清楚、還能提出可執行的止血方案,卻不容易。
先把結論放在前面。你會發現一個違反直覺的現象:這兩年 API 每百萬 token 的單價一路下殺,企業的 LLM 總帳單卻不減反增。原因不在單價,在用量暴增與「用大砲打小鳥」的用法。真正能止血的,不是等供應商再降價,而是建立一套廠商中立的成本治理架構,把「這個請求該用哪顆模型、要不要走快取、值不值得呼叫」變成可以管理的決策。搭配得當,模型路由加上小模型混合,能在幾乎不掉品質的前提下,把真實帳單砍掉四到八成。這篇就帶你把這套架構拆開來看。
為什麼單價一直降,帳單反而越用越貴?
要對症下藥,得先認清帳單膨脹的四個結構性原因,它們幾乎和單價無關。
第一,用例暴增,而且新用法更耗 token。Gartner 在 2026 年 3 月的預測中指出,即使到 2030 年,在兆級參數模型上做一次推論的成本會比 2025 年便宜九成以上,但企業實際支出未必跟著降,因為 agentic 工作流每個任務消耗的 token 是單純聊天問答的 5 到 30 倍,而導入速度比單價下降更快。一個會自己規劃、呼叫工具、反覆檢查的 AI Agent,背後可能是幾十次模型呼叫。
第二,每個功能都預設呼叫旗艦模型。很多團隊在開發時圖方便,一律接最強的模型,上線後也懶得回頭調整。於是「把一段文字分類成三種標籤」這種國中生都會的任務,也在用每百萬輸出 token 要價數十美元的旗艦模型處理。這是最常見、也最好省的浪費。
第三,上下文不斷膨脹。RAG 檢索塞進來的文件、越拉越長的對話歷史、一層層堆疊的系統提示,都讓每次請求的輸入 token 悄悄長大。輸入變長不只變貴,還拖慢回應。我們在 用大脈絡 RAG 打造高階 AI 智庫 一文談過長脈絡的價值,但長脈絡同時是成本放大器,必須有意識地管理。
第四,缺乏成本可觀測。大多數團隊沒有把每次呼叫的模型、token 與花費埋點記錄下來,於是帳單是一個黑盒子,沒人知道哪個功能、哪個團隊在燒錢。看不到,就管不了。想把單一任務的成本算清楚,可以參考我們在 AI Agent 單一任務成本怎麼算 拆解的 Cost Per Task 埋點方法;那篇教你怎麼把帳單算清楚,這篇則接著教你怎麼把它降下來。
成本結構怎麼看?先看懂 token 經濟學
要優化成本,得先看懂帳單是怎麼算出來的。LLM 的計費幾乎都以 token 為單位,但有三個關鍵細節常被忽略。
第一,輸出比輸入貴得多,通常是好幾倍。以目前主流旗艦模型的定價為例,輸出每百萬 token 的價格往往是輸入的四到六倍。這代表「讓模型少講廢話、輸出精簡結構化的結果」本身就是省錢,而要求它長篇大論地把思考過程全寫出來,代價不小。
第二,快取命中的輸入極便宜。OpenAI、Anthropic、Google 目前對命中快取的輸入 token 都只收約原價的一成,等於省下九成左右。(要留意 Anthropic 的五分鐘快取「寫入」是加價 1.25 倍,那是寫入端的成本,不是折扣,別和命中折扣混為一談。)對於系統提示固定、只有末端問題在變的場景,快取幾乎是免費的午餐。相關的快取與退讓策略,我們在 AI API 帳單爆量的 Rate Limit 突破指南 針對 WordPress 情境有完整實作;那篇聚焦在單站的防禦策略,這篇則把視角拉高到整個組織的成本架構。
第三,模型間的單價差距是數量級的。同一份工作,交給小模型和交給旗艦模型,成本可能差十倍以上。下面這張表把一個典型企業每月 500 萬次請求的帳單拆開來看,你會直觀感受到「路由」的槓桿在哪裡。
| 成本項目 | 全部走旗艦模型 | 路由 + 小模型 + 快取 | 說明 |
|---|---|---|---|
| 簡單任務(分類、抽取、意圖判斷) | 旗艦模型全包 | 小模型處理,約 1/10 單價 | 約占流量七到八成 |
| 困難任務(複雜推理、開放生成) | 旗艦模型 | 旗艦模型(保留品質) | 約占流量兩到三成 |
| 重複性請求(固定系統提示) | 每次全額計費 | 快取命中輸入打約一折 | 視場景可覆蓋大量輸入 |
| 輸出 token | 不受控、常過長 | 要求精簡結構化輸出 | 輸出單價是輸入數倍 |
| 典型總帳單相對值 | 100% | 約 20% 到 50% | 不掉關鍵品質 |
看懂這張表,你就抓到了本文所有策略的共同邏輯:把對的請求,送到對的模型,並盡量重用已經算過的部分。
模型路由三種做法,該怎麼選?
模型路由就是那個負責「決定這個請求交給誰」的調度層。市面上的做法大致分三種,成本與品質的取捨各不相同,實務上也常混用。
Cascade 升級式路由:先便宜試,不夠好再升級
最直覺的一種。請求先送給便宜的小模型,若結果通過品質檢查(例如信心分數夠高、格式正確、有明確答案),就直接回傳;不合格才升級到更貴的大模型重做。優點是實作簡單、對「大部分請求其實很簡單」的場景省很兇;缺點是困難請求會被算兩次(小模型先跑一次、大模型再跑一次),且需要一個可靠的品質判斷機制,否則要嘛該升級的沒升級、要嘛全部都升級等於白做。
Classifier 分類路由:用一個小分類器先判斷難度
在請求真正送進模型前,先用一個訓練過的輕量分類器判斷「這題難不難、該給誰」,再一次性路由到正確的模型,不做重試。柏克萊、Anyscale 與 Canva 團隊的 RouteLLM 研究就是這條路的代表:他們用 Chatbot Arena 的偏好資料訓練路由器,依團隊在 LMSYS 部落格公布的數據,在 MT Bench 上把成本砍掉約 85%、同時保留 95% 的 GPT-4 品質,關鍵是只把約一到兩成的困難查詢送去最強的模型。優點是沒有重試浪費、延遲穩定;缺點是分類器需要資料訓練與維護,判斷錯了就直接影響品質。
Semantic 語意路由:用向量相似度對應到專門模型
把進來的請求向量化,和預先定義好的一組「意圖範例」比對語意相似度,命中哪一類就路由到最適合該類的模型或流程。這種做法在「多個垂直專門模型並存」時特別好用,例如法務問題走法務微調模型、程式問題走程式模型、閒聊走最便宜的通用小模型。它和 RAG 的向量檢索共用同一套基礎設施,若你已經在做 企業級混合向量檢索,語意路由幾乎是順手就能加上的一層。缺點是需要維護意圖範例庫,邊界模糊的請求容易誤判。
| 路由做法 | 運作方式 | 省成本潛力 | 主要成本 / 風險 | 適合場景 |
|---|---|---|---|---|
| Cascade 升級式 | 先跑便宜模型,不合格才升級 | 高(簡單請求佔多數時) | 困難請求算兩次;需可靠品質檢查 | 請求難度分佈偏簡單、可自動驗收 |
| Classifier 分類路由 | 輕量分類器先判難度再一次路由 | 很高(研究達約 85%) | 需訓練與維護分類器 | 流量大、任務類型穩定、要低延遲 |
| Semantic 語意路由 | 向量相似度對應到專門模型 | 中高 | 需維護意圖範例庫;邊界易誤判 | 多個垂直專門模型並存 |
沒有哪一種絕對最好。用量還小的團隊,Cascade 最快見效;流量大而穩定,Classifier 的槓桿最高;已經有多個專門模型與向量基礎設施,Semantic 最順。三者也能疊,例如先語意分流到領域,再在領域內用 Cascade 升級。
小模型(SLM)什麼時候該上、怎麼選?
路由決定了「哪些請求該降級」,而降級的目的地,通常就是小模型。近兩年 SLM 的能力進步很快,經濟帳更是壓倒性。NVIDIA 研究團隊在《Small Language Models are the Future of Agentic AI》中主張,agentic 系統裡大量重複、範圍明確的子任務,小模型才是更合理的預設;該研究也指出,服務同樣的工作量,7B 級小模型的推論成本約是 70B 到 175B 大模型的十分之一到三十分之一,整整低了一個數量級。
更有說服力的是實戰數據。把第一線客服的標準工單,從旗艦模型換成用一兩千筆自家對話微調過的小模型後,省下約九成成本、回應速度快約三倍、而且在既有工單類型上的準確度不降反升的案例,在 2026 年已經相當常見。原因很單純:客服問題高度重複、領域封閉,微調小模型反而比通用大模型更懂你的業務術語。
那什麼時候不該硬上小模型?開放式的複雜推理、需要廣泛世界知識的長篇生成、以及品質容錯極低的關鍵決策,旗艦模型仍然值得那個價差。判斷原則是:任務越重複、範圍越封閉、可用自家資料微調,就越適合小模型;任務越開放、越吃通用智能,就越該留給大模型。下表是選型時的經濟學對照。
| 面向 | 小模型 SLM(微調) | 大型旗艦 LLM |
|---|---|---|
| 相對單位成本 | 低,約為大模型的 1/10 到 1/30 | 高 |
| 基礎設施 | 需求低得多,能自架於較廉價硬體 | 依賴昂貴 GPU 或高單價 API |
| 回應延遲 | 快,客服場景常見快約三倍 | 相對慢 |
| 擅長任務 | 分類、抽取、意圖判斷、標準回覆、格式轉換 | 複雜推理、開放生成、廣域知識 |
| 資料主權 | 可完全本地部署,資料不外流 | 多為外部 API,需評估合規 |
| 導入門檻 | 需準備微調資料與評測集 | 接 API 即用,門檻低 |
資料主權那一列,對受監管產業特別關鍵。若你的顧慮是原始碼或客戶資料不能離開機房,本地部署的小模型往往是唯一解,這部分的取捨我們在 企業原始碼隱私與 AI 開發安全指南 有更完整的討論。至於把小模型放到更靠近資料的邊緣端執行,則牽涉硬體架構的另一套權衡,可延伸閱讀 組合式 AI 與邊緣運算策略;那篇談的是硬體與部署位置,本文談的是軟體路由層與成本經濟學,兩者互補。
LLM Gateway 與成本可觀測,怎麼建?
路由與小模型是策略,而讓策略能被統一執行、監控與計費的地方,就是 LLM Gateway(也叫 AI Gateway 或 LLM Proxy)。它坐在你的應用和各家模型 API 之間,把多家供應商收斂成單一介面,並在這一層集中處理金鑰、預算、降級、快取與日誌。以下中立列舉三個 2026 年常見的方案,各有取向。
LiteLLM 是 Apache 2.0 授權的開源代理,能把上百家供應商統一成 OpenAI 相容格式,支援虛擬金鑰、逐專案預算上限、備援與 Redis 快取,適合想要完全自架、資料自主的團隊。OpenRouter 走 SaaS 市集路線,一把金鑰就能存取 400 多個模型、70 多家供應商,零基礎設施,適合想快速試多個模型的團隊,但所有請求會經過其美國基礎設施,有資料落地要求者需留意。Portkey 定位在企業級,內建語意快取、護欄、PII 遮罩與稽核軌跡,其閘道早在 2024 年初就已開源,2026 年 3 月推出的 Gateway 2.0 則是把原本只在企業版提供的治理、可觀測性、認證與成本控制功能併回開源版,可自架也可用其託管平台。
選哪個是次要的,重點是這一層要幫你落實三件事:其一,成本歸因,讓每個團隊、每個功能的花費一目了然;其二,預算告警與硬上限,避免某個失控的迴圈把整月預算一次燒光;其三,自動降級與備援,讓主模型出事時能無痛切換。這三件事做到了,你才算真正把 AI 支出從黑盒子變成可管理的科目。想理解閘道與底層 API、工具協定的分層關係,可延伸閱讀 MCP、API 與 CLI 的差異解析。
資源有限,落地優先順序怎麼排?
成本治理最怕的是一頭栽進最難的微調,卻連錢花在哪都不知道。我們建議按「省力槓桿」由高到低推進,每一步都站穩再往下走。
第一步,量測。先把每次呼叫的模型、輸入輸出 token 與成本埋點記錄下來。你幾乎一定會發現,八成帳單集中在兩三個用例,優化火力對準它們就好。這一步的方法論,直接沿用 Cost Per Task 埋點 那套即可。
第二步,快取。對重複性高、系統提示固定的請求開啟 prompt caching,命中的輸入最多打一折。這步幾乎不動架構,投報率最高。
第三步,路由。從最省力的 Cascade 開始,把明顯簡單的請求分流到便宜模型,先吃掉一大塊。
第四步,導入小模型。針對量最大、最重複的那個用例,評估換上開源或微調小模型,把單價再壓一個數量級。
第五步,微調。當某個小模型場景的品質還差臨門一腳、且流量夠大值得投資時,才用自家資料微調。它成本較高、週期較長,是壓箱底的手段,不是開場白。
把這個順序記牢:越前面的步驟越省力、越不改架構。跳過量測直接微調,是我們看過最常見、也最貴的錯。整體導入的節奏與組織配套,可參考 2026 台灣企業 AI Agent 導入指南。
不同用量階段,情境怎麼選型?
小量試水(每月帳單數千元台幣內)
別過度工程。這階段的重點是驗證價值,不是省那幾千塊。直接接一個好用的 API、開好 prompt caching、把用量儀表板看住即可。硬體、自架閘道、微調全都太早,那是用工程時間換小錢,划不來。
成長中(帳單開始每月翻,看不懂了)
這是導入治理的黃金時機。引入 LLM Gateway 做成本歸因與預算告警,用 Cascade 做基礎路由,把最大的那個用例挑出來評估小模型。這一步通常就能把帳單斜率壓平,效益評估的完整思路可參考 AI Agent 效益評估的三個迷思。
高量客服/重複性任務(工單、FAQ、意圖分類)
這是小模型的主戰場。用自家歷史對話微調一個小模型接掉大宗標準工單,把旗艦模型留給少數疑難雜症,通常能省下最可觀的一筆。搭配 Classifier 路由與語意檢索,效果最佳。
合規敏感(金融、醫療、政府、法務)
資料主權優先於單純的成本數字。優先評估可本地部署的小模型與自架閘道,讓敏感資料不離開機房;若必須用外部大模型,也要透過閘道做 PII 遮罩與稽核。這類需求常會延伸到私有知識庫,可參考 企業專屬 AI 大腦 RAG 建置指南。
資料來源與延伸連結
本文所引用的關鍵數據,查證於 2026 年 7 月 15 日,來源與立場如下(幣別均為美元):
- 模型路由在 MT Bench 上省約 85% 成本、保留 95% GPT-4 品質:RouteLLM 團隊 2024 年 7 月 1 日的部落格公告,LMSYS,RouteLLM。方法論與完整實驗見 Ong 等人論文(UC Berkeley、Anyscale、Canva,ICLR 2025),arXiv:2406.18665 與官方 GitHub 專案;論文本身回報的是同樣保留 95% 品質下約 3.66 倍的成本節省。
- 單價下降但支出未必降、agentic 工作流耗 token 5 至 30 倍:Gartner 2026 年 3 月 25 日新聞稿,Gartner Newsroom。
- 小模型是 agentic AI 的未來、經濟學論證,以及 7B 級小模型的服務成本約為 70B 到 175B 模型的十分之一到三十分之一:NVIDIA 研究,arXiv:2506.02153。
- 快取命中的輸入約收原價一成:OpenAI Prompt Caching 官方說明、Anthropic Prompt Caching 文件(快取讀取為基礎價的 0.1 倍)與 Google Gemini Context Caching 文件(標準輸入價的十分之一)。
- LLM Gateway 產品現況(中立列舉):LiteLLM、OpenRouter、Portkey 官方網站。
延伸閱讀
- AI API 帳單爆量的 Rate Limit 突破指南(WordPress 情境實作)
- AI Agent 單一任務成本怎麼算:Cost Per Task 的 ROI 公式實戰
- 2026 台灣企業 AI Agent 導入指南
- 組合式 AI 與邊緣運算策略
下一步:把帳單變成可管理的科目
想先看看實際交付出來長什麼樣子,可以對照我們做過的客製化系統案例:大專院校的捐款與課程報名系統、BNI 的簽到系統、旅遊業的返點計算平台,規模與串接複雜度都不同,看完比較好判斷自己的需求落在哪一區間。
AI 成本治理不是一次性的專案,而是一套要長在流程裡的能力。如果你的帳單正開始失控、卻抓不清錢花在哪,我們可以幫忙。想從量測、路由到小模型整套落地,看看 AI 自動化開發服務;若你的痛點是特定系統要客製一層成本治理或閘道邏輯,可以聊聊 客製化外掛開發。或者,直接來 跟我們談談 你這個月的帳單,我們用顧問視角幫你找出最省力的那條止血路徑。
RoamerHost 幫你把開源 AI 與自動化工具一鍵代管:獨立 Docker、自動 SSL、24/7 監控,60 秒上線。省下租機器、裝環境、顧維運的力氣,訂閱就能開始用。
▶立即免費註冊常見問題
模型路由真的能省成本又不掉品質嗎?
小模型(SLM)會不會太笨,不能用在正式產品?
導入 LLM Gateway 會不會反而增加延遲與維運負擔?
為什麼 API 單價一直降,我們公司帳單反而越來越高?
我們資源有限,第一步應該先做什麼最划算?
這個主題的完整脈絡、選型比較與導入建議,都整理在指南裡。
訂閱免費電子報
把 AI 自動化、企業系統設計與 WordPress / Laravel 開發的真實案例和可直接照做的技巧,整理成電子報寄給你。只寄精選內容、不灌垃圾信,一鍵就能退訂。