OpenRouter 與混合模型工作流程研究

← 首頁

查核日期:2026-09-17(台灣)|公開方法版|文件研究,未執行付費模型評測

值得試行:保留主力訂閱,加上有預算上限、可以獨立運作的 API 工作池。

目標是提高交付品質、減少返工,並在訂閱額度耗盡時保有工作能力。OpenRouter 可以統一模型供應與路由,但效果取決於任務拆分、交接資料、驗收及成本控制。本文的模型是試測候選,並非已驗證的勝出者。

1. 先保留有價值的分工

工作建議處理方式驗收與升級條件
搜尋檔案、搬檔、格式轉換、影片轉碼確定性程式與現有工具檔案存在、格式、筆數與完成狀態;不必每步都叫模型。
語音轉錄保留既有 Groq/Whisper 管線先確認完整音訊已轉錄,才開始摘要;路由研究先從後段文本處理開始。
逐字稿抽取、待辦、資料分類既有本機模型與 Gemini 2.5 Flash-Lite 作對照保留原文引句、行號或時間戳;缺漏、否定語意或角色錯誤需升級。
研究初稿、週報、跨文件整理測試便宜模型初稿+主力整合能追溯來源,不能把初稿當事實;檢查矛盾與數字。
程式架構、複雜除錯、跨工具執行訂閱主力模型;必要時固定高階 API 模型備援實際測試與工具執行結果;不能只看回答是否流暢。
客戶建議、正式文件、涉及金額的結論主力模型+人工最終審閱重要數字、條件、引用零容忍;先處理可公開或去識別化內容。

現有本機助手若已有佇列、快取、來源驗證,應在其上新增可選後端,避免另建一套工作系統。規則能回答的分類先走規則。這是本研究的工程建議,仍需用實際任務證明效益。

2. 三種「路由」不能混為一談

  1. 供應商路由:同一模型挑不同供應端,改善價格或可用性;不是改用更適合的模型。可用 require_parameters 與單價限制篩選端點。官方說明
  2. 自動選模:openrouter/auto 依任務分類及近七天市場支出排序,再套用成本級別與允許模型清單。這是群體使用訊號,不是針對自己的中文工作品質測驗。新版使用 cost_tier;舊 cost_quality_tradeoff 已淘汰但保留相容。官方說明
  3. 工作流程路由:由自己的程式依任務、風險、資料權限與驗收結果決定模型。第一階段最適合採這種明確分工。

API 成功回傳不代表內容正確。OpenRouter 的錯誤 fallback 不會自動判斷「待辦漏了一條」並交給更強模型;品質升級要另外設計。fallback 文件

建議先固定少量模型建立基準,再用同一批測例評估 Auto Router。自動路由的成本級別是價格帶,不是整筆任務的費用上限。市場排序會變,固定版本比較容易追查品質變化。

3. 省的是 API、額度,還是總支出?

訂閱費不變且仍有可用額度時,改走 API 會增加現金支出;效益可能是延後額度用盡、縮短等待、避免升級與少返工。訂閱的 API 牌價換算值不等於實際帳單。OpenAI 官方也把訂閱用量與 API 按量收費分開。Codex 定價

OpenRouter 按量方案目前列平台費 5.5%,模型推論費另計;Auto Router 不另收路由費,但仍付所選模型費用。實際付款、最低費、稅與匯率以結帳為準。平台定價

試測候選每百萬 input/output tokens20,000 input+2,000 output 算例
Gemini 2.5 Flash-LiteUS$0.10/0.40US$0.0028
Claude Sonnet 4.6US$3/15US$0.09

以上只是固定 token 數、無快取、無工具、無額外 reasoning 費用的單次算例。同一文本在不同模型的 token 數也可能不同。單價差不代表品質相同;價格是查核時的頁面標示,端點與條件可能不同。

假設 1,000 個任務先全部跑 Flash-Lite,其中 20% 驗收不過,再以完整同尺寸輸入跑 Sonnet:推論費為 US$2.80+US$18=US$20.80;全跑 Sonnet 為 US$90。這是約 77% 的推論費理論下降,尚未計驗收、重試、路由額外上下文與維護,也完全不能解讀為訂閱費省 77%。若只示意加上 5.5% 平台費,兩者約為 US$21.94 與 US$94.95。

真正比較式:混合月成本=現有訂閱+新增 API+工具與主機費+返工/維護時間成本。升級月成本=新訂閱+升級後仍需的其他費用。新增 API 的合理上限,應低於升級價差並留有維護餘裕;必須先確認實際帳單,不能把舊記憶中的月費當現況。

4. 兩條工作路徑,分開建置

A. 平時分流:節省主力模型的閱讀與整理

檔案/任務入口→規則分類+資料範圍→本機或便宜 API→驗收與必要升級→主力整合

每個子任務帶明確輸入、輸出 schema、來源範圍與截止條件。主力只接收短結果、來源索引、尚未解決的問題;抽樣回查原文,重要結論仍讀原文。若主力最後又重讀全文、重做全部工作,通常省不到額度。

B. 額度耗盡:獨立執行入口與完整交接

額度用盡時,不能仍依賴原主模型來拆任務。必須提前保存任務目標、完成步驟、未完成項目、檔案/版本、驗收指令,並提供可直接啟動的備援 CLI 或 agent。純摘要 worker 不能代替會操作工具的 agent。第一次試行只接沒有外部寫入的工作;有日曆、訊息與部署等副作用的任務,要以 task id 和執行狀態避免重複操作。

接點文件確認本研究建議
本機 Python 任務工具可在既有介面加 API 後端;屬待實作第一個試點:來源抽取與待辦整理,沿用快取、佇列與驗證。
OpenClaw官方有 OpenRouter provider新增隔離的候選 agent/設定,核對目前安裝版本;不直接取代常駐主入口。
Codex CLI官方整合教學與 自訂 provider 設定隔離設定測工具呼叫、串流、上下文與恢復;不能由 CLI 文件推論桌面版所有功能均相容。
既有 API 秘書/週報程式先核對實際 provider、模型與完整成本台帳固定輸入的週報先試;外部日曆寫入延後。

快取可降低重複前綴處理成本,但依模型與供應端而異;頻繁換模型/端點可能破壞效益。API worker 不會自動取得現有工具、記憶與權限,這些必須明確提供。快取文件

5. 預算與資料邊界要做到程式裡

6. 用 30 個真實任務決定,不靠模型排行榜

建議試行 7~14 天。取逐字稿抽取、跨文件整理、固定格式改寫各 10 件。保留長文本、否定句、多人角色、數字與日期等難例,遮蔽必要個資。由人工標註關鍵項目與來源,先鎖定標準,再比較既有流程、本機模型、固定便宜 API,以及通過前測後的受限 Auto Router。

  1. 先看品質:關鍵數字、日期、角色不能出錯;抽取完整度目標至少 95%。引文存在只能證明可回查,不能證明理解正確。這些是建議門檻,不是已測結果。
  2. 再看可直接採用率:建議至少 90%,平均人工修正時間不能高於目前流程。先盲評,不讓模型品牌影響判斷。
  3. 算完整任務成本:所有失敗、驗收與升級成本均計入,分母為真正通過的任務數。同時計主力整合成本,不只計便宜 worker。
  4. 看主力額度:以官方用量與同類工作量對照,記錄模型、日期及其他同時工作;API token 無法直接換算訂閱百分比。沒有隔離干擾的數字只能當趨勢。
  5. 演練備援:不呼叫主力模型,從 checkpoint 啟動替代 agent,完成一個檔案任務並通過驗收,證明額度耗盡時仍能工作。
  6. 採用決策:品質不降、返工不增、備援可用,且追加費用小於可接受預算/升級差額才擴大。只省幾美元卻多出大量維護就停止。

30 件只能做初篩;正式接管重要工作前,要逐步擴樣並觀察一個完整計費週期。低風險工作抽查,正式交付完整審閱,避免每個小任務都再叫高價模型重做一次。

7. 其他方案與導入順序

方案適合情境目前建議
訂閱內選較小模型與較低推理強度日常短任務、額度管理先做;官方亦建議用較小模型延長額度。仍需驗證品質。來源
OpenRouter+簡單規則路由想小成本測跨廠模型並保有備援首選試行;少量固定候選,之後再測自動選模。
直接使用單一原廠 API已確定只需要一個模型/供應商一起比較實際報價、快取及維護;聚合器的便利性也有成本。
自架 LiteLLM多個應用、金鑰、路由與集中治理需求日後再評估。它提供重試、冷卻與多端路由,但需自己維護服務。官方文件
全面改本機模型資料不離機且工作足夠簡單保留為一條路徑;硬體、速度與返工也算成本,不預設全面替代。

優先順序:訂閱內分級與縮短上下文 → 既有任務工具接一個便宜 API 做評測 → 建立獨立備援入口 → 達標後擴大。研究不等於已批准付費、切換主模型或部署。

來源、證據範圍與限制

主要依據均為官方產品文件,已在各段落附直接連結。另核對 2026-08-10 Auto Router 更新公告,避免沿用舊版參數。市場支出排序及廠商 benchmark 不能取代自己的任務實測。

本文不公開個人帳單、帳號、主機位置、內部路徑或客戶內容。尚未取得完整帳單與任務用量分布、未執行付費評測、未確認各工具目前安裝版本的端到端相容性,因此不保證實際月省金額或特定模型的工作品質。