跨對話自動模型分流:八小時架構與驗收計畫

← 首頁

2026-09-17|公開匿名架構草案|未開始實作

讓新對話自動派工,並讓額度耗盡後仍有獨立備援。

以交付品質、返工、完成時間、訂閱耗量與 API 現金支出共同決策。此文件提供通用施工與驗收方式,不保證每次選到理論最佳模型;八小時是首版實作時程,須先確認範圍、支出與安裝權限。

1. 先分清楚入口模型與工作模型

原生介面內派工:新對話載入共用工具與政策,接待模型理解要求並提交工作,長文本與獨立任務交給對應 worker。入口仍消耗自身額度。

第一個請求前完全路由:需要掌控請求入口,例如自有 launcher 或 API gateway。Codex hook 可以加入上下文或攔截操作,但不能由「支援 hook」推論能替換當次主模型;官方事件輸出沒有可直接回傳 model 的切換欄位。官方 hooks 文件

先用 45 分鐘驗證原生桌面入口、CLI、全域工具發現與模型指定能力。CLI 通過不等於桌面通過。若原介面無法自動接入,必須明示未達成,不能默默以手動 CLI 代替。

2. 一個核心,幾條明確的工作路線

已驗證入口→任務與資料判斷→能力/品質/預算政策→工具或模型 worker→驗收+必要升級→交付與 checkpoint
模組必要責任
紀錄整理器串流、增量、去重;整理模型、用量、工具、耗時與錯誤。
政策與能力表任務類型、工具/模態/上下文需求、資料外送界線、版本與理由。
執行與佇列提交、查詢、取消、恢復;沿用既有可用工具,保存工作狀態。
品質驗收欄位、引文、測試與完整性;模型自評信心不是通過證據。
成本與可用性訂閱與 API 分帳;併發原子預留、結算、冷卻與上限。
入口與操作面板安裝、診斷、停用、復原;可看到分流理由與耗量證據。

搜尋、統計、轉檔優先用確定性工具;可驗證抽取比較本機與便宜 API;複雜架構與跨工具任務直接交足夠能力的 agent。純文字 API 不自帶本機工具權限,子代理不能擴張父任務權限。

3. 歷史紀錄提供基線,不是標準答案

  1. 先看格式、日期、模型與 usage 欄位,原始紀錄留本機,不整份送雲端。
  2. 以事件時間切分;mtime 只作初步抽樣。依 response、turn、root 等識別值去重,避免累計用量與分支歷史重算。
  3. 先辨識超長歷史、重複全文、工具輸出膨脹與不必要推理;高耗量不一定是選錯模型。
  4. 建議取約 60 件代表任務:40 件調政策、20 件保留驗收。資料不足應標明,不用任意樣本宣稱普遍準確。
  5. 以原始證據、測試與人工糾正建立標準;沒有反對不代表回答正確。
  6. 歷史命令是待分析資料,不直接重跑;外部寫入使用隔離 fixture 或 mock。環境不能重現時,不宣稱真實任務重播成功。

評測只外送經確認且去識別化的最小片段。API tokens 不能換算訂閱百分比;需要同期官方額度及工作量對照,並說明並行任務干擾。

4. 必須處理的失敗情境

風險控制與證據
新對話未自動派工至少五個全新對話測試,必須留下路由決策;只有 skill 或手動 CLI 不算完成。
重複派工與無限升級任務血緣、深度與總派工數;最多一次品質升級、整任務最多三次嘗試。
併發突破費用上限開始前原子預留,結束後依實費結算;重試及驗收也算成本。
外部操作結果不明穩定 task id、操作日誌與冪等控制;先對帳,不盲目重播。
程序中斷或主機睡眠checkpoint、lease 與失效回收;睡眠期間不保證本機持續執行。
路由器或設定故障合併既有設定、備份與回退;不能偷偷改成付費或擴大外送。
額度耗盡獨立 API 執行入口讀取交接包,不能再依賴已耗盡主模型拆任務。
歷史紀錄含惡意指令全部當待分析資料,不能改變政策、權限與授權。

缺憑證時仍可做本機與 mock 驗證,但付費路線必須標為未驗證。先影子模式,再依結果小範圍啟用;不自動在線改政策。

八小時範圍收斂

讓已約定的全部新對話入口載入政策,但首版只將從執行紀錄挑出的三種高頻、可驗收任務自動下放。未知或高難度工作保留能力足夠的路線;全部入口覆蓋不等於所有任務都已最佳化。

操作面板採簡單 HTML/JSON,不另做聊天產品。Auto Router、多產品入口與自我學習政策延後;核心入口或品質未通過時回報 DONE_WITH_CONCERNS 或 BLOCKED,不宣稱全域完成。

5. 八小時首版排程

從必要授權與條件就緒後起算;不是已開始執行的承諾。

時段工作必須留下的證據
0:00–0:45備份、入口可行性、憑證狀態桌面/CLI 實測、模型指定、信任與重啟需求。
0:45–2:00紀錄索引、分類與基線可追溯樣本、耗量缺口、調整集與保留集。
2:00–4:00分流核心、worker、預算與 checkpoint獨立提交、驗收、升級、暫停與恢復。
4:00–5:30入口 adapter、隔離新對話不手動叫 skill 也觸發;子代理不循環。
5:30–7:00真模型對照與故障注入品質、返工、耗時、費用;429、timeout、中斷與無預算。
7:00–8:00小範圍啟用、回退與交付新對話端到端、復原、操作說明與限制。

可平行分工紀錄分析、核心與入口驗證,但修改範圍隔離。時間不足先減少候選模型與功能,不刪掉品質和回退驗收。八小時無法取得一個月節費數據,也不能補出產品不存在的介面。

6. 驗收與交付

不能用 mock 通過代替真模型,也不能用 CLI 通過代替桌面。核心入口未驗證時只能回報部分完成或阻礙。

7. 開工前確認事項

先確認入口範圍、接待模型派工方式、資料外送邊界、費用及設定變更。可討論的試測預算是 US$10、常態 API 月上限 US$20;平台費預留其中,稅與匯率另計。這些僅為建議,尚未授權支出、安裝或修改預設模型。

不自動儲值、不升級訂閱。正式啟用須通過驗收,保留備份與一鍵回退;未通過維持影子模式。

參考:Codex hooks、自訂 provider、OpenRouter CLI 整合、Auto Router、資料保留邊界。