讓新對話自動派工,並讓額度耗盡後仍有獨立備援。
以交付品質、返工、完成時間、訂閱耗量與 API 現金支出共同決策。此文件提供通用施工與驗收方式,不保證每次選到理論最佳模型;八小時是首版實作時程,須先確認範圍、支出與安裝權限。
1. 先分清楚入口模型與工作模型
原生介面內派工:新對話載入共用工具與政策,接待模型理解要求並提交工作,長文本與獨立任務交給對應 worker。入口仍消耗自身額度。
第一個請求前完全路由:需要掌控請求入口,例如自有 launcher 或 API gateway。Codex hook 可以加入上下文或攔截操作,但不能由「支援 hook」推論能替換當次主模型;官方事件輸出沒有可直接回傳 model 的切換欄位。官方 hooks 文件
先用 45 分鐘驗證原生桌面入口、CLI、全域工具發現與模型指定能力。CLI 通過不等於桌面通過。若原介面無法自動接入,必須明示未達成,不能默默以手動 CLI 代替。
2. 一個核心,幾條明確的工作路線
| 模組 | 必要責任 |
|---|---|
| 紀錄整理器 | 串流、增量、去重;整理模型、用量、工具、耗時與錯誤。 |
| 政策與能力表 | 任務類型、工具/模態/上下文需求、資料外送界線、版本與理由。 |
| 執行與佇列 | 提交、查詢、取消、恢復;沿用既有可用工具,保存工作狀態。 |
| 品質驗收 | 欄位、引文、測試與完整性;模型自評信心不是通過證據。 |
| 成本與可用性 | 訂閱與 API 分帳;併發原子預留、結算、冷卻與上限。 |
| 入口與操作面板 | 安裝、診斷、停用、復原;可看到分流理由與耗量證據。 |
搜尋、統計、轉檔優先用確定性工具;可驗證抽取比較本機與便宜 API;複雜架構與跨工具任務直接交足夠能力的 agent。純文字 API 不自帶本機工具權限,子代理不能擴張父任務權限。
3. 歷史紀錄提供基線,不是標準答案
- 先看格式、日期、模型與 usage 欄位,原始紀錄留本機,不整份送雲端。
- 以事件時間切分;mtime 只作初步抽樣。依 response、turn、root 等識別值去重,避免累計用量與分支歷史重算。
- 先辨識超長歷史、重複全文、工具輸出膨脹與不必要推理;高耗量不一定是選錯模型。
- 建議取約 60 件代表任務:40 件調政策、20 件保留驗收。資料不足應標明,不用任意樣本宣稱普遍準確。
- 以原始證據、測試與人工糾正建立標準;沒有反對不代表回答正確。
- 歷史命令是待分析資料,不直接重跑;外部寫入使用隔離 fixture 或 mock。環境不能重現時,不宣稱真實任務重播成功。
評測只外送經確認且去識別化的最小片段。API tokens 不能換算訂閱百分比;需要同期官方額度及工作量對照,並說明並行任務干擾。
4. 必須處理的失敗情境
| 風險 | 控制與證據 |
|---|---|
| 新對話未自動派工 | 至少五個全新對話測試,必須留下路由決策;只有 skill 或手動 CLI 不算完成。 |
| 重複派工與無限升級 | 任務血緣、深度與總派工數;最多一次品質升級、整任務最多三次嘗試。 |
| 併發突破費用上限 | 開始前原子預留,結束後依實費結算;重試及驗收也算成本。 |
| 外部操作結果不明 | 穩定 task id、操作日誌與冪等控制;先對帳,不盲目重播。 |
| 程序中斷或主機睡眠 | checkpoint、lease 與失效回收;睡眠期間不保證本機持續執行。 |
| 路由器或設定故障 | 合併既有設定、備份與回退;不能偷偷改成付費或擴大外送。 |
| 額度耗盡 | 獨立 API 執行入口讀取交接包,不能再依賴已耗盡主模型拆任務。 |
| 歷史紀錄含惡意指令 | 全部當待分析資料,不能改變政策、權限與授權。 |
缺憑證時仍可做本機與 mock 驗證,但付費路線必須標為未驗證。先影子模式,再依結果小範圍啟用;不自動在線改政策。
八小時範圍收斂
讓已約定的全部新對話入口載入政策,但首版只將從執行紀錄挑出的三種高頻、可驗收任務自動下放。未知或高難度工作保留能力足夠的路線;全部入口覆蓋不等於所有任務都已最佳化。
操作面板採簡單 HTML/JSON,不另做聊天產品。Auto Router、多產品入口與自我學習政策延後;核心入口或品質未通過時回報 DONE_WITH_CONCERNS 或 BLOCKED,不宣稱全域完成。
5. 八小時首版排程
從必要授權與條件就緒後起算;不是已開始執行的承諾。
| 時段 | 工作 | 必須留下的證據 |
|---|---|---|
| 0:00–0:45 | 備份、入口可行性、憑證狀態 | 桌面/CLI 實測、模型指定、信任與重啟需求。 |
| 0:45–2:00 | 紀錄索引、分類與基線 | 可追溯樣本、耗量缺口、調整集與保留集。 |
| 2:00–4:00 | 分流核心、worker、預算與 checkpoint | 獨立提交、驗收、升級、暫停與恢復。 |
| 4:00–5:30 | 入口 adapter、隔離新對話 | 不手動叫 skill 也觸發;子代理不循環。 |
| 5:30–7:00 | 真模型對照與故障注入 | 品質、返工、耗時、費用;429、timeout、中斷與無預算。 |
| 7:00–8:00 | 小範圍啟用、回退與交付 | 新對話端到端、復原、操作說明與限制。 |
可平行分工紀錄分析、核心與入口驗證,但修改範圍隔離。時間不足先減少候選模型與功能,不刪掉品質和回退驗收。八小時無法取得一個月節費數據,也不能補出產品不存在的介面。
6. 驗收與交付
- 至少五個不同情境的新對話自動觸發,無需補提示;適用範圍以實測入口為準。
- 簡單任務走低成本路線,難任務可直接派強模型,入口/分類/整合成本全計入。
- 保留集建議至少 90% 可直接採用;重要數字、日期與來源錯誤不得直接交付。這是建議門檻,非已達成結果。
- 與可重現基線比較品質、人工修正與耗時;沒有人工盲評時,修正時間先標未知。
- 模擬主額度不可用,獨立 API 在授權費用內完成一件帶工具任務;只產摘要不算備援。
- 併發預算、復原、避免重複外部寫入與停用回退通過;外部帳務延遲需事後對帳。
- 交付版本化程式、政策、操作面板、測試報告、安裝/卸載與已知限制。
不能用 mock 通過代替真模型,也不能用 CLI 通過代替桌面。核心入口未驗證時只能回報部分完成或阻礙。
7. 開工前確認事項
先確認入口範圍、接待模型派工方式、資料外送邊界、費用及設定變更。可討論的試測預算是 US$10、常態 API 月上限 US$20;平台費預留其中,稅與匯率另計。這些僅為建議,尚未授權支出、安裝或修改預設模型。
不自動儲值、不升級訂閱。正式啟用須通過驗收,保留備份與一鍵回退;未通過維持影子模式。
參考:Codex hooks、自訂 provider、OpenRouter CLI 整合、Auto Router、資料保留邊界。