最近企業 AI 平台有一個很明顯的方向:不再把所有工作綁在單一模型上。簡單摘要交給便宜快速的模型,複雜推理交給能力較強的模型,圖片、語音或程式再分流到各自擅長的服務。遇到供應商異常,系統還能自動 fallback,不必讓整條流程停下來。
這在成本與可靠性上都很合理。但從技術主管的角度,我更在意另一件事:任務可以換模型,權限不能跟著換一套。如果路由層只知道哪個模型比較快、比較便宜,卻不知道這個人能看什麼、這筆資料能去哪裡、這個動作需要誰核准,那它不是智慧調度,而是一條新的權限繞道。
模型路由不是單純的效能最佳化
很多團隊第一次做 model routing,規則通常很直覺:依任務類型、context 長度、品質要求、延遲與 token 價格選模型。這些指標沒有錯,但它們只描述「哪個引擎適合做」,沒有回答「這次工作可不可以交給它做」。
例如同樣是摘要,一份公開文件與一份內部人事資料,能力需求可能完全一樣,資料邊界卻完全不同。同樣是查詢訂單,一個模型只負責閱讀,另一個 Agent 還能呼叫工具修改交期。若路由層只看到「這是摘要」或「這是高難度推理」,就可能把敏感內容送到不允許的供應商、區域或保存政策之下,也可能讓原本只能產草稿的工作,在切換執行路徑後取得送出權限。
所以我會把路由判斷拆成兩個問題。第一個是能力選擇:哪個模型做得好、成本合理、延遲可接受?第二個是政策選擇:在目前使用者、資料、環境與動作範圍下,哪些執行路徑根本不應成為候選?
順序很重要。應該先用政策把不合格的路徑排除,再從合格集合裡做效能與成本最佳化,而不是先挑出最便宜的模型,最後才祈禱它符合規範。
權限應該附著在任務,不是模型名稱
我不喜歡用「高階模型可以做更多事」來設計企業 Agent。模型能力與業務授權是兩條不同的軸。模型變聰明,不代表它自動取得更多資料;模型比較便宜,也不代表它只能處理低風險工作。
真正應該跟著任務一路傳遞的,是一份可執行的政策上下文,至少包含:
- 發起者與代理身份,以及代誰執行;
- 可讀取的資料範圍、欄位與保存限制;
- 允許使用的工具、動作層級與目標環境;
- 是否只能建議或產生草稿,能否提交、核准或執行;
- 哪些步驟需要人工審批,審批後的授權能使用多久;
- 輸出可以回寫到哪裡,以及必須保留哪些稽核資訊。
這份上下文不應只寫在 prompt 裡。Prompt 可以提醒模型遵守規則,卻不是強制邊界。真正的限制要落在資料存取、工具 gateway、憑證 scope、網路邊界與流程狀態上。模型可以被替換,這些控制仍然要生效。
換句話說,路由層可以決定由誰思考,但不能單方面決定它能碰什麼。
Fallback 最容易把安全悄悄降級
多模型架構最吸引人的功能之一是 fallback。主要服務 timeout、額度用完或區域故障時,自動換另一個模型繼續跑,使用者甚至不一定會察覺。
可惜,越無感的 fallback,越容易藏住安全降級。備援模型可能位於不同區域,資料保留條款不同;它可能不支援原本的結構化輸出或工具授權機制;原路徑使用企業身份登入,備援路徑卻共用一把服務憑證;甚至原模型只能閱讀資料,fallback Agent 卻預設掛載更多工具。
因此,fallback 不應該只是模型清單,而應該是經過驗證的相容矩陣。每條備援路徑都要回答:資料可以送嗎?工具能力一致嗎?審批語意會不會遺失?輸出格式能否被後續系統正確驗證?稽核事件是否仍能串回同一個任務?
如果答案不完整,我寧可讓任務明確失敗或降級成只讀、只產草稿,也不要為了維持「服務看起來正常」,偷偷把治理標準放低。
稽核要記錄路由決策,不只記最後答案
當同一個工作可能經過不同模型、供應商與工具鏈,出了問題只保存最終輸出是不夠的。團隊需要知道當時有哪些候選路徑、為何選中這一條、套用了哪版政策、是否發生 fallback、哪些資料被送出,以及最後由哪個身份執行工具。
這些紀錄不只是資安稽核。它也直接影響品質與成本管理。某類案件為什麼常被送到昂貴模型?某個 fallback 的人工覆判率是否特別高?特定資料範圍是否經常因政策不符而沒有可用模型?如果路由決策不可觀測,團隊只能看到帳單變化與偶發錯誤,卻無法改善架構。
我會把一次 Agent 任務想成一條有政策約束的執行軌跡,而不是一個 API request。模型只是軌跡中的一個可替換節點;身份、權限、審批、資料血緣與責任才是整條軌跡不能斷掉的骨架。
多模型的價值,是保留選擇,不是製造例外
企業採用多模型並沒有錯。它能避免供應商綁定,也能讓不同工作取得更好的品質、速度與成本平衡。真正的問題,是團隊有沒有把「模型可替換」與「政策不可漂移」分開設計。
我現在評估一個多模型 Agent 平台,會先問幾個很務實的問題:路由前是否先做政策判斷?權限能否跨模型一致執行?fallback 失去能力時會 fail closed,還是默默放寬?高風險操作是否仍回到同一套預覽、審批與 rollback?路由決策能否被查詢、重現與解釋?
如果這些問題沒有答案,多模型只會把原本集中在單一服務的風險,分散到更多看不見的角落。
技術上,我們當然希望系統能自動選到最適合的模型。但企業真正需要的,不是每次都選到最聰明的那一個,而是不論選到誰,都不能越過同一條業務邊界。
模型可以換,供應商可以換,成本策略也可以換。不能跟著一起換掉的,是誰能做什麼,以及出了事由誰說明。