企業開始導入 AI 時,最容易取得的數字通常是買了多少席次、每週有多少人使用、呼叫了多少次模型,以及每個月花了多少錢。這些數字很適合放進簡報,卻不一定能回答真正重要的問題:工作有沒有因此做得更快、更準,或更容易被管理?
我越來越認為,AI 導入最該先做的不是挑模型,而是把原本的流程量清楚。沒有導入前的基準線,導入後看到的每一個「提升」,都可能只是感覺、宣傳,或把成本從一個部門移到另一個部門。
使用率不是成果,只是入口有被打開
席次啟用率、每日活躍使用者、對話數與 token 用量並非沒有價值。它們能告訴我們工具是否被看見、員工是否願意嘗試,也能協助估算基礎設施負載。但這些都是使用行為,不是業務成果。
一位同仁每天打開 AI 十次,可能是工作效率變高,也可能是答案不穩定,必須來回追問十次。某個部門用量突然增加,可能代表流程成功普及,也可能只是把原本一次能完成的事情,拆成更多模型呼叫。只看活躍度,很容易把「系統很忙」誤認成「系統有價值」。
這和早期企業軟體導入很像。帳號有登入,不代表流程有改善;表單電子化,也不代表等待、重工與溝通成本消失。AI 只是讓這個誤判更容易發生,因為生成的內容看起來很有產出感。
先建立一條不完美但可信的基準線
所謂流程基準線,不需要一開始就做成昂貴的流程探勘專案。先挑一個邊界清楚、頻率夠高的工作,回答幾個基本問題就很有幫助:
- 一件工作從進件到完成,日曆時間要多久?
- 人真正投入處理的時間是多少,等待時間又是多少?
- 中間經過幾次交接、補件與人工確認?
- 有多少案件第一次就完成,有多少需要返工?
- 哪些例外最常發生,最後由誰接手處理?
- 錯誤被發現時,修正成本與影響範圍多大?
這些數字不必假裝精準到小數點。重點是定義一致、取樣方式固定,而且團隊對「開始」「完成」「返工」有共同語意。若連完成是什麼都說不清楚,後面再漂亮的 AI ROI 都只是試算表上的想像。
我通常也會把端到端時間和實際處理時間分開。AI 很可能讓撰寫摘要從二十分鐘降到三分鐘,卻沒有縮短案件在部門間等待兩天的時間。如果只量局部操作,會得到七成以上的效率提升;從客戶或內部使用者的角度看,整體流程可能幾乎沒變。
AI 常把成本移位,而不是直接消失
生成速度變快,並不代表總成本一定下降。AI 產生初稿後,可能增加事實核對、格式整理、權限確認與責任簽核;第一線省下時間,卻讓資深人員承擔更多覆判;自動分類提高吞吐量,也可能把少數錯誤送進更下游,直到代價更高時才被發現。
所以我不會只問「模型一次呼叫多少錢」,而會看一件工作完整完成的成本。它至少包含模型與平台費用、人工操作時間、審核時間、例外處理、失敗重跑,以及錯誤造成的返工。若還涉及正式資料或外部承諾,稽核、撤銷與風險控制也不是免費的。
這也是為什麼按使用量比較供應商,常常會得到錯誤結論。單次推論便宜的方案,如果需要更多重試與人工覆判,最終每件完成工作的成本可能更高。反過來,模型單價較高,卻能降低交接、返工與等待,整體反而更划算。
真正適合管理的單位,不是每百萬 token,而是每個可驗證成果。
指標要跟著流程階段分層
我會把 AI 工作流的指標分成四層。
第一層是系統層:可用率、延遲、錯誤率、模型與工具成本。它回答平台是否健康。
第二層是操作層:採用率、建議接受率、人工修改幅度、重試次數與工具呼叫成功率。它回答人和 AI 是否能順利合作。
第三層是流程層:完成時間、等待時間、一次完成率、返工率、例外率與轉人工比例。它回答工作流是否真的改善。
第四層才是成果層:交付速度、服務品質、營運風險、收入、成本或使用者滿意度。它回答這項改善是否值得企業持續投資。
分層的好處,是發現數字變動時不必急著下結論。建議接受率下降,可能是模型退步,也可能是員工開始把 AI 用在更困難的案件;轉人工比例上升,可能是失敗,也可能是風險規則更成熟,成功攔下不該自動處理的例外。指標必須搭配流程脈絡解讀,不能只追求全部往同一個方向變漂亮。
先做影子量測,再談全面自動化
在高風險流程裡,我偏好先讓 AI 以建議或草稿模式運作。它可以產生判斷,但不直接寫入正式結果;系統同時記錄人工原本怎麼做、AI 建議什麼、最後採用哪個版本,以及差異出在哪裡。
這段影子期的價值,不只是驗證準確率。它能幫助團隊看見例外分布、資料缺口、人工判斷規則與真正耗時的地方。有時候跑完才會發現,流程最大的瓶頸根本不在內容生成,而在資料要跨三個系統查找,或完成後仍要等待另一個角色核准。這時候,優先改善整合與流程設計,可能比換更大的模型有效。
等基準線、風險邊界與人工接手機制都穩定,再逐步提高自動化程度。不是因為保守,而是只有這樣,團隊才知道自動化拿掉了哪些成本,又新增了哪些成本。
技術主管要管理的是改善證據
企業 AI 最後一定會遇到預算問題:要不要續約、要不要擴大、哪個流程值得投資、哪個實驗應該停止。到了那一刻,模型展示多驚豔、員工用了多少次,都不足以支持決策。
技術主管真正需要準備的是改善證據:導入前後採用相同定義量測,差異能追溯到流程,失敗與例外沒有被排除在統計之外,而且成本包含必要的人工與治理工作。即使結果顯示某個 AI 專案沒有價值,這套量測仍然有價值,因為它讓團隊可以及早停止,而不是靠期待繼續燒預算。
我不反對用使用率觀察推廣,也不反對比較模型價格。但這些都只能是儀表板的一部分。真正成熟的 AI 導入,應該能清楚回答:原本的工作怎麼完成,現在改變了哪一步,總時間與總成本如何變化,錯誤去了哪裡,以及這個改變是否值得長期保留。
在回答這些問題之前,先不要急著說 AI 提升了多少生產力。先把原本的流程量清楚,才有資格知道我們到底改善了什麼。