試用期到了,你卻說不出「該不該轉正」
多數企業替 AI 員工設了試用期,卻在期末只能憑印象決定去留:「感覺還行」、「好像有幫上忙」。這不是驗收,是碰運氣。而代價正被數據揭穿——MIT 2025 年的《The GenAI Divide》研究分析 300 個企業部署後發現,高達 95% 的生成式 AI 專案交不出可衡量的損益貢獻,只有 5% 真正跨過「試用到生產」的斷崖;Gartner 也預估,到 2027 年底將有超過四成的代理式 AI 專案因價值不明、成本失控或風控不足而被取消。
這些失敗多半不是 AI 不夠好,而是沒有人在期初就把「怎樣算過關」講清楚。真正的試用期驗收,應該在期初就定義一組可量化的關卡,期末逐項對照,得出明確結論:go(轉正上線)、conditional(限期改善)或 no-go(下線重做)。本文聚焦「轉正這一刻」的驗收門檻與 go/no-go 邏輯,不重談指標如何設計,也不談導入的組織過渡。
轉正驗收的四道量化關卡
把驗收拆成四道彼此獨立的關卡,任何一道未達標都不能無條件轉正。門檻要對照真實基準來訂,而非憑感覺:業界廣泛使用的 τ-bench 顯示,即使頂尖模型在較簡單的零售任務可破 80% 成功率,換到規則較嚴的航空客服任務也常只落在 54~58%,這說明「達標線」必須依任務難度與風險調整。以下為一般中低風險業務的建議起點,高風險場景(金流、法遵、對外決策)應往上收緊(皆為參考基準,非保證值):
| 關卡 | 衡量方式 | 建議轉正門檻 | no-go 訊號 |
| 任務完成率 | 成功結案數 ÷ 總指派數 | ≥ 90% | 低於 75% 或持續下滑 |
| 品質合格率 | 抽樣人工複核通過比例 | ≥ 95% | 重大錯誤出現一次以上 |
| 人工介入率 | 需人力接手數 ÷ 總任務 | ≤ 15% | 高於 30% |
| 表現穩定度 | 連續達標不回跌的週數 | ≥ 3 週 | 週間表現大幅震盪 |
這些門檻可對照公開數據:以客服類 AI 為例,Intercom 的 Fin 公布其約 1.2 萬家客戶的平均解決率約 76%,換句話說仍有約四分之一的對話需要人工接手,可作為「人工介入率」的參考量級。關鍵在於「門檻先於試用」——這些數字必須在試用期開始前就白紙黑字寫下並取得業務單位同意,否則期末很容易被人情或沉沒成本拉著走。
穩定度:最常被跳過、卻最能戳破試用假象的一關
四道關卡裡最容易被輕忽的是「穩定度」。很多團隊看到一次漂亮的展示就急著轉正,卻忽略 AI 的輸出是機率性的,單次成功不代表次次可靠,而這在評測上有殘酷的數學。一個單次成功率 75% 的 Agent,連續三次都成功的機率只剩約 42%(0.75³);τ-bench 的 pass^k 實測更顯示,單次成功率約 60% 的 Agent,連跑八次全過的比例會塌到 25% 以下。串接更放大這個問題:三段各 70% 成功率的流程,端到端只剩約 34%(0.7³)。也就是說,一個「試用期看起來八成能成」的 AI,放到每天成百上千筆的真實流量裡,失誤會被放大到讓人措手不及。因此穩定度不能只看一次驗收,而要看「連續數週不回跌」,並用 pass^k(連續 k 次全過的比例)而非單次成功率來衡量,才擋得住靠運氣過關的假象。
go / no-go 怎麼判:逐關把守,不取平均
四道關卡不是加總後取平均,而是逐關把守。任何一關落在 no-go 區間,就不能直接轉正;但也不代表立刻淘汰,而是進入三選一的決策:
- go|轉正上線:四關全部達標且穩定度連續三週不回跌,正式編入日常流程,改為抽樣監控。
- conditional|限期改善:僅一關落在門檻與 no-go 之間,給 2 至 4 週的改善窗口,鎖定該項指標重驗,其餘維持觀察。
- no-go|下線重做:出現重大品質事故,或兩關以上未達標,退回調整 Prompt、資料或流程,重新起算試用。
驗收時建議把「可硬性判定」與「需要判斷」的項目分開驗:任務完成率、人工介入率這類能用規則精確計算的,用確定性指標自動比對;回覆品質、語氣是否得體這類需要判斷的,2026 年主流做法是搭配 LLM-as-judge,由更強的模型依你定義的標準評分,再輔以人工抽核。用「關卡把守」而非「平均分」,能避免一個危險錯誤:讓亮眼的完成率去掩蓋不及格的品質,而品質失誤往往才是真正讓企業付出代價的地方。
轉正前必須逐項簽核的驗收清單
數字達標只是必要條件,轉正前還要確認 AI 員工能被安全託付。以下清單建議由業務負責人與技術負責人共同簽核,缺一項就不放行:
- 四道量化關卡的期末數據已備齊,並與期初門檻逐項對照。
- 失敗與例外案例已建檔,確認錯誤模式可控、不會造成不可逆損害。
- 人工接手與升級的觸發條件明確,交接動線在真實情境下驗證過。
- 上線後同時保留離線回歸測試與線上即時評分,並設定品質下滑的告警門檻與負責人。
- 資料存取範圍符合權限最小化,敏感資訊處理方式經確認。
- 回滾方案已備妥:一旦轉正後表現崩壞,能在多久內下線。
三個讓驗收失真的常見陷阱
- 用 Demo 數據當驗收數據:展示環境用的是精選資料與簡化流程,反映不了生產的複雜度,驗收必須取自實際流量。
- 只看平均、不看尾端:平均 95% 合格,剩下 5% 若集中在高金額或高風險案件,風險其實不小,要看錯誤的分布而非只看平均。
- 試用期太短就結案:AI 的表現會隨資料與情境波動,穩定度需要足夠時間才看得出來,別在剛上手的高峰就急著轉正。
恩梯科技:把驗收標準前置到導入第一天
多數轉正爭議的根源,不是 AI 不夠好,而是沒有人在導入前就把「怎樣算過關」講清楚。恩梯科技的 AI 導入顧問服務,會在專案啟動時就與你一起訂出四道量化關卡的門檻、簽核清單與 go/no-go 決策邏輯,並協助建立上線後的監控與回滾機制,讓試用期結束時能拿數據說話,而不是靠感覺表決。與其等 AI 上線半年才發現撐不住,不如在第一天就把驗收標準寫進合約與流程裡。
參考資料
- MIT Project NANDA,《The GenAI Divide: State of AI in Business 2025》,2025。來源連結
- Gartner,《Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027》,2025。來源連結
- Yao et al.(Sierra),《τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains》,2024。來源連結
- DataCamp,《Claude 3.7 Sonnet: How it Works, Use Cases & More》,2025。來源連結
- Intercom(Fin),《How AI Customer Service Agents Compare in 2026》,2026。來源連結