技術分享
長對話上下文工程:壓縮、摘要與分段如何守住 AI 的焦點與成本
長對話中 AI 為何越聊越貴、越聊越發散?本文用 Chroma、Anthropic 等最新研究數據,拆解滑動視窗、摘要壓縮(compaction)、分段外部卸載與關鍵資訊釘選四種上下文工程策略與組合方式。
企業導入 AI 代理時最常見的困境,是把「人做」與「AI 做」當成非此即彼的開關:不是每一筆都要人核准,就是索性全部交給系統自動跑。Gartner 於 2025 年 6 月預測,到 2027 年底將有超過四成的 agentic AI 專案被取消,主因正是成本失控、商業價值不明與風險控制不足,且多數專案仍停在被炒作驅動的 PoC 階段走不到生產。這個數字的另一面很清楚:全審讓自動化失去意義,全放又在系統尚未被驗證前承擔不可控風險,兩端都會讓專案卡住。真正可落地的做法,是把放權設計成一道有級距、可驗證、可撤銷的階梯——從人工全審開始,隨表現達標逐級鬆手,同時保留隨時退回上一級的煞車。
談分級之前先確立詞彙。人與自動化的關係,業界通常拆成三種姿態,IBM 與航太人機協作研究都以這三層描述監督強度:
| 監督姿態 | 人的角色 | 適用情境 |
|---|---|---|
| 人在迴路內 human-in-the-loop | AI 提建議,每一筆都要人核准後才執行 | 決策間隔長、單筆影響大 |
| 人在迴路上 human-on-the-loop | AI 自主執行,人事後監看、隨時可介入 | 決策太快、無法逐筆審 |
| 人在迴路外 human-out-of-the-loop | AI 全程自主,人只看監控告警 | 低風險、可自動回滾、無法即時通訊 |
值得注意的是,歐盟《AI 法案》第 14 條要求高風險 AI「可被有效監督」,但明確不等於要人審查每一個決策——它要求的是人有能力監看、理解、介入並隨時中止系統,並警覺「自動化偏誤」,也就是過度信任 AI 輸出的傾向。這正是授權分級要解決的問題:在不同動作上,給人不同強度的介入權。
把自主權切成級距不是新發明。早在 1978 年,Sheridan 與 Verplank 就為海底遙控機具提出十級自動化量表,從「人做全部決策」一路排到「機器完全自主、連通知都不給人」。2000 年 Parasuraman、Sheridan 與 Wickens 進一步把自動化程度對應到資訊處理的四個階段——獲取、分析、決策、執行——指出同一系統在不同階段可以有不同自主度。這個觀念被 2025 年後的 AI 代理框架直接繼承:一份被廣泛引用的《Levels of Autonomy for AI Agents》以「使用者扮演的角色」定義五級自主——操作者、協作者、顧問、核准者、觀察者,從人主導一路過渡到人只旁觀。企業要借用的,正是這種「同一個代理、不同動作、不同級別」的分層思路。
把上述理論收斂成企業可直接套用的五個級距。核心原則:同一個 AI 代理在不同動作上可以處於不同級別——唯讀查詢可能已是 Level 4,涉及金額或不可逆的動作仍停在 Level 1。
| 級別 | 決策與執行 | 人工介入方式 | 適用門檻 |
|---|---|---|---|
| Level 0 全人工審核 | AI 提出建議,人逐筆核准後才執行 | 每一筆都審 | 剛上線、風險未知 |
| Level 1 抽樣審核 | AI 執行,人事前抽審一定比例 | 抽審 20–50% | 已初步驗證、低風險 |
| Level 2 例外審核 | AI 執行,僅低信心或高風險案件送審 | 只審例外 | 準確率穩定、風險可控 |
| Level 3 事後審核 | AI 全自主執行,人做事後抽查與覆盤 | 事後抽查 | 長期穩定、影響可逆 |
| Level 4 全自主 | AI 完全自主,人只看監控與告警 | 僅監控儀表板 | 成熟、低風險、可自動回滾 |
這道階梯把「要不要信任 AI」這個模糊問題,拆成一連串可驗證、可撤銷的小決定——逐級鬆手是長期累積的結果,不是一次跳到全自主。
晉級不能靠感覺,必須綁定可量測的指標。建議每一級都預先定義三類門檻,全部達標才允許往上一階:
把門檻寫成明確數字而非原則宣言,晉級就成為一個可稽核的決策:誰、在什麼數據基礎上、把哪一類動作從哪一級推到哪一級,全程留痕,也讓決策者能對董事會或稽核單位交代放權的依據。
階梯真正的安全感來自它可以往下走,而這裡要分清兩種東西。殺手鐧(kill switch)是人發現不對、手動終止;斷路器(circuit breaker)則在基礎設施層自動觸發——當代理在 M 分鐘內呼叫工具超過 N 次、同一呼叫連續失敗三次、或單次工作階段成本超標,就自動暫停並告警。這正是兩者的分野所在:代理若在無人值守時陷入重試迴圈,整夜發出大量失敗呼叫,能及時止血的只有能自動觸發的斷路器——殺手鐧因為沒人醒著而毫無用處。建議設三種自動降級觸發:指標跌破門檻,自動降一階並提高審核比例;發生單次重大事故,立即降級並凍結該類動作待人釐清;動作觸及金額或影響上限,該筆自動轉人工審核。放權因此是可進可退的雙向階梯,而非一次性的豪賭。
實務上最常見的錯誤,是把整個 AI 代理當成單一級別一次放權。正確做法是以「動作類型」為單位分別分級:唯讀查詢、產生草稿、對外發送、寫入系統、涉及金額或不可逆的操作,各自維持獨立的授權級別與門檻,並為每一筆動作留下審計軌跡,記錄當時的級別、信心分數與是否經人工介入。Salesforce 的 Agentforce 就以 Trust Layer 落實這套做法:資料遮罩、逐筆稽核日誌,並依風險與敏感度設定核准與升級路徑。治理成熟度仍是普遍缺口——Deloitte 2026 年調查指出,僅約 21% 企業對自主代理具備成熟治理,卻有 74% 預計兩年內導入 agentic AI。先把授權階梯與斷路器建起來,才能在低風險動作上快速走到全自主,同時把高風險動作牢牢綁在人工審核,兼顧效率與安全。
恩梯科技協助企業把授權分級框架落地到既有流程:從盤點動作類型與風險等級、定義各級的量化門檻與觀察期,到建置抽審機制、審計軌跡與自動降級的斷路器,並在上線後陪企業一起依數據逐步放權。若你的 AI 系統卡在「不敢全放、又不想全審」的兩難,歡迎與恩梯科技討論,一起設計一條可進可退的自動化階梯。
想把這些做法落地到你的公司?
加 LINE 免費諮詢需要協助嗎?
點擊這裡與我們聯繫!