技術分享
AI Agent 事件驅動架構:觸發器、事件匯流排與監測管線
要讓 AI Agent 主動運作,難的不是模型,而是背後那套決定它何時被喚醒、事件如何流動、出事後怎麼收拾的機制。本文純從技術實作角度,用 Kafka、Debezium、OpenTelemetry、Stripe 等真實框架與數據,拆解觸發器、事件匯流排、非同步、冪等重試與監測管線五大組件,說明如何把主動化 AI 落地成可觸發、可觀測、可回復的系統。
「幫我整理上週的資料」對系統有多個未定義參數:哪一份資料、整理成什麼格式、輸出到哪裡。真正棘手的不是模型「聽不懂」,而是它偵測得到指令模糊、卻仍傾向直接猜一個解讀執行。康乃爾團隊 2026 年〈Knowing but Not Showing〉把這現象量化:直接問模型「這句話有沒有歧義」,它多半判斷得出來,但放進實際問答情境,它壓倒性地選擇直接作答而不回問,提供檢索脈絡後這傾向還更強(arXiv 2605.25284)。另一項 2026 年程式代理研究〈Ask or Assume〉把代價算清楚:同一組任務,指令完整時解決率 70.8%,指令刻意留白、不許互動時掉到 54.8%——約十六個百分點的差距全來自系統拿假設當事實去執行。可見模糊指令的錯誤不是模型能力問題,而是缺少一層把不確定性顯性化、信心不足時主動澄清的機制。以下拆成四個可落地環節。
第一步是把自由文字對應到有限的意圖集合(intent set):預先定義企業任務類型,例如「查詢報表」「排程會議」「彙整文件」,每個意圖對應一組必填槽位(slot);系統收到指令後同時做意圖分類(輸出 intent 與信心分數)與缺槽偵測(比對必填清單、列出尚未提供的欄位)。以「排程會議」為例,必填槽位是參與者、時間、時長;使用者若只說「幫我約個會」,系統應偵測到三槽全空,而非填入預設值。
槽位填得準本身就是難題,不能假設模型一次到位。含語音雜訊的公開基準 SpokenWOZ 顯示,即使是最強的對話狀態追蹤模型,聯合目標準確率(整輪狀態全對才算對)也只有 25.65%(arXiv 2305.13040)。因此缺槽偵測與槽位驗證必須由程式碼把關,而非讓模型自行決定要不要略過必填欄位;學界也用共形預測(conformal prediction)為意圖產出「可信意圖集合」,集合唯一時直接執行、含多個候選才觸發澄清(arXiv 2403.18973)。
是否發起澄清、或直接轉真人,由信心分數與缺槽狀況共同決定。關鍵認知是沒有放諸四海皆準的百分比,門檻要依業務容錯度設定,且最好用「兩道門檻」——模型能不能給出有依據的答案(can),以及這個風險等級下該不該給(should)。某醫療語音代理把預設門檻訂在 0.75,低於此就轉真人並附逐字稿,把推得的意圖標為「建議」而非「決定」。
| 意圖信心 | 缺槽狀況 | 系統動作 |
|---|---|---|
| 高(≥0.85) | 無必填缺槽 | 直接執行 |
| 高 | 有必填缺槽 | 發起澄清,補齊後執行 |
| 中(0.5~0.85) | 任意 | 複述理解並請使用者確認 |
| 低(<0.5) | 任意 | 請使用者重述,或轉真人 |
單一門檻還不夠:成熟系統會加入多訊號升級——連續數輪信心不足、或對話陷入重複迴圈即轉真人,並記錄每次分類的信心與動作,供日後調門檻與補 few-shot 範例。
澄清迴圈是一個有限狀態機:分類意圖 → 檢查缺槽 → 有缺槽則生成一個聚焦問題回問 → 回填槽位 → 重新檢查。兩條原則決定它好用與否。其一是「一次只問最關鍵的一到兩個缺槽」,一次丟五個問題會讓使用者放棄;ICLR 2025〈Modeling Future Conversation Turns〉指出,問對的澄清問題不只能消歧,連看似無歧義的問題也能提高答對率(arXiv 2410.13788)。其二是「別問過頭」,迴圈必須設輪數上限(例如三輪),超過即改走預設值或轉真人。2026 年的澄清能力基準 ClarEval 更把這點寫進指標,用「平均澄清輪數」(ATC)與「效率調整召回率」(EAR)懲罰過度追問,量化準確與打擾間的取捨(arXiv 2603.00187)。承前例,使用者說「安排明天的檢討會」、意圖信心 0.9 但缺參與者與時長,系統只回問這兩項、補齊後才建會,全程不臆測名單。
系統提示裡光寫「不確定時先問」效果有限,因為模型預設就傾向直接答。更可靠的做法是把「判斷該不該問」與「執行任務」拆成兩個角色。〈Ask or Assume〉的雙代理設計就是範例:意圖代理(Intent Agent)只負責分析對話、回報意圖、缺什麼、哪裡是假設,並輸出帶 needs_clarification 布林旗標的結構化 JSON;主代理(Main Agent)受此旗標約束,為 true 時只能回問、不得動手。這套配置讓 OpenHands+Claude Sonnet 4.5 的解決率從單代理的 61.2% 拉到 69.4%,幾乎追平指令完整時的 70.8%。落地三個要點:
不必替所有功能都補上完整澄清機制。務實順序是先找出「一旦誤解就代價最高」的一兩條流程——付款、發信、刪改資料這類不可逆動作優先,補上意圖分類、缺槽驗證與信心門檻,再擴及其餘。衡量成效要看實際數字:誤執行率、澄清後一次完成率、以及多少澄清是必要而非打擾。Gartner 於 2025 年 3 月預測,到 2029 年代理式 AI 將自主解決八成常見客服問題、帶動約三成營運成本下降;但這上限的前提,正是系統懂得該問就問、超出把握時交回人手,而不是把模糊話當明確指令去執行。
把澄清能力做對,難的不是意圖分類、slot filling、澄清迴圈這些名詞,而是判斷哪條流程值得投資、每道信心門檻與退場行為怎麼設,以及如何在不過度打擾下擋住錯誤執行——這需要同時懂業務容錯與系統實作。恩梯科技的 AI 導入顧問與客製開發服務,會先協助盤點企業任務類型、定義意圖與槽位結構,設計信心門檻與雙代理式澄清架構,並在上線後持續調校門檻與 few-shot 範例。若你的 AI 系統常因誤解指令而產出無用結果,歡迎與我們談談如何把「該問就問」變成穩定的內建行為。
想把這些做法落地到你的公司?
加 LINE 免費諮詢需要協助嗎?
點擊這裡與我們聯繫!