處理模糊指令:意圖辨識與需求澄清的 Prompt 設計

技術分享
Author
恩梯科技
2026-08-25 6 次閱讀 7 分鐘閱讀

模糊指令為什麼會讓 AI 系統靜默出錯

「幫我整理上週的資料」對系統有多個未定義參數:哪一份資料、整理成什麼格式、輸出到哪裡。真正棘手的不是模型「聽不懂」,而是它偵測得到指令模糊、卻仍傾向直接猜一個解讀執行。康乃爾團隊 2026 年〈Knowing but Not Showing〉把這現象量化:直接問模型「這句話有沒有歧義」,它多半判斷得出來,但放進實際問答情境,它壓倒性地選擇直接作答而不回問,提供檢索脈絡後這傾向還更強(arXiv 2605.25284)。另一項 2026 年程式代理研究〈Ask or Assume〉把代價算清楚:同一組任務,指令完整時解決率 70.8%,指令刻意留白、不許互動時掉到 54.8%——約十六個百分點的差距全來自系統拿假設當事實去執行。可見模糊指令的錯誤不是模型能力問題,而是缺少一層把不確定性顯性化、信心不足時主動澄清的機制。以下拆成四個可落地環節。

意圖分類與缺槽偵測(slot filling)

第一步是把自由文字對應到有限的意圖集合(intent set):預先定義企業任務類型,例如「查詢報表」「排程會議」「彙整文件」,每個意圖對應一組必填槽位(slot);系統收到指令後同時做意圖分類(輸出 intent 與信心分數)與缺槽偵測(比對必填清單、列出尚未提供的欄位)。以「排程會議」為例,必填槽位是參與者、時間、時長;使用者若只說「幫我約個會」,系統應偵測到三槽全空,而非填入預設值。

槽位填得準本身就是難題,不能假設模型一次到位。含語音雜訊的公開基準 SpokenWOZ 顯示,即使是最強的對話狀態追蹤模型,聯合目標準確率(整輪狀態全對才算對)也只有 25.65%(arXiv 2305.13040)。因此缺槽偵測與槽位驗證必須由程式碼把關,而非讓模型自行決定要不要略過必填欄位;學界也用共形預測(conformal prediction)為意圖產出「可信意圖集合」,集合唯一時直接執行、含多個候選才觸發澄清(arXiv 2403.18973)。

信心門檻與升級決策表

是否發起澄清、或直接轉真人,由信心分數與缺槽狀況共同決定。關鍵認知是沒有放諸四海皆準的百分比,門檻要依業務容錯度設定,且最好用「兩道門檻」——模型能不能給出有依據的答案(can),以及這個風險等級下該不該給(should)。某醫療語音代理把預設門檻訂在 0.75,低於此就轉真人並附逐字稿,把推得的意圖標為「建議」而非「決定」。

意圖信心缺槽狀況系統動作
高(≥0.85)無必填缺槽直接執行
有必填缺槽發起澄清,補齊後執行
中(0.5~0.85)任意複述理解並請使用者確認
低(<0.5)任意請使用者重述,或轉真人

單一門檻還不夠:成熟系統會加入多訊號升級——連續數輪信心不足、或對話陷入重複迴圈即轉真人,並記錄每次分類的信心與動作,供日後調門檻與補 few-shot 範例。

澄清迴圈(clarification loop)的設計

澄清迴圈是一個有限狀態機:分類意圖 → 檢查缺槽 → 有缺槽則生成一個聚焦問題回問 → 回填槽位 → 重新檢查。兩條原則決定它好用與否。其一是「一次只問最關鍵的一到兩個缺槽」,一次丟五個問題會讓使用者放棄;ICLR 2025〈Modeling Future Conversation Turns〉指出,問對的澄清問題不只能消歧,連看似無歧義的問題也能提高答對率(arXiv 2410.13788)。其二是「別問過頭」,迴圈必須設輪數上限(例如三輪),超過即改走預設值或轉真人。2026 年的澄清能力基準 ClarEval 更把這點寫進指標,用「平均澄清輪數」(ATC)與「效率調整召回率」(EAR)懲罰過度追問,量化準確與打擾間的取捨(arXiv 2603.00187)。承前例,使用者說「安排明天的檢討會」、意圖信心 0.9 但缺參與者與時長,系統只回問這兩項、補齊後才建會,全程不臆測名單。

可落地的澄清 Prompt 與架構範式

系統提示裡光寫「不確定時先問」效果有限,因為模型預設就傾向直接答。更可靠的做法是把「判斷該不該問」與「執行任務」拆成兩個角色。〈Ask or Assume〉的雙代理設計就是範例:意圖代理(Intent Agent)只負責分析對話、回報意圖、缺什麼、哪裡是假設,並輸出帶 needs_clarification 布林旗標的結構化 JSON;主代理(Main Agent)受此旗標約束,為 true 時只能回問、不得動手。這套配置讓 OpenHands+Claude Sonnet 4.5 的解決率從單代理的 61.2% 拉到 69.4%,幾乎追平指令完整時的 70.8%。落地三個要點:

  • 結構化輸出:要求模型回 intent、confidence、missing_slots 三欄,而非自然語言,讓後端用程式邏輯(而非再賭一次 LLM 判斷)決定執行或回問。
  • 缺槽非空才生成問題:missing_slots 有值時才另外產一句 clarify_question,並限定只問缺的欄位。
  • few-shot 示範正確行為:放入「模糊輸入 → 只問缺槽、不執行」的範例,抵銷模型直接作答的慣性;EMNLP 2025 的 Ask-when-Needed 框架證實,用 prompt 明確引導模型「需要時才問」,能同時提升發問品質與 API 呼叫正確率(arXiv 2409.00557)。

導入順序:從錯一次最貴的那條流程開始

不必替所有功能都補上完整澄清機制。務實順序是先找出「一旦誤解就代價最高」的一兩條流程——付款、發信、刪改資料這類不可逆動作優先,補上意圖分類、缺槽驗證與信心門檻,再擴及其餘。衡量成效要看實際數字:誤執行率、澄清後一次完成率、以及多少澄清是必要而非打擾。Gartner 於 2025 年 3 月預測,到 2029 年代理式 AI 將自主解決八成常見客服問題、帶動約三成營運成本下降;但這上限的前提,正是系統懂得該問就問、超出把握時交回人手,而不是把模糊話當明確指令去執行。

恩梯科技如何協助

把澄清能力做對,難的不是意圖分類、slot filling、澄清迴圈這些名詞,而是判斷哪條流程值得投資、每道信心門檻與退場行為怎麼設,以及如何在不過度打擾下擋住錯誤執行——這需要同時懂業務容錯與系統實作。恩梯科技的 AI 導入顧問與客製開發服務,會先協助盤點企業任務類型、定義意圖與槽位結構,設計信心門檻與雙代理式澄清架構,並在上線後持續調校門檻與 few-shot 範例。若你的 AI 系統常因誤解指令而產出無用結果,歡迎與我們談談如何把「該問就問」變成穩定的內建行為。

參考資料

  • Jinyan Su, Claire Cardie(Cornell University),《Knowing but Not Showing: LLMs Recognize Ambiguity but Rarely Ask Clarifying Questions》(arXiv:2605.25284),2026。來源連結
  • Nicholas Edwards, Sebastian Schuster,《Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agents》(arXiv:2603.26233),2026。來源連結
  • S. Si et al.,《SpokenWOZ: A Large-Scale Speech-Text Benchmark for Spoken Task-Oriented Dialogue Agents》(arXiv:2305.13040),2023。來源連結
  • F. den Hengst et al.,《Conformal Intent Classification and Clarification for Fast and Accurate Intent Recognition》(arXiv:2403.18973,NAACL Findings 2024)。來源連結
  • Lucid AI Labs,《Why confidence thresholds beat intent classifiers for medical voice agents》。來源連結
  • M.J.Q. Zhang et al.,《Modeling Future Conversation Turns to Teach LLMs to Ask Clarifying Questions》(arXiv:2410.13788,ICLR 2025)。來源連結
  • J. Li et al.,《ClarEval: A Benchmark for Evaluating Clarification Skills of Code Agents under Ambiguous Instructions》(arXiv:2603.00187),2026。來源連結
  • W. Wang et al.,《Learning to Ask: When LLM Agents Meet Unclear Instruction》(arXiv:2409.00557,EMNLP 2025)。來源連結
  • CX Today,《Gartner Predicts that Agentic AI Will Solve 80 Percent of Customer Service Issues by 2029》,2025。來源連結

想把這些做法落地到你的公司?

加 LINE 免費諮詢

我們不追求大量專案。

只與少數值得深入合作的夥伴建立長期關係。

申請合作評估

需要協助嗎?

點擊這裡與我們聯繫!

立即聯繫