如何在不將對話時長最佳化的情況下衡量實用的簡短 AI 對話
當簡短的 AI 對話能協助使用者完成小型創意任務時,它就是成功的:例如挑選調色盤、為週末專案命名,或是為個人活動尋找靈感點子。若要評估這類互動,請先釐清使用者的具體需求,接著檢查回覆是否切題、實用,且易於引導或結束。停留時間與回訪次數可以用來描述使用情況,但光憑這些數據並無法告訴你這次互動是否真正帶來了幫助。
從使用者前來處理的任務著手
在選擇指標之前,先用可觀察的詞彙定義一項日常任務。「為陽台香草花園想幾個有趣的名稱」就比「進行一場引人入勝的對話」更容易評估。前者為審核人員提供了具體的觀察重點:系統是否提供了符合需求的名稱?使用者是否能夠選擇或調整其中之一?
這遵循了更廣泛的可用性原則:判斷特定使用者能否在特定情境下,有效率、有成效且滿意地達成特定目標。ISO 定義將這些視為相關但截然不同的特質,因此沒有任何單一指標(包括時長)能夠代表全部。ISO 9241-11:2018, *Ergonomics of human-system interaction — Part 11: Usability: Definitions and concepts*
對於創意型請求,應將「完成」定義為實用的成果,而非單一的正確答案。使用者離開時可能帶走了一個選定的點子、一份候選清單,或是能進行另一次嘗試的更好方向。請事先寫下對這項任務而言怎樣才算足夠。這樣可以避免團隊在不知不覺中將成功重新定義為「使用者一直在持續聊天」。
分別為完成度與切題性評分
實務上的審核可以從兩個問題開始:這次互動是否達成了預期成果?助理的回覆是否符合請求?請將這兩者的評分分開。一個回覆可能很切題,但卻沒有給使用者一個可用的選擇;使用者也可能在忽略了令人分心或泛泛的回覆後,依然完成了任務。
任務完成度是一種常見且簡單的指標,但它將結果壓縮成「是」或「否」,無法解釋使用者為何失敗,也無法說明完成的任務執行品質如何。請將它與簡短的對話審查或直接的使用者評分搭配使用。Nielsen Norman Group, “Success Rate: The Simplest Usability Metric”
對話研究支持了這種更細緻的觀點。一項針對任務導向對話的研究,在輪次與對話層級上分別標註了切題性、趣味性、理解度、任務完成度與效率;該研究發現,單一的整體評分可能會忽略實用的細微差異,且不同標註者與對話之間的滿意度各不相同。這些發現並不是一套放之四海皆準的評分公式,但它們提供了一組有根據的維度,可供套用至創意任務中。Siro, Aliannejadi, and de Rijke, “Understanding User Satisfaction with Task-oriented Dialogue Systems”
將回覆品質視為單輪對話層級的問題
檢視每個回答是否回應了最新的請求,並善用了前幾輪對話中的相關上下文。例如,如果使用者說「讓那些顯得不那麼正式」,那麼實用的下一個回覆就應該相應地調整建議。請計算可避免的重複、遺漏的限制條件,或是無助於推進任務的釐清請求次數。
一項針對智慧助理的研究發現,滿意度因情境而異:在某些任務中,任務完成度極為關鍵,而在另一些任務中,所花費的心力則更為重要。該研究還指出,保留對話上下文非常重要,而且整體任務滿意度不能簡化為對單一查詢的滿意度。在實務上的啟示是,既要檢查特定回覆,也要審視整個互動過程,同時根據所屬任務來解讀每一項指標。Microsoft Research, “Understanding User Satisfaction with Intelligent Assistants”
對於創意互動,簡短的人工審核可以將回覆標註為切題、部分切題或偏離主題,並記錄助理是否遵循了修正指示。這些標籤是一種建議的審查方法,而非經過驗證的基準。如果由自動化分類器提供這些標籤,請手動抽樣檢查:看似漂亮的評分仍可能遺漏那些技術上符合提示詞、但實際上卻沒有提供任何可用內容的建議。
確認使用者能夠引導互動方向
使用者掌控度體現在微小的時刻:使用者能夠縮小請求範圍、要求另一種風格、糾正誤解,或在獲得足夠資訊後停止。檢視對話紀錄,確認系統是否對引導做出回應,而不是反覆堅持自己的對話方向。如果介面提供了停止、編輯、重新產生或清除回覆的控制項,請測試這些操作的行為是否符合人們的預期。
針對對話代理的研究從自主性的角度進行了描述,其中包括對對話、提問和回覆的掌控權。這支持了將掌控度視為一項值得檢視的特質,儘管它並未為此確立一個通用的產品指標。Yang and Aurisicchio, “Designing Conversational Agents: A Self-Determination Theory Approach”
一個輕量級的使用者提問可以讓掌控度變得可衡量:「您是否能讓對話產出您想要的那種結果?」在互動結束後提出這個問題,並附帶一個任務完成度問題。在各個對話階段中保持回答選項的一致性,並允許填寫簡短說明。低分是需要檢查對話的訊號,而不是特定原因的定論證明。
將明確的結束視為有效的成果
良好的終點是指使用者已獲得所需內容,並且可以在系統沒有進一步提示的情況下離開。以香草花園為例,那可能就是他們選定名稱的時刻。在那裡結束的對話,可能比透過泛泛的後續追問所延長的對話更有價值。這是一項從任務推導出的衡量原則:如果目標已經達成,額外的對話輪次並不會自動增加價值。
追蹤任務是否看起來已完成,以及使用者是否選擇繼續,但要在具體情境中解讀這些事件。後續的對話輪次可能反映出好奇心、必要的修正,或是未完整的回答。默默離開可能意味著使用者感到滿意、分心或失望。單憑對話長度無法區分這些解釋;請透過抽樣對話紀錄審核或簡短的使用者回饋來深入調查。
將時長作為情境背景,而非最終評判標準
時長有助於回答營運層面的問題,例如特定流程是否經常需要許多輪對話。但它仍然只是衡量活動流逝時間的指標,並不是證明回答實用的直接證據。例如,Google Analytics 將參與時間定義為與事件相關聯的使用者參與持續時間;其開發者指南也警告,人為延長工作階段會扭曲行為數據。這些是分析定義和實作警示,並非創意對話的品質衡量標準。Google Analytics, “Measurement Protocol reference” 以及 Google Analytics, “Measure sessions and user engagement”
僅在類似任務之間比較時間,並將其與任務完成度、切題性、使用者掌控度和明確的終點一併考量。較短的中位數時長可能反映出更直接的回答,但也可能反映出使用者放棄了。較長的時間可能意味著成效良好的反覆調整——也可能是毫無必要的阻礙。佐證必須來自任務成果與使用者的實際體驗,而非單看計時。
精簡的評估流程
在小型研究中,給予參與者一項措辭明確的創意任務,讓他們自然地使用聊天功能,並記錄他們是否達成了自己定義的成果。抽樣審查互動紀錄,檢視其切題性、上下文理解能力,以及引導或停止的機會。在每項任務結束後,詢問他們是否獲得了有用的結果,以及是否覺得能夠主導對話。將時長記錄為情境背景,接著深入調查時長與使用者回報之實用性不一致的情況。
分別報告各項指標,而不是將它們合併為單一的「參與度」分數。說明任務內容、完成度的評判方式、回覆的審核者,以及使用者回饋的收集方式。如果樣本數較小或任務定義較為主觀,請將調查結果描述為方向性的參考,而非推廣至所有使用者或所有創意請求。
簡短互動的價值在於引導使用者從具體的需求走向實用的結果,同時讓他們掌控前進路徑與停下腳步的時機。請直接衡量這些成果。讓工作階段長度協助解釋體驗,但絕不要讓它來定義成功。
