如何測試 AI 角色在十次對話後是否依然引人入勝
要測試虛構的 AI 角色在經過十次對話後是否仍具吸引力,請為遊戲測試員提供一致的角色和設定,然後邀請他們進入十個不同且逼真的情境。追蹤他們選擇的場景、角色是否忠於既定設定、每次互動產生了哪些新的故事素材,以及測試員是否選擇完成整套測試。將這些視為改進角色的客觀線索,而非衡量一個人能聊多久的指標。
界定本次測試中「依然引人入勝」的意義
第十次對話應該要能展現出在最初的新鮮感消退後,角色是否還能持續支撐有價值的互動體驗。在本次練習中,「吸引力」意味著測試員有理由選擇多樣化的場景、能在變動的情境中認出該角色,並從互動中獲得有用或令人驚喜的內容。「完成度」則是一項最終的自願行為:測試員自行決定完成預計的第十次對話。這些觀察結果單獨來看,都不能證明每位玩家都會覺得這個角色引人入勝。
將問題聚焦在:「這個角色是否提供了足夠一致且新鮮的素材,讓這位遊戲測試員願意選擇並完成十次對話?」不要將總花費時間作為決定性的評分標準。長時間的互動可能反映出一個引人入勝的場景,但也可能反映出困惑或懸而未決的提示詞。角色測試的核心問題關乎場景選擇、正典設定、新鮮感和自願完成度——而不是消費者的訂閱費用在十四天內是否物有所值。
準備正典設定卡與十個場景邀請
在測試前,撰寫一份簡要的正典設定卡,列出角色必須保持的事實:其角色定位、重要經歷、既定偏好、人際關係、界限以及獨特的說話風格。同時也納入一些具備彈性的特質:在感到驚訝時會有何反應、會注意到什麼,或者傾向於忽略哪些細節。這樣一來,無需強制角色重複相同的口頭禪,即可觀察到一致性。針對具備人設條件的對話代理(persona-conditioned dialogue agents)之研究,將人設一致性視為一項評估指標;而一項針對互動語言模型代理的研究也發現,各設定檔在互動過程中的一致性與語言對齊程度各不相同。這些研究促成了對跨多次互動行為的檢驗;但它們並未確立十次對話就是通用的門檻。(Building Persona Consistent Dialogue Agents with Offline Reinforcement Learning;LLM Agents in Interaction: Measuring Personality Consistency and Linguistic Alignment in Interacting Populations of Large Language Models)
準備十個場景邀請,創造不同的契機,同時不預先限制角色的台詞。例如,角色可能需要挑選一份小禮物、計劃拜訪熟悉的地方、化解一場無傷大雅的誤會、協助籌辦社群活動,或者決定如何度過一個意料之外的空閒午後。讓每個邀請都維持在角色既定的世界觀和日常個人選擇之內。改變情境與決策類型,同時保留足夠的連續性,讓先前的事件能發揮作用。
避免撰寫十個僅有表面變化卻大同小異的提示詞。一個有價值的場景會要求玩家做出有意義的選擇,或帶入自己的想法。互動敘事的相關研究與理論認為,玩家能動性不僅僅在於選項的存在:玩家的理解與詮釋也會形塑體驗。在本次遊戲測試中,這意味著要記錄測試員實際選擇的內容以及他們如何引導場景,而不只是計算角色回應了多少提示詞。(Connecting player and character agency in videogames)
進行十次對話,不預設或引導「正確」回應
向測試員提供簡短、中立的說明:他們正在體驗角色和場景,而這項測試著重於體驗本身,而非他們的表現。讓他們知道隨時可以中途停止。每次以一致的格式呈現一個場景,並避免暗示如何讓場景變得精彩,或角色應該做出哪種選擇。有主持人的易用性測試指引建議設計清晰、逼真且不洩露答案的任務,並觀察參與者並提出開放式後續問題。將這種嚴謹方法調整後應用於創意互動中:明確說明設定,然後留出空間讓測試員以自己的方式回應。(Using moderated usability testing)
在每次互動結束後,記錄幾項具體的觀察:測試員選擇或發展了哪個場景、是否引入了新方向、角色是保持還是違背了正典設定,以及出現了什麼新的故事元素。當特定台詞或選擇能佐證觀察時,將其記錄下來。將這些觀察與主觀詮釋分開:「測試員改變了去市場的計劃」是一項觀察;「該角色激發了玩家能動性」則是一種可能的詮釋。相較於籠統的印象,簡短且單點明確的筆記在跨場次比較時更容易進行對比。(Taking notes and recording user research sessions)
互動結束後,提出少數幾個中立的問題。「接下來你還想和這個角色做些什麼?」可以揭示測試員是否能想像出另一個場景。「有什麼地方與你對該角色的理解不一致嗎?」可以找出破壞正典設定之處。「哪一部分讓你覺得熟悉,哪一部分讓你覺得新奇?」可以釐清新鮮感是來自角色、情境還是測試員自身的投入。詢問是什麼觸發了他們的回答,而不是由你自行提供解釋。
使用簡單的十行計分卡
每次對話使用一行。精簡的量表有助於總結規律,但筆記和具體實例遠比算術分數更重要。以下評分準則是一項實用的測試輔助工具,而非經過驗證的正式研究量表。
對話:1–10;場景選擇或走向:測試員選擇、補充或轉向的內容;正典設定:0 = 矛盾;1 = 不明確;2 = 一致;實用新鮮感:0 = 僅重複而無新增;1 = 包含部分新素材;2 = 明確、可用的進展;是否自願完成?:是 / 否
對於正典設定,只有當角色與設定卡上的事實或既定事件發生衝突時才判定為矛盾——不能僅僅因為角色在全新情境中有不同表現就判定為矛盾。對於新鮮感,應採計能為測試員提供回應或發揮基礎的細節、決策、人際關係進展或場景轉折。如果一個令人驚訝的細節在角色的世界觀中毫無意義,就不能算作實用新鮮感。對於場景選擇,請保持客觀描述,而非評判測試員的偏好:多樣性意味著角色能容納不同的方向,而不是要求測試員必須挑選預設範圍內的內容。
將完成情況與其他評分分開記錄。如果測試員自願完成了第十次對話,請予以標註;如果他們中途停止,詢問他們是否願意分享導致停止的原因。不要將完成視為喜愛的證明,也不要將未完成視為失敗的證明。測試員可能因為角色之外的因素而停止,而已完成的對話序列也可能包含重複或矛盾的場景。行為與說明的結合,遠比單一的二元結果能提供更多訊息。
解讀規律並決定修改方向
尋找整個流程中體驗發生轉折的地方。如果測試員不斷嘗試不同類型的場景,但角色的回應卻變得千篇一律,請針對各種情境下的語調與決策邏輯進行改善。如果角色依然容易辨識,但場景屢屢在沒有新決定或新細節的情況下草草結束,請修改場景邀請,或給予角色更具體的目標與偏好以便採取行動。如果測試員開始改變場景走向,請檢視預設的情境是否顯得過於雷同、狹隘,或者單純沒有測試員自己提出的想法來得有趣。
獨特的聲音應該體現在角色所注意到的事物、渴望的事物以及所說的話語中——而不僅僅是重複的口頭禪。一篇關於對話的敘事指南將「聲音」描述為個性的展現,並建議讓對話符合角色的特質、背景與情感。在審閱對話紀錄時請運用該原則:這句台詞在這個情境下是否合理地屬於這個角色?它是否展現了可辨識的視角?(Section 8 – Writing Dialogue – A Beginner’s Guide to Storytelling)
接著選擇一項具體的修改,並與另一位測試員重複相同的十個場景測試,或以記錄明確的新一輪測試來進行。在比較不同版本時,請保留相同的提示詞和評分定義,以確保測試本身的變化不會被誤認為角色的變化。如果第一輪測試發現了正典設定的矛盾,請增加一個能自然檢驗相關事實的場景;如果發現對話內容重複,請增加包含不同類型抉擇的情境。這是一個診斷循環,而非總體評估。單一測試員可以指出具體的障礙與可能性,但無法顯示該結果能在多廣泛的範圍內通用。
十次對話能告訴你什麼——以及不能告訴你什麼
十次對話的格式非常適合用作聚焦的壓力測試:它有助於你觀察場景多樣性、可辨識的正典設定與新鮮素材在開場互動之後是否依然存在。它可以指出特定測試員在何處失去了興趣、在哪裡發現了有潛力的方向,或在何處遇到了矛盾。它無法證明長期的吸引力、預測留存率,或確立所有受眾的反應方式。用它來決定需要審視和修改的內容,如果你需要在不同讀者和遊玩風格間獲得信心,請收集更多的測試數據。
最明確的訊號是帶有實例的模式:測試員有選擇的空間,角色的回應方式符合既定正典設定,場景產生了可供進一步發揮的獨特素材,且測試員選擇完成整個對話序列。當其中一項元素缺失時,筆記應該指向下一個創作決策——調整角色的語調、釐清正典設定或重新設計場景邀請——而不是單純增加更多的對話提示詞。
