如何在 20 分鐘內觀察 AI 遊戲對話遊玩測試
對於正在測試單一生成式對話場景的小型工作室,請觀察玩家如何利用 NPC 的回答:他們是否嘗試了不同的問題、是否根據有用資訊採取行動、是否從虛構事實中恢復,以及是否退出對話以完成場景。簡短的問卷可以記錄玩家在事後所表達的感受或理解;但它本身無法展示逐刻發生的選擇與繞路。在遊玩過程中請使用簡單的事件表,然後提出具針對性的後續問題。請將觀察結果視為關於此場景和版本的實證——而非衡量滿意度的指標或所有玩家行為模式的證明。
在生成式對話場景中你該觀察什麼?
選擇一個目標明確的場景,且該場景中的 NPC 回答可能會改變玩家追求該目標的方式。例如在一個虛構場景中,玩家必須在通風週期結束前打開密封的溫室大門。維修 NPC 可以透過自由對話提供線索。預期途徑是在工具棚中找到藍色閥門手柄,但 NPC 可能偶爾會虛構細節,例如聲稱手柄在被水淹沒的泵房中。
以下四個指標聚焦於玩家行為和場景後果。它們不需要你去評判提問是否聰明,或玩家看起來是否享受遊戲。
指標:**多樣化提問** — 記錄事件的時機…:玩家在獲得回答後改變了措辭、主題或方式——例如詢問閥門在哪裡,接著詢問它是什麼顏色或哪個房間是安全的。 — 需注意的具體實證:他們問了什麼、NPC 回答了什麼,以及下一個問題是否順應該回答。區分真正不同的詢問與近似重複的提問。 — 事後提問…:「你希望透過那些問題了解什麼?」
指標:**回答改變了下一步行動** — 記錄事件的時機…:玩家順應 NPC 的回答而移動、檢查某物或改變他們的計劃。 — 需注意的具體實證:NPC 的回答、玩家的下一步行動,以及他們繞過的任何明顯替代選項。將這種關聯標記為明確、合理或不確定;回答之後採取的行動並不能證明就是回答所引起的。 — 事後提問…:「對話中的哪一部分(如果有的話)影響了你的下一步行動?」
指標:**虛構事實導致誤入歧途** — 記錄事件的時機…:玩家順應 NPC 特定未經證實或虛假的主張,並因此採取了徒勞無功的行動。 — 需注意的具體實證:確切的主張、引發的行動、在版本中可見的代價或繞路,以及玩家如何發現或修正錯誤。在將主張標記為虛構之前,請在測試結束後核對場景的預設事實。 — 事後提問…:「是什麼讓那條路線看起來是正確的?你是在何時決定改變方向的?」
指標:**玩家能夠停止對話並完成場景** — 記錄事件的時機…:玩家退出、暫停或拒絕進一步對話,並且仍然能夠追求並完成目標。 — 需注意的具體實證:退出選項是否清晰可見、離開後發生了什麼、是否仍能取得有效進展,以及玩家是否達到場景的完成狀態。將遇到阻礙與玩家主動選擇繼續交談分開記錄。 — 事後提問…:「你覺得自己能夠隨時離開對話嗎?是什麼讓你選擇繼續或停止?」
這些是事件定義,不是品質評分。請記錄玩家實際的言語和行動,而不是從面部表情、沉默或遊戲時長推斷意圖。如果某個事件沒有發生,請記錄「本場次未觀察到」,而不是推定為失敗。
讓觀察表與遊戲版本緊密結合
在每個測試場次開始前,記錄組建版本、初始目標、已知場景事實和允許的完成狀態。在遊玩過程中,寫下玩家的提問、NPC 的回答、下一個可見行動以及任何確定的遊戲狀態變更。一句聽起來有幫助的話如果指向了該版本中不存在的位置,它依然是錯誤的。
測試結束後,將疑似虛構的事實與實際的場景設定表進行比對。只有當場景事實與該主張相矛盾時,才將其標記為已確認的無根據主張;否則將其標記為未解決並展開調查。請為引導者的提示或技術中斷保留單獨的記錄,因為這些因素可能會改變玩家的下一步行動。這種簡短的佐證線索能使後續討論更加精準,而不會將單次遊玩結果視為普遍結論。
如何進行有時間限制的 20 分鐘測試
告訴參與者:「請像平時一樣體驗這個場景。你可以隨時與角色交談或隨時離開對話。我可能會保持安靜,以便觀察你的嘗試。」避免教導他們提出多樣化問題或提醒他們注意虛構事實;那樣會改變此測試旨在揭示的行為。如果他們尋求幫助,請以一致的方式回應,記錄下這次干預,並在分析後續行為時考慮該幫助的影響。
一個切實可行的時間表如下:
**第 0–2 分鐘:準備設定。** 解釋任務和操作方式,不要描述預期解決方案。當玩家獲得控制權時開始計時,並確保每位參與者的場景初始狀態完全相同。
**第 2–15 分鐘:觀察記錄。** 讓玩家探索和對話。記錄每個相關的回答和下一步行動,特別是當某個說法引導他們前往某處時。在玩家停滯且需要提示才能繼續的時刻,使用中立的提問(如「你現在在想什麼?」);並記下你進行了干預。
**第 15–20 分鐘:結束與詢問。** 如果玩家尚未完成,請在遊玩 15 分鐘時叫停並記錄當前狀態,而不要暗示他們未能通過速度測試。詢問與觀察到的事件相關的後續問題,然後提出一個廣泛的問題:「關於對話或你的下一步,是否有任何不清楚的地方?」將自我陳述與觀察到的行為分開記錄。
20 分鐘的限制是本範例中一個切合實際的測試邊界,而不是實證基準。花更長時間交談的玩家並不代表滿意度更高,而快速完成的玩家也不一定理解或喜歡該場景。如果在你的版本中該任務需要更多時間,請在測試前調整時間表並保持一致。
將發生的事實與玩家的陳述分開
在[《圖靈測試》事後回顧](https://www.gamedeveloper.com/business/postmortem-building-i-the-turing-test-i-around-a-secret-mechanic)中,設計總監 David Jones 描述了向學生測試謎題、收集趣味性與難度評分以及遊玩時長,並更加重視觀察玩家行為的經驗。他描述了如何結合評分與觀察來評估難度曲線。對於對話場景而言,有用的借鑑是將這兩種證據放在一起但保持各自獨立:事件日誌顯示玩家做了什麼;後續訪談記錄他們的解釋或評分。兩者都不能自動解釋對方。
Klei 的[《忍者之印》事後回顧](https://www.gamedeveloper.com/design/classic-postmortem-klei-entertainment-s-i-mark-of-the-ninja-i-)描述了頻繁與新玩家進行測試以檢驗設計假設。團隊尋找抱怨背後的動機,觀察新玩家在哪裡遇到困難,然後調整提示和設計。應用在此處,玩家的誤入歧途是一個需要調查的線索——而不是單純將 NPC 對話加長的藉口。去探究在回答、介面或場景中有什麼讓該路線顯得具備說服力,並在決定要修改什麼之前檢查錄像或版本狀態。
Ubisoft 的 [Teammates 公告](https://staticctf.ubisoft.com/8aefmxkxpxwl/2QCAorjku7w7gH1LGORV3t/6e8f347be3ecab7daa4769e5300086bc/Ubisoft_Unveils_%C3%A2__Teammates%C3%A2____Its_First_Playable_Generative_AI_Experience_Through_Closed_Player_Testing.pdf)描述了一項針對可玩生成式 AI 體驗的封閉玩家測試。它證明了該團隊宣布了封閉測試;但所引用的公告中並未提供已發布的玩家測試結果,因此無法用來支持關於玩家做了什麼或該體驗是否成功的論述。
將觀察結果轉化為下一版本的決策
測試結束後,審視時間線並將 NPC 的每個回答與玩家的下一步行動連結起來。對於每一個看似走錯方向的情況,驗證相關的場景事實,然後找出可能的原因:NPC 提供了虛假細節、玩家誤解了真實回答,或是某個位置或互動提示將他們引向了別處。在對照記錄的順序進行核對,並在有需要時經由另一次測試驗證之前,這些解釋都只是假設。
利用這四個指標來挑選具體的後續調整或測試。如果玩家提出了幾個不同的問題,但得到的回答無法指導行動,請檢視該場景是否提供了可操作的資訊。如果某個特定的虛構主張將他們引導到了錯誤的房間,請考慮場景是否需要一種驗證該主張或在不陷入死胡同的情況下恢復的方法。如果玩家無法離開對話並完成任務,請檢查退出機制與目標流程。如果他們確實離開並完成了場景,請注意該路徑在該版本中是可行的;但在認定其足夠清晰之前,請先詢問他們理解了什麼。
單次 20 分鐘的測試可以暴露出某個特定的困惑或缺失的路徑,但它無法確定該問題有多普遍。在決定下一步調查方向時,請將觀察者的事件記錄、已驗證的場景事實以及玩家的回溯性回答分開。這能為小型團隊提供關於該玩家如何探索此生成式對話場景的實用說明,其價值遠超單純的一份問卷。
