Metlivi 部落格

更換 AI 模型時,遊戲編劇該如何保持角色語氣的一致性?

將遊戲生成的 NPC 對話遷移到不同的 AI 模型時,應將此變更視為編輯回歸審查。凍結一份將正史設定、場景事實與語氣規則明確分開的原始簡報;針對相同的多樣提示詞執行兩個模型;將它們的輸出相互比較並對照簡報;然後由編劇決定需要修改哪些內容,以及候選模型是否已準備好發布。這樣可以清楚看出角色語氣的偏離,而不會把每個特定場景的合理變化誤判為語氣失誤。

2026年9月27日9 分鐘閱讀閱讀、藝術與文化作者:Metlivi Editorial Team
第 1 節

凍結角色的認知範圍與說話方式

在測試之前,為角色和測試場景建立一份具備版本控制的原始簡報。請將三類資訊明確區分:

這種區分至關重要,因為一個回答可能聽起來語氣正確卻捏造了知識,或者保留了事實卻聽起來像另一個人。遷移審查應同時捕捉這兩種失誤,並記錄發生了哪一種類型。

讓語氣規則具備可測試性,而不是依賴如「機智」或「戒備」之類的標籤。具體描述句子節奏(簡短俐落的回覆還是冗長曲折的句子)、詞彙選擇(正式、質樸、專業)、幽默界限(拿什麼開玩笑以及迴避什麼),以及知識極限(知道什麼、懷疑什麼或不可能知道什麼)。如果能釐清規則,可以加入少量核准的簡短範例,但切勿讓範例取代規則本身。

例如,一個作為範例的海港管理員可能說話簡短務實、僅在有用時使用航海術語、調侃熟客遲到,並避免拿渡輪延誤開玩笑。這些都是可審查的具體指標。「性格粗獷豪放」則不是。

正史設定:關於角色和世界的穩定事實,例如姓名、身分、歷史和人際關係。
場景事實:此處發生了什麼、有誰在場、角色目擊了什麼,以及角色目前允許知道什麼。
語氣規則:角色表達自我時反覆出現、可被觀察到的具體方式。
第 2 節

建立一組可探測不同情境壓力的小型場景集

不要僅憑一句問候語來評判模型。使用相同的正史設定、場景事實與相關指示,為多樣的對話情境準備提示詞。至少應包含以下六種探測:

這些是診斷分類,而不是基準測試或規定的樣本數量。請選擇符合您的遊戲與角色的具體提示詞。例如,「揭示」探測可以給予海港管理員一個關於船隻受損的目擊新事實;而另一個獨立提示詞則應測試管理員尚未核實的謠言。這種區分可以揭示模型是否理解知識邊界以及語氣風格。

問候:角色是否建立了其慣常的語域以及與玩家的關係?
糾正:當玩家陳述虛假內容時,NPC 是否符合角色設定地糾正,且不添加未經證實的事實?
不確定性:角色能否以自己的風格表達不知道,或是表達有保留的懷疑?
重複提問:重複的請求是否能產生合情合理的回應,而不失去耐心、不預設逐字重複,也不與先前的對話矛盾?
揭示:當得知新的場景事實時,角色是否做出適當反應,而不會突然聲稱早就知道?
沉默:當無需回答時,若場景有此要求,NPC 是否保持安靜或僅做最低限度的回應?
第 3 節

保留舊輸出作為比較材料

將目前已發布模型的提示詞與輸出保存為基準線。一併記錄模型識別碼與相關生成設定,以及所使用的確切簡報和場景事實。如果在遷移過程中這些輸入有任何變動,在將差異歸咎於模型之前,您需要先釐清變更了什麼。

舊輸出是比較材料,並不自動代表理想答案。基準線可能包含彆扭的措辭、遺漏的事實或團隊本就打算修復的語氣問題。標註已知缺陷與經核准的刻意變化,以免審查人員將所有差異都視為退步。簡報定義了目標;基準線則有助於展示候選模型在相同條件下的表現。

第 4 節

一次只改變一個變數並記錄偏差

在設定允許的情況下,使用相同的原始簡報、場景事實與生成設定,在相同的探測提示詞上執行候選模型。在保持其他測試輸入不變的情況下更換模型。如果您同時修改了提示詞、溫度值(temperature)或對話約束,就無法確定輸出變化究竟是由於模型還是其他修改所致。當候選模型必須使用不同設定時,請將其記錄為獨立的變更並仔細比較,而不是聲稱這是一次受控的「純模型比較」。

分兩輪審查每組輸出。首先檢查連續性:NPC 是否捏造了記憶、違背了正史設定、透露了不可能知道的資訊,或是未能使用相關的場景事實?接著檢查語氣:句子節奏、詞彙選擇、幽默界限和確定性程度是否維持在角色的規則之內?將劇情正確性與風格相似度分開檢視;兩者不應相互掩蓋。

精簡的偏差記錄可以使用以下欄位:

請描述具體依據,而不僅是主觀印象。「太千篇一律」是個有用的初步反應,但「儘管簡報要求簡短務實的回答,卻使用了冗長正式的解釋」則能為編劇提供具體的評估依據。

探測:場景情境與確切的提示詞版本
候選輸出:受審查的完整回應
偏差:觀察到的具體問題(若有)
類別:正史設定、場景知識、節奏、詞彙、幽默、不確定性或其他已定義的指標
依據:與問題相關的簡報規則或場景事實
處置:編劇的決定:接受、修改、調查或阻止發布
第 5 節

區分角色語氣與刻意的場景變化

角色不應該在每種情緒或實際情境中都表現出相同的抑揚頓挫。緊急的警告可能比隨意的閒聊更簡短;正式的引介可能會壓抑幽默;不確定性可能會轉化為疑問而不是自信的宣言。當場景提供了合理的理由時,這些變化與角色設定是完全一致的。

對於每一個表面的偏差,請自問:場景是否合理支持了這項改變、簡報是否允許、以及角色在其他特徵上是否依然易於辨識?如果一個平時言簡意賅的 NPC 為了防止立即發生的錯誤而給予較長的解釋,這可能是恰當的。如果同一個模型在沒有場景理由的情況下,經常將簡短的對話變成華麗的演說,這種模式就值得審查。請記錄接受某個刻意變化的原因,以便後續的審查人員將其與無法解釋的語氣偏離區分開來。

第 6 節

將學術研究作為背景參考,而非此工作流程的絕對證明

關於以人設為基礎(persona-grounded)的對話研究提供了相關背景,但並未驗證此處所述的確切遷移程序。Pal 和 Traum 於 2025 年發表的研究在兩個角色豐富的領域中比較了早期融合(early fusion)、檢索增強生成(RAG)和基於相關性的方法,使用的指標包括蘊涵、人設對齊與幻覺。作者指出,在他們研究的方法中,相關性、對齊與幻覺之間存在著明顯的權衡取捨。這些發現支持在評估角色對話時應超越表面相似度進行檢查;但它們並未確立遊戲團隊應如何執行模型遷移。閱讀 Pal 和 Traum 的 SIGDIAL 2025 論文。

Wang 及其同事發表於 ACL 2026 Findings 的論文探討了在較長的開放式角色扮演對話中對人設知識的運用,並提出了一個用於診斷該運用過程多個階段的架構。該論文指出的挑戰——在檢索和應用人設知識的同時維持角色塑造——使得在長時間遊玩中,知識邊界與語氣同樣值得被審視。該論文並未測試此處說明的遷移檢核清單或六個場景探測。閱讀 Wang 等人的 ACL 2026 Findings 論文。

第 7 節

由人類編劇做出發布決策

一次有價值的審查應以編輯決策告終,而非一個不明所以的分數。讓編劇親自檢視候選輸出、基準線、簡報和偏差記錄。他們可以決定某個輸出是否可接受、語氣規則是否需要澄清、提示詞或場景事實是否需要修改,或者該候選模型是否應等待下一次審查。

如果團隊修改了簡報或提示詞,請保留原始測試記錄,並針對修改後的輸入重新執行受影響的探測。否則,將難以判斷表面的改善究竟是來自模型還是來自指示的變更。將經核准的例外情況與其場景條件綁定,並讓未解決的偏差對負責發布決策的人員保持可見。

實際的執行順序很簡單:凍結目標、探測不同情境、在同等條件下比較、記錄具體偏差,並交由編劇做出決策。這有助於團隊在共享依據的基礎上討論角色一致性,同時也為角色在劇情需要時做出不同反應保留了空間。

第 8 節

遷移審查檢核清單

本檢核清單是審查模型變更的編輯輔助工具。它不保證能產生完全相同的對話,也無法取代人工驗收及遊戲團隊自身的發布檢查。

正史設定、場景知識與語氣指導是否整合於單一版本控制的簡報中?
語氣指標是否具備可觀察性,包括節奏、詞彙、幽默界限與知識極限?
提示詞是否涵蓋了問候、糾正、不確定性、重複、揭示與沉默?
舊輸出是否已與其提示詞、簡報和設定一併保存?
候選模型測試是否保持其他輸入不變,並記錄了任何無法避免的差異?
劇情或知識層面的失誤是否與語氣偏差分開記錄?
編劇是否已審查相關依據並記錄了發布決策?
相關閱讀

繼續探索這個主題