Metlivi 博客

当 AI 模型变更时,游戏编剧应如何保持角色语调的一致性?

将游戏生成的 NPC 对话迁移到新的 AI 模型时,请将该变更视为一次编辑回归审查。固化一份将设定、场景事实和语调规则明确区分的源简介;针对相同的多样化提示词运行两个模型;将它们的输出相互对比并对照简介核对;然后由编剧决定需要修改的内容以及候选版本是否已准备好上线。这能让角色风格的偏离变得清晰可见,同时避免将每一个特定场景的合理变化误判为语调失真。

2026年9月27日9 分钟阅读阅读、艺术与文化作者:Metlivi Editorial Team
第 1 节

固化角色已知的信息及其说话方式

在测试之前,请为角色和所测场景创建一份带版本控制的源简介。明确区分三类信息:

这种区分至关重要,因为生成的回答可能会在编造知识的同时听起来十分自然,或者在保留事实的同时听起来完全不像同一个人。迁移审查应该捕获这两种失误,并记录具体发生了哪一类。

让语调规则具备可测试性,而不是依赖“诙谐”或“戒备心强”等宽泛的标签。详细描述句子节奏(简短干脆的回答还是冗长曲折的表述)、词汇选择(正式、朴素还是专业)、幽默界限(他们拿什么开玩笑,避讳什么)以及知识局限(他们知道什么、怀疑什么或不可能知道什么)。如果已获批准的简短示例有助于阐明规则,可以适当添加,但绝不能让示例取代规则本身。

例如,作为说明,一个港口管理员可能会用简短实用的话语交流,仅在必要时使用航海术语,打趣熟人的迟到行为,但绝不拿延误的轮渡开玩笑。这些都是可供审查的明确线索。而“性格泼辣”则不是。

设定(Canon):关于角色和世界的固定事实,例如其姓名、身份、过往经历以及人际关系。
场景事实(Scene facts):此处发生了什么、有谁在场、角色目睹了什么,以及他们此时被允许知道什么。
语调规则(Voice rules):角色表达自我时反复出现且可观察到的具体方式。
第 2 节

构建一组探查不同压力情境的小型场景集

不要仅凭一句问候就对模型下定论。使用相同的设定、场景事实和相关指令,针对各种对话情境准备提示词。至少应包含以下六类探查:

这些是诊断性类别,并非基准测试或规定好的样本量。请选择契合你的游戏和角色的具体提示词。例如,在“揭示”探查中,可以给港口管理员一个关于船只受损的新目击事实;而另一个独立的提示词则应测试管理员尚未证实的传言。这一区分有助于揭示模型是否在把握语调的同时理解知识边界。

问候(Greeting):角色是否建立了其惯常的语域以及与玩家的关系?
纠错(Correction):当玩家陈述虚假内容时,NPC 是否能在符合人设的前提下进行纠正,且不添加未经证实的事实?
不确定性(Uncertainty):角色能否以自己的风格表达不知道,或表达有节制的怀疑?
重复提问(Repeated question):面对重复的请求,是否能在不失耐心的前提下给出合理解释,避免默认逐字重复或与先前的对话相矛盾?
揭示(Revelation):当得知新的场景事实时,角色是否反应得当,而不是突然声称自己早就知晓?
沉默(Silence):当不需要回应时,如果场景需要,NPC 是否能保持安静或给出最低限度的回应?
第 3 节

保留旧模型的输出作为对照材料

保存当前已上线模型的提示词和输出作为基线。在其旁边记录模型标识符及相关的生成设置,以及所使用的确切简介和场景事实。如果在迁移过程中这些输入项有任何更改,在将差异归咎于模型之前,你需要明确究竟改动了什么。

旧的输出只是对照材料,并不天然等同于理想答案。基线可能包含蹩脚的措辞、遗漏的事实或团队本就打算修复的语调问题。标出已知的缺陷和经过批准的刻意变化,这样审查人员就不会把每一次改动都视为质量回退。简介定义了目标;而基线有助于展示候选模型在相同条件下的表现。

第 4 节

每次只改变一个变量并记录偏差

在环境允许的情况下,使用相同的源简介、场景事实和生成设置,在相同的探查提示词上运行候选模型。在保持其他测试输入不变的前提下更换模型。如果你同时修改了提示词、采样温度(temperature)或对话约束,你将无法确定输出的改变是源于模型还是源于其他调整。当候选模型必须采用不同设置时,请将其作为单独的变更进行记录并仔细对比,而不要声称这是一次受到严格控制的纯模型对比。

分两轮审查每组对比输出。首先检查连续性:NPC 是否捏造了记忆、违背了设定、泄露了不可能知晓的信息,或未能利用相关的场景事实?然后检查语调:句式节奏、词汇选择、幽默界限以及确定性程度是否保持在角色的规则之内?将剧情的正确性与风格的相似度分开;二者不应相互掩盖。

一份精简的偏差日志可以包含以下字段:

描述具体依据,而非仅凭印象。“太大众化”是一个有参考价值的初步反应,但“尽管简介规则要求简短实用的回答,却使用了冗长正式的解释”才能给编剧提供切实可供评估的依据。

探查(Probe):场景情境和确切的提示词版本
候选模型输出(Candidate output):待审查的完整回复
偏差(Deviation):观察到的具体问题(如有)
类别(Category):设定、场景认知、节奏、词汇、幽默、不确定性或其他已定义的特征线索
依据(Evidence):与该问题相关的简介规则或场景事实
处理意见(Disposition):编剧的裁定:接受、修改、调查或阻止发布
第 5 节

将角色语调与刻意的场景变化区分开来

角色不应在每种情绪或实际情境下都保持相同的说话腔调。紧急警告可能比闲聊更短促;正式介绍可能会抑制幽默;心存疑虑可能会引出一个疑问而非自信满满的陈述。当场景为这些变化提供了合理的理由时,它们依然与角色人设保持一致。

对于每一个表面上的偏差,请追问:场景是否证明了这种变化的合理性?简介是否允许?在其他线索上角色是否依然具有辨识度?如果一个平时寡言少语的 NPC 为了防止当场出错而给出了较长的解释,这可能是恰当的。如果同一个模型在没有场景理由的情况下,频繁将简短对话变成辞藻华丽的长篇大论,这种模式就值得审查。记录接受某种刻意变化的理由,以便后续审查人员能够将其与无法解释的人设偏离区分开来。

第 6 节

将学术研究作为背景参考,而非该工作流的证明

关于基于人设的对话(persona-grounded dialogue)的研究提供了相关背景,但这并不代表此具体迁移流程得到了学术验证。Pal 和 Traum 于 2025 年开展的研究比较了在两个具有丰富角色的领域中,早期融合(early fusion)、检索增强生成(retrieval-augmented generation)和基于相关性的方法,所采用的评估维度包括蕴涵性(entailment)、人设一致性(persona alignment)和幻觉(hallucination)。作者指出,在他们研究的各种方法中,相关性、一致性与幻觉之间存在明显的权衡取舍。这些发现支持了在评估角色对话时不仅要看表面相似度;但它们并未规定游戏团队应如何进行模型迁移。阅读 Pal 和 Traum 的 SIGDIAL 2025 论文。

Wang 等人的 ACL 2026 Findings 论文探讨了在更长、开放式角色扮演对话中对人设知识的运用,并提出了一个用于诊断该运用过程若干阶段的框架。论文指出的核心挑战——在检索和应用人设知识的同时维持角色塑造——使得在长时间游戏中,知识边界与语调同样值得检查。该论文并未测试此处所述的迁移核对清单或六项场景探查。阅读 Wang 等人的 ACL 2026 Findings 论文。

第 7 节

由人类编剧做出发布决策

一次有价值的审查应以编辑决策告终,而非一个语焉不详的评分。安排一名编剧检查候选模型的输出、基线、简介和偏差日志。他们可以决定输出是否可接受、语调规则是否需要澄清、提示词或场景事实是否需要修改,或者候选模型是否应等待另一次审查。

如果团队修改了简介或提示词,请保留原始测试记录,并针对修改后的输入重新运行受影响的探查。否则,将很难分清表面的改善是源于模型本身还是指令的变动。将已接受的特例与其场景条件绑定在一起,并让未解决的偏差对负责发布决策的人员保持可见。

实际的执行流程很简单:固化目标、探查不同情境、在同等条件下对比、记录具体偏差,并交由编剧做出裁定。这有助于团队基于共同的证据讨论角色一致性,同时允许角色在剧情需要时做出不同的反应。

第 8 节

迁移审查核对清单

本核对清单是用于审查模型变更的编辑辅助工具。它不保证对话完全一致,也无法替代人工验收和游戏团队自身的发布检查流程。

设定、场景知识和语调指引是否整合在一份带版本控制的简介中?
语调线索是否具备可观察性,包括节奏、词汇、幽默界限和知识局限?
提示词是否涵盖了问候、纠错、不确定性、重复提问、揭示和沉默?
旧的输出是否已连同其提示词、简介和设置一同保存?
候选测试是否保持了其他输入不变,且记录了所有不可避免的差异?
剧情或认知错误是否与语调偏差分开记录?
编剧是否已审查证据并记录了发布决策?
相关阅读

继续探索这个主题