加入几句生成的台词能让固定的游戏剧本变得更有趣吗?
可以——前提是生成内容带来局部变化的同时,仍由预设的叙事节点掌控后续发展。保持目标、转折点和结果固定不变;让少量的台词槽位在明确的限制内变化,例如角色的语气或他们注意到的细节。然后将该版本与使用相同场景和玩家选择的纯脚本版本进行对比。观察玩家是否认为台词新颖或回应灵敏,同时检查两个版本中是否存在更多关于角色、事件或游戏状态的困惑。
混合方法旨在改变什么
混合叙事将其主要事件置于作者的直接掌控之下,并仅在这些事件周围的特定台词中使用生成技术。例如,场景可能始终以店主打烊开始,呈现相同的玩家选择,并以相同的线索结束。生成的台词可能会改变店主评论天气或向玩家打招呼的方式,但它不应虚构新线索、改变选择,或暗示之前的事件有不同的发展。
这一界限至关重要,因为台词可以在不改变故事状态的情况下显得丰富多样。互动叙事研究将故事片断(storylets)描述为离散的叙事模块,其可用性取决于当前的游戏状态。另一个互动叙事系统将高层故事导向与自主角色行为相结合,并在玩家行动导致不一致时调整故事情节。这些例子支持了一个有用的设计原则:将预设事件和当前状态视为结构性约束,仅在不会与它们产生矛盾的地方允许变化。(Sketching a Map of the Storylets Design Space;Mixing Story and Simulation in Interactive Narrative)
选择重复感明显但风险较低的槽位
首先找出在多次到访或周目中重复出现且不承载核心信息的台词。问候语、对玩家先前行动的简短反应,或是一句烘托场景氛围的台词,都可以作为候选。揭示秘密、承诺、指令或关于物品归属的陈述则不适合作为首选槽位:改变其含义可能会破坏情节或玩家对世界观的理解。
对于每个槽位,在编写或生成变体之前先记下它的作用。记录发言者是谁、角色知晓什么、刚刚发生了什么、适宜的情感幅度,以及哪些事实必须保持不变。设定明确的长度限制,并定义禁止添加的内容,如新任务、新物品、新关系或过去的事件。当替换一句台词既不改变场景的可玩结果,也不影响玩家后续所需了解的事实时,该槽位才算受到了充分约束。
这是一项设计建议,并不意味着每句生成的台词都会让人感到耳目一新。有些玩家可能注意不到细微的变化;另一些人可能会发现,即使是一句构思良好的台词,也可能会破坏精心把控的场景节奏。测试应当确立这种变化是否契合这款特定游戏及其受众。
让纯脚本版本成为公平的对照
构建同一简短可玩片段的两个版本。在对照版本中,在每个候选槽位使用现有的预设台词。在混合版本中,保留相同的预设叙事节点,仅在这些槽位中替换为生成的台词。保持场景顺序、选择、奖励、角色外观和游玩说明完全一致。如果这些元素存在差异,就很难判断玩家是对台词的变化产生了反应,还是因其他变化所致。
在招募玩家之前确定你想了解的内容。一个切中要害的问题是:“受约束的台词是否让这个场景感觉更具互动性或更少重复,同时又不会削弱对发生事件的理解?”招募背景相近的玩家,并给予他们相同的任务。如果参与者同时体验两个版本,请考虑到初次游玩可能会让他们熟悉场景;如果由不同群体分别游玩各自版本,群体之间的差异可能会影响对比结果。无论选择哪种方案,都要记录其局限性。
游戏用户研究指南建议根据研究目标选择方法,并在需要时综合运用观察、问卷和访谈。观察可以展现玩家的行为,问卷能让评分更易于对比,而访谈有助于解释行为背后的原因,尽管每种方法都有其局限性。针对本次测试,应记录游戏行为,并在游玩后收集简短的评分或进行访谈,而不是仅仅依赖“好玩吗?”这样笼统的单一问题。(Choose the Right Playtest Method)
分别追踪创意变化和状态一致性
使用两份独立的评分表,以免生动的台词掩盖了连贯性问题。第一份评分表衡量变化是否易于察觉且富有成效。游玩结束后,询问玩家台词是否显得重复、角色的反应是否灵敏自然,以及是否有任何台词令人印象深刻。要求他们指出具体时刻,而不仅仅是给出一个数字评分。在游玩过程中,注意玩家是否暂停、重读或评论某句台词,但不要假设受到关注就必然意味着喜欢。
第二份评分表检查一致性。将每句生成的台词与一份简短的状态事实清单进行对比:角色身份与认知、所处位置、之前的行动、当前目标以及场景先前确立的事实。记录矛盾之处、缺乏依据的新主张,以及玩家显得不确定发生了什么的时刻。同时让玩家总结场景的关键事件和下一个目标;不一致可能意味着理解出现了偏差,尽管小规模的试玩本身无法完全证明其发生的原因。
状态追踪值得单独关注。一项将《龙与地下城》视为对话任务的研究,将生成下一个回合与根据对话历史预测游戏状态视为相关但截然不同的挑战。其数据集包含了部分状态标注,作者对生成的对话和状态预测都进行了评估。该研究虽然不能证明某种特定的混合设计一定有效,但它强调了为何应将叙事变化和状态准确性分开衡量。(Dungeons and Dragons as a Dialog Challenge for Artificial Intelligence)
将结果视为设计决策的依据,而非对生成的最终定论
在相同指标上对比这两个版本。玩家是否注意到了台词的变化?他们是否认为某个具体的反应更贴切或更少重复?他们对场景事实和目标的理解是否一致?混合版本是否引入了任何连续性错误?有价值的结果可能是喜忧参半的:玩家可能喜欢多样的问候语,却觉得生成的交代性台词更难理解。这表明应该保留问候语槽位,并移除或缩窄交代性台词槽位。
结合玩家的评论和状态检查记录,审视他们实际看到的台词。平均数据可能会掩盖某处严重的矛盾,而令人印象深刻的个例可能会夸大罕见事件的影响。如果某句台词违背了既定事实,应在解读趣味性结果之前将其视为必须修复的缺陷。如果玩家没有注意到变化,在将生成技术推广至整个剧本之前,应检查该槽位是否过于简短或过于微妙。
一项针对角色扮演游戏的研究对比了静态、改写、混合和全生成台词,记录了 64 名参与者的行为日志并进行了游玩后问卷调查。其报告的结果表明,生成式自主性的程度可以影响互动和沉浸感,但这些结论仅适用于该游戏和该项研究。它们并不能直接套用到其他作品上。对于小规模设计实验而言,实用的经验是在预期的游玩语境中直接对比不同的台词处理方式。(Quest of Aivengarde: Comparative Study of Player Experience Across LLM Dialogue Systems)
仅扩充通过两项检查的槽位
如果混合版本生成的台词能被玩家察觉并获得认可,同时又能保持相同的场景理解和状态事实,可以再尝试第二批风险较低的小型槽位。保持固定的叙事节点不变,并重新进行对比。如果某个槽位几乎没有增加可感知的变化,或者反复引起困惑,就将其还原为预设台词,或者收紧其约束范围。
几句精心挑选的生成台词可以让重复的时刻感觉不再千篇一律,但它们能否让游戏变得更加有趣,对玩家而言是一个需要通过实践检验的问题。保留故事的核心事件,仅对具有明确局部意图的台词引入变化,并通过受控的试玩测试来权衡创意收益与连续性成本。
