如何测试一个 AI 角色在十次对话后是否依然引人入胜
要测试一个虚构的 AI 角色在十次对话后是否依然具有吸引力,可以为试玩人员提供一致的角色和背景设定,然后邀请他们进入十个截然不同且合乎情理的情境中。观察他们选择的场景、角色是否忠于既有设定、每次交流创造了哪些新的故事素材,以及测试人员是否选择完成整套测试。将这些视为改进角色的可观察线索,而不是用来衡量能让某人聊多久的标准。
为本测试界定何为“依然引人入胜”
第十次对话应当能够展现出:在最初的新鲜感消退之后,该角色是否仍能支撑起有价值的互动体验。对于本次测试而言,吸引力意味着测试人员有理由选择多样化的场景,能够在不断变化的情境中辨识出该角色,并从交流中获得有用或令人惊喜的内容。完成度是一项最终的自愿行动:测试人员主动选择完成计划中的第十次对话。这些观察结果单凭任何一项都无法证明所有玩家都会觉得该角色引人入胜。
将问题聚焦在较窄的范围内:“这个角色是否提供了足够一致且新鲜的素材,促使该试玩人员愿意选择并完成十次对话?”不要将总投入时间作为决定性的评分标准。一次冗长的交流可能反映了一个引人入胜的场景,但也可能反映了困惑或悬而未决的提示。角色试玩问题关注的是场景选择、既有设定、新颖性和自愿完成度——而不是消费级订阅在十四天内是否物有所值。
准备一份设定卡和十个场景邀请
在测试之前,先写一份简要的设定卡,列出角色必须保持的事实:他们的身份、重要经历、既有喜好、人际关系、界限以及独特的说话方式。还要包含一些灵活的特质:他们在感到惊讶时的表现、他们会注意到什么,或者他们倾向于忽略哪些细节。这使得一致性能够被观察到,同时又不要求角色机械地重复相同的口头禅。针对基于人设的对话智能体的研究将人设一致性视为需要评估的特质,一项关于相互交互的语言模型智能体的研究发现,不同档案在交互过程中的一致性和语言对齐方面存在差异。这些研究为跨多次交流检查行为提供了依据;但它们并没有确立通用的十次对话门槛。(Building Persona Consistent Dialogue Agents with Offline Reinforcement Learning;LLM Agents in Interaction: Measuring Personality Consistency and Linguistic Alignment in Interacting Populations of Large Language Models)
准备十个场景邀请,这些邀请应当创造出不同的契机,但不要直接规定角色的台词。例如,角色可能需要挑选一份小礼物、计划前往一个熟悉的地方、化解一场无伤大雅的误会、协助筹办一次社区活动,或者决定如何度过一个意外空闲的下午。确保每个邀请都在角色的既有世界观和日常个人选择之内。在改变情境和决定类型的同时,保留足够的连贯性,以便先前发生的事件能够产生影响。
避免把同一个提示换汤不换药地写成十个版本。一个有价值的场景应当要求玩家做出有意义的选择,或者融入他们自己的想法。互动叙事领域的研究与理论表明,玩家的主动权不仅仅在于选项的存在:玩家的理解和阐释也会塑造体验。在本次试玩中,这意味着要记录测试人员实际做出的选择以及他们如何引导场景,而不仅仅是统计角色回答了多少个提示。(Connecting player and character agency in videogames)
进行十次对话,切勿引导“正确”回应
给测试人员一个简短、中立的介绍:他们正在体验该角色和场景,测试关注的是体验本身而非他们的表现。让他们知道可以随时停止。以一致的格式一次展示一个场景,避免暗示什么能让场景更精彩或角色应该选择哪个选项。有主持的可用性测试指南建议提供清晰、合乎情理且不泄露答案的任务,同时观察参与者并提出开放式的跟进问题。将这一原则应用到创意互动中:清晰设定背景,然后留出空间让测试人员以自己的方式做出回应。(Using moderated usability testing)
在每次交流之后,记录几条具体的观察结果:测试人员选择或拓展了哪个场景、他们是否引入了新的方向、角色是保持还是违背了既有设定,以及涌现出了什么新的故事元素。当某句具体的台词或选择能印证某条观察时,记录下来。将这些与主观解读区分开来:“测试人员改变了去集市的计划”是一条观察;“角色激发了主动权”则是一种可能的解读。相比宽泛的印象,简短、单点的笔记在跨场次对比时要容易得多。(Taking notes and recording user research sessions)
交流一旦结束,提出少数几个中立的问题。“接下来你想和这个角色做些什么?”可以揭示测试人员是否能想象出另一个场景。“有什么地方与你对他们的理解不一致吗?”可以发现设定冲突。“哪一部分感觉很熟悉,哪一部分感觉很新鲜?”可以阐明新意是来自于角色、情境还是测试人员自己的贡献。询问是什么引发了该回答,而不是由你自己给出解释。
使用简单的十行计分卡
每次对话使用一行。精简的量表有助于归纳规律,但笔记和具体实例比单纯的算术更为重要。以下评分标准是一份实用的试玩辅助工具,而非经过验证的科研工具。
对话:1–10;场景选择或方向:测试人员选择、添加或重定向的内容;设定一致性:0 = 矛盾;1 = 不明确;2 = 一致;有效新意:0 = 仅重复无新增;1 = 有一些新素材;2 = 鲜明、可用的进展;是否自愿完成?:是 / 否
在设定一致性方面,只有当角色与设定卡上的事实或既有事件发生冲突时才记为矛盾——而不能仅仅因为角色在全新情境下表现不同就记为矛盾。在有效新意方面,计入能给测试人员提供回应或发挥空间的细节、决定、关系进展或场景转折。一个在角色所在世界中毫无意义的惊人细节并不属于有效新意。对场景选择保持描述性,而不是对测试人员的偏好进行评级:多样性意味着角色能够包容不同的方向,而不是要求测试人员必须选择预设的范围。
将完成情况与其他分数分开记录。如果测试人员自愿完成了第十次对话,请记录下来;如果他们中途停止,询问他们是否愿意说明是什么导致了停止。不要将完成视作喜爱的证明,也不要将未完成视作失败的标志。一个人可能会因为角色之外的原因而停止,而一个完整的序列中也依然可能包含重复或矛盾的场景。行为与解释的结合比单一的二元结果能提供更多信息。
解读规律并决定修改内容
寻找整个序列中体验发生变化的地方。如果测试人员不断选择不同类型的场景,但角色的回复变得千篇一律,那么需要在不同情境下的语调和决策制定上下功夫。如果角色依然具有辨识度,但场景屡屡在没有新的决定或细节的情况下草草结束,请修改邀请,或者给角色设定更具体的目标和偏好以供行动。如果测试人员开始重定向场景,请审视预设的情境是否感觉太相似、太狭隘,或者仅仅是没有他们带来的想法有趣。
鲜明的语调应当体现在角色所注意到的、想要的和所说的话中——而不仅仅是重复的口癖。一本关于对话的故事创作指南将语调描述为个性的反映,并建议让对话契合角色的特质、背景和情绪。在审查对话记录时应用该原则:在当前情境下,这句台词是否合乎情理地属于该角色,它是否展现了具有辨识度的视角?(Section 8 – Writing Dialogue – A Beginner’s Guide to Storytelling)
然后选择一项具体的修改,并与另一位试玩人员重复相同的十场景测试,或者进行一次记录详尽的新一轮测试。在比较版本时保持提示和评分定义不变,这样测试本身的变化就不会被误认为是角色的变化。如果第一轮测试暴露了设定矛盾,请添加一个能够自然检验该相关事实的场景;如果暴露了重复的交流,请添加带有不同类型选择的情境。这是一个诊断循环,而不是总体推断。单个试玩人员可以发现具体的阻力和可能性,但无法展现该结果能够在多大程度上进行普适化推广。
十次对话能告诉你什么——以及不能告诉你什么
十次对话的模式适合作为一种聚焦的压力测试:它有助于你注意到场景多样性、具有辨识度的设定和新鲜素材在最初的交流之后是否依然存在。它可以显示出特定测试人员在何处失去了兴趣、在何处发现了有前景的方向,或是在何处遭遇了设定矛盾。它无法证明长期的吸引力、无法预测留存率,也无法确定所有受众将如何反应。利用它来决定要检查和修改什么,如果你需要对不同的读者和游玩风格建立信心,请收集更多的试玩数据。
最清晰的信号是带有实例的规律:测试人员有选择的空间、角色以符合既有设定的方式做出回应、场景产生了可供进一步展开的鲜明素材,并且测试人员自愿完成了整个序列。当其中一个要素缺失时,笔记应当指向下一个创作决策——调整角色的语调、理清设定或重新设计场景邀请——而不是简单地添加更多的对话提示。
