如何在20分钟内观察AI游戏对话试玩测试
对于测试单个生成式对话场景的小型工作室,应重点观察玩家如何应对NPC的回答:他们是否尝试不同的提问、是否根据有效信息采取行动、能否从虚构的事实中恢复过来,以及是否退出对话去完成场景。简短的问卷可以记录玩家事后声称的感受或理解;但它本身无法展现每时每刻发生的选择与弯路。在游戏过程中使用简单的事件记录表,随后提出有针对性的跟进问题。将这些观察视为关于当前场景和版本的依据——而不是满意度的衡量标准,也不是所有玩家都会如此表现的证明。
在生成式对话场景中你应该观察什么?
选择一个具有明确目标、且NPC的回答可能改变玩家达成目标方式的场景。例如,在一个虚构的场景中,玩家必须在通风循环结束前打开一扇封闭的温室大门。一名维修NPC可以通过自由对话提供线索。预期的路线是在工具棚中找到一个蓝色阀门手柄,但NPC偶尔可能会捏造细节,例如声称手柄在被水淹没的泵房里。
以下四个指标侧重于玩家行为及场景产生的结果。它们不需要去评判某个问题是否聪明,也不需要判断玩家是否看起来乐在其中。
指标:**提问的多样性** —— 记录事件的时机:玩家在得到回答后改变了措辞、主题或切入角度——例如,先询问阀门在哪里,接着询问它是什么颜色,或者哪个房间是安全的。 —— 需要记录的事实依据:玩家问了什么、NPC回答了什么,以及下一个问题是否是由该回答引出的。将真正不同的探究与近乎重复的提问区分开来。 —— 事后询问:“你当时试图通过那些问题了解到什么?”
指标:**回答改变后续操作** —— 记录事件的时机:玩家移动、检查某物,或以某种顺应NPC回答的方式改变了计划。 —— 需要记录的事实依据:该回答、玩家的下一步操作,以及他们绕过的任何可见替代方案。将这种关联标记为明确、可能或不确定;回答之后的行动并不能证明就是该回答导致的。 —— 事后询问:“如果有的话,对话中的哪一部分影响了你的下一步行动?”
指标:**虚构事实导致误入歧途** —— 记录事件的时机:玩家听信了NPC某个未经证实或错误的断言,并因此采取了徒劳的行动。 —— 需要记录的事实依据:确切的断言、由此引发的行动、版本中可见的代价或绕路,以及玩家是如何发现或纠正错误的。在测试结束后核对场景设定的既定事实,然后再将某个断言归类为捏造。 —— 事后询问:“是什么让你觉得那条路线是正确的?你是在什么时候决定改变方向的?”
指标:**玩家能够终止对话并完成场景** —— 记录事件的时机:玩家退出、暂停或拒绝进一步对话,并且仍然能够继续推进并完成目标。 —— 需要记录的事实依据:退出选项是否显而易见、离开后发生了什么、是否仍有可能取得有效进展,以及玩家是否达到了场景的完成状态。将游戏阻碍与玩家自主选择继续交谈分开记录。 —— 事后询问:“你当时觉得可以随时离开对话吗?是什么让你选择继续或停下来?”
这些是事件定义,而非质量评分。记录玩家实际的话语和动作,而不是通过面部表情、沉默或游戏时长来推测其意图。如果某个事件没有发生,记录“本次测试未观察到”,而不是假定其失败。
让观察表与具体游戏版本保持绑定
在每次测试之前,记录游戏版本号、起始目标、已知的场景事实以及允许的完成状态。在游玩过程中,写下玩家的提问、NPC的回答、下一步可见的操作以及任何已提交的游戏状态变化。一句听起来很有帮助的话,如果指向了该版本中并不存在的位置,那它依然是错误的。
测试结束后,将疑似捏造的事实与实际的场景设定表进行比对。只有当场景事实与之矛盾时,才将未经证实的断言标记为已证实虚构;否则将其标记为未解决并展开调查。对主持人的提示或技术中断单独做笔记,因为这些都会改变玩家接下来的操作。这一小段事实证据链能让后续的讨论更加精确,而不会把单次试玩的结果当成普遍规律。
如何组织一场限定在20分钟内的测试
告诉参与者:“请像平时一样体验这个场景。你可以随时与角色交谈或离开对话。我可能会保持安静,以便观察你的尝试。”避免教导他们提出多样化的问题,或警告他们可能存在虚构事实;那样会改变原本想要观察的行为。如果他们寻求帮助,应保持一致的回应方式,记录下这次干预,并在考量后续行为时将该帮助因素考虑在内。
一个可行的流程安排是:
**第 0–2 分钟:准备。** 解释任务和操作方式,不要描述预期的解决方案。当玩家获得控制权时开始计时,并确保每位参与者都在相同的初始状态下开启场景。
**第 2–15 分钟:观察。** 让玩家自由探索和交谈。记录每一个相关回答及后续操作,尤其是当某个说法指引他们前往某处时。保持中立的提示,例如当玩家停下来需要提示才能继续时,询问“你在想什么?”;并记录下你进行了干预。
**第 15–20 分钟:结束与提问。** 如果玩家尚未完成,在游玩满15分钟时叫停并记录当前状态,切勿暗示他们未通过速度测试。提出与观察到的事件相关的跟进问题,然后问一个宏观问题:“关于对话或你的下一步,有什么不清楚的地方吗(如果有的话)?”将主观自述与观察到的行为分开记录。
20分钟的限制是本示例中一个切合实际的单场边界,而非经验基准。交谈时间更长的玩家并不代表满意度更高,快速完成的玩家也不一定理解或喜欢这个场景。如果任务在你的版本中需要更多时间,请在测试前调整流程时间表并保持一致。
将实际发生的事情与玩家的说辞区分开
在[《图灵测试》复盘](https://www.gamedeveloper.com/business/postmortem-building-i-the-turing-test-i-around-a-secret-mechanic)中,设计总监 David Jones 描述了与学生一起测试谜题的经历:收集趣味性和难度评分以及游戏时长,同时更加看重观察玩家的行为。他介绍了如何结合评分与观察来评估难度曲线。对于对话场景而言,有益的启示是将这两种证据放在一起但保持界限分明:事件日志展示了玩家做了什么;跟进提问记录了他们的解释或评分。两者都不能自动解释对方。
Klei 的[《忍者印记》复盘](https://www.gamedeveloper.com/design/classic-postmortem-klei-entertainment-s-i-mark-of-the-ninja-i-)描述了频繁利用新玩家进行测试以检验设计假设的做法。团队寻找抱怨背后的动机,观察新玩家在哪些地方感到吃力,进而调整提示与设计。应用到此处,玩家走弯路是一个值得调查的线索——而不是单纯增加 NPC 对话长度的理由。询问回答、界面或场景中的什么因素让该路线显得可信,并在决定做出修改之前核对录屏或版本状态。
育碧关于 [Teammates 的公告](https://staticctf.ubisoft.com/8aefmxkxpxwl/2QCAorjku7w7gH1LGORV3t/6e8f347be3ecab7daa4769e5300086bc/Ubisoft_Unveils_%C3%A2__Teammates%C3%A2____Its_First_Playable_Generative_AI_Experience_Through_Closed_Player_Testing.pdf)描述了一项针对可玩生成式AI体验的封闭玩家测试。该公告证实了团队宣布进行封闭测试;但引用的公告中并未提供已公开发布的玩家测试结果,因此它无法作为支撑“玩家做了什么”或“该体验是否成功”等观点的依据。
将观察结果转化为下一个版本的决策
测试结束后,回顾时间线并将每个NPC的回答与玩家的下一步行动联系起来。对于每一次明显的走弯路,核实相关的场景事实,然后找出可能的原因:NPC提供了错误细节、玩家误读了正确回答,或者是某个地点或交互提示引导他们走向了别处。在对照记录的序列以及(在有需要时)另一次测试进行验证之前,这些解释都只能算作假设。
利用这四个指标来确定具体的后续调整或测试方案。如果玩家提出了几个截然不同的问题,但得到的回答无法指导行动,请检查场景是否提供了可操作的信息。如果某个具体的捏造说法将他们引向了错误的房间,考虑场景是否需要一种验证说法或在不陷入死胡同的情况下恢复进度的方法。如果玩家无法离开对话并完成任务,请检查退出机制和目标流程。如果他们确实离开了并完成了场景,记录下该路径在此版本中是走得通的;但在得出其设计清晰的结论之前,先问问他们当时的理解是什么。
单次20分钟的测试可以暴露出某种特定的困惑或缺失的路线,但它无法确定该问题的普遍程度。在决定下一步要调查什么时,将观察者的事件记录、核实过的场景事实以及玩家的回溯性回答区分开来。这能为小型团队提供一份超越单一问卷的详实依据,弄清这名玩家是如何应对这个生成式对话场景的。
