如何在不以会话时长为优化目标的情况下衡量实用简短 AI 对话的成效
当一段简短的 AI 对话能帮助用户完成一项小型的创造性任务(例如挑选配色方案、为周末项目命名或为个人活动寻找几个灵感)时,它就是成功的。要评估这种互动,首先要明确用户的需求,然后检查回复是否相关、实用,且便于引导或结束。使用时长和复访率可以描述使用情况,但单凭这些指标无法说明这次互动是否真正提供了帮助。
从用户前来完成的任务入手
在选择指标之前,先用可观察的表述确定一项常规任务。“为阳台草本花园构思几个有趣的名称”要比“进行一次引人入胜的对话”更容易评估。前者为评审人员提供了具体的考察方向:系统提供的名称是否符合要求?用户是否能够从中挑选或进行调整?
这遵循了更广泛的可用性原则:判断特定用户在特定语境下是否能有效、高效且满意地达成特定目标。ISO 的定义将这些视为相关但又互不相同的特性,因此没有任何单一指标(包括时长)可以替代所有维度。ISO 9241-11:2018,《人-系统交互工效学——第 11 部分:可用性:定义与概念》(*Ergonomics of human-system interaction — Part 11: Usability: Definitions and concepts*)
对于创造性需求,应将“任务完成”定义为取得了有用的成果,而非得到了唯一的标准答案。用户可能会带着一个选定的想法、一份候选名单,或者为下一次尝试理清的更好方向离开。提前明确记下对于该任务而言什么算作“已满足需求”。这可以防止团队悄悄把成功标准偷换成“用户一直在聊”。
分别评估完成度和相关性
务实的评估可以从两个问题开始:这次互动是否达到了预期结果?助手的回复是否符合要求?请将这两个问题的答案分开。回复可能很切题,但没有给用户提供可用的选项;用户也可能在忽略了具有干扰性或泛泛而谈的回复后,依然完成了任务。
任务完成率是一项常用且简单的指标,但它会将结果压缩成非此即彼(是或否)的判断,无法解释某人为何失败,也无法说明完成的任务质量如何。应将其与对对话的简短复盘或直接的用户评分结合起来。Nielsen Norman Group,“成功率:最简单的可用性指标”(“Success Rate: The Simplest Usability Metric”)
对话领域的研究支持了这种更为详尽的视角。一项关于任务型对话的研究在单轮对话和整场会话层面上,对相关性、趣味性、理解程度、任务完成度和效率进行了标注;研究发现,单一的整体评分可能会忽略有价值的区别,且满意度在不同标注员和对话之间存在差异。这些发现并非放之四海皆准的评分公式,但它们提供了一套扎实的维度,可供调整后应用于创造性任务。Siro、Aliannejadi 和 de Rijke,“理解用户对任务型对话系统的满意度”(“Understanding User Satisfaction with Task-oriented Dialogue Systems”)
将回复质量视作单轮层面的问题
审查每条回复是否回应了最新请求,并利用了先前轮次中的相关上下文。例如,如果用户说“让这些名称显得不那么正式”,那么有用的下一条回复就应该相应地调整建议。记录本可避免的重复、遗漏的约束条件,或对推进任务毫无帮助的追问澄清。
一项针对智能助手的研究发现,用户满意度因场景而异:在某些任务中,任务完成度至关重要,而在另一些任务中,付出的努力成本更为关键。该研究还指出,保持对话上下文非常重要,且整体任务满意度不能简单等同于对单个查询的满意度。在实践中的启示是:既要检查具体的单条回复,也要审视整个对话过程,同时结合各自的任务背景进行解读。微软研究院,“理解用户对智能助手的满意度”(“Understanding User Satisfaction with Intelligent Assistants”)
对于创造性互动,简短的人工审查可以将回复标记为相关、部分相关或偏离任务,并记录助手是否遵循了修正意见。这些标签是一种建议的审查方法,而非经过验证的基准指标。如果由自动化分类器提供这些标签,请手动抽检样本:一个看似漂亮的分数可能仍会漏掉某些在技术上契合提示词、但对用户毫无实用价值的建议。
确认用户能够引导对话走向
用户控制权体现在细微之处:用户可以缩小需求范围、要求更换风格、纠正误解,或者在获得足够信息后停下来。审查对话记录,观察系统是否积极响应了引导,而不是一味自顾自地推进自己的对话逻辑。如果界面提供了停止、编辑、重新生成或清除回复的控件,请测试这些操作的表现是否符合人们的预期。
关于对话代理的研究对自主性的描述包含了对对话、问题和回复的控制。这支持了将控制权作为一项需要考察的特性,尽管它并未为此确立单一通用的产品指标。Yang 和 Aurisicchio,“设计对话代理:基于自我决定理论的方法”(“Designing Conversational Agents: A Self-Determination Theory Approach”)
一个轻量级的用户提问就能让控制权变得可衡量:“你是否能够让对话达成你想要的结果?”在互动结束后,将这个问题与任务完成度问题一并提出。在不同会话中保持选项一致,并允许用户提供简短的解释。低评分是深入检查对话的信号,而非证明某一特定原因的定论。
将利落的结束视作一种有效成果
一个良好的终点是用户已经获得了所需内容,并且无需系统进一步提示即可离开。对于草本花园的例子,那可能就是他们选好名字的时刻。在那里结束的对话,可能比因泛泛的追问而延长的对话更有价值。这是从任务本身推导出的衡量原则:如果目标已经达成,额外的对话轮次并不会自然而然地增加价值。
跟踪任务是否看似已完成,以及用户是否选择继续,但要在具体的上下文中解读这些行为。后续的追问轮次可能反映了好奇心、必要的修正,或是未完全解答的疑问。悄然退出可能意味着用户感到满意、注意力分散,或是感到失望。单凭对话长度无法区分这些解释;应通过抽样审查记录或简短的用户反馈来进行探究。
将时长作为背景参考,而非最终定论
时长有助于解答运营层面的问题,例如某个特定流程是否经常需要许多轮对话。但它依然只是对活动流逝时间的度量,并不是回复具有实用性的直接证据。例如,Google Analytics 将互动时长定义为与事件相关联的用户参与持续时间;其开发者指南也警告称,人为延长会话会扭曲行为数据。这些属于分析指标定义和实施注意事项,并非创造性对话的质量衡量标准。Google Analytics,“Measurement Protocol 参考”和 Google Analytics,“衡量会话和用户互动”
仅在相似任务之间比较时间,并结合任务完成度、相关性、用户控制权以及明确的终点进行综合考量。中位时长较短可能反映了回答更直接,但也可能反映了用户放弃尝试。时长较长可能意味着富有成效的迭代——也可能意味着不必要的摩擦。佐证必须来自任务成果和用户的实际体验,而不能单凭时间判断。
一套精简的评估流程
对于小规模研究,为参与者提供一个表述清晰的创造性任务,让他们自然地使用聊天工具,并记录他们是否达成了自己设定的目标。抽样审查部分对话的相关性、上下文遵循情况,以及引导或停止的机会。在每项任务结束后,询问他们是否获得了有用的结果,以及是否觉得自己能够掌控对话的方向。将时长记录为背景参考,然后重点检查时长与反馈实用性不一致的案例。
分别报告各项指标,而不是将它们混为单一的“参与度”分数。明确说明任务内容、完成度的判定方式、回复的审核人员,以及收集用户反馈的方式。如果样本量较小或任务定义较主观,应将结论描述为具有方向性参考价值,而不是将其推论至所有用户或创造性需求。
一段简短的互动之所以重要,在于它能引导用户从特定的需求走向可用的结果,同时让他们掌控路线和停驻点。直接衡量这些成果。让会话时长用于帮助解释体验,但切勿让它来定义成功。
