超越听起来像人:AI 聊天设计的四个更佳目标
对于构建 AI 聊天交互的设计师而言,“让它感觉真实”过于模糊,无法指导有用的决策。更好的任务是帮助用户获得清晰的答案、探索想法、理解系统已经执行的操作,并选择接下来的步骤。对拟人化线索的研究表明,类人信号可能会改变人们对 AI 信息准确性的认知。这使得清晰度、创造性探索、可靠的任务状态以及用户控制权,成为比模仿人类身份更有用的设计目标。
为什么 AI 聊天应将目标定在超越类人表象?
一段对话可以听起来很流畅,却无法让用户对系统产生可靠的认知。在一项涉及 2,165 名参与者的实验中,研究人员改变了伪语言模型是仅使用文本还是结合语音与文本,以及它称呼自己为“我”还是“系统”。语音加文本提高了参与者对拟人化和信息准确性的评分;在一种情境下,第一人称措辞提高了准确性评分并降低了感知风险。这些发现虽然特定于该研究设置,但它们表明,使系统看起来更像人的线索也会影响对其信息的判断。Google Research,《Believing Anthropomorphism: Examining the Role of Anthropomorphic Cues on User Trust in Large Language Models》
这就是为什么拟人化线索和交互质量值得进行独立审查的原因。拟人化线索审查会探寻界面暗示了 AI 的何种身份或人类特质。判断风险审查则探寻某种线索是否可能导致用户高估其输出的准确性或可靠性。以下的设计目标针对的是一个不同的问题:用户在交流过程中应该能够理解、执行和决定什么?只要不掩盖系统的能力或任务状态,温和的语调完全可以与这些目标共存。
微软的人机 AI 体验工具包(Human-AI eXperience Toolkit)围绕 AI 系统在初次使用时、交互过程中、出错时以及随着时间推移的表现来组织指导原则。这种结构对聊天设计非常有用,因为它将注意力从角色的个性转移到了使用系统的人不断变化的需求上。Microsoft,《Guidelines for Human-AI Interaction》
让清晰度成为对话中显而易见的特性
清晰度始于用户的任务,而不是极其逼真的对话语调。询问三个周末活动建议的人需要可以进行对比的选项;要求重写文本的人需要可以修改的草稿。界面应让请求的操作与返回的结果易于区分。如果 AI 正在提供建议、总结或转换材料,请清晰地标注该贡献,并保留足够的上下文供用户进行判断。
一次有用的交互还可以在关键节点展示 AI 能做什么和不能做什么。例如,如果聊天助手可以建议计划但无法进行预订,回复就不应使该操作模棱两可。说明哪些已就绪,哪些仍需要用户操作,以及哪些细节仍不确定。这是根据 HAX 对整个交互过程中适度行为的强调所推导出的设计建议,而非声称某种用词模式适用于所有产品。
一个简单的清晰度检查是在简短交流后询问某人:你让系统做什么?它实际做了什么?在使用结果之前,你需要核对或决定什么?如果答案偏离了界面的预期含义,请在添加更多个性之前修改用词、结构或下一步提示。
运用趣味性支持探索
趣味性为人们提供了一种探索工具及其可能性的方式。在一项针对 372 篇有关 ChatGPT 的用户生成帖子的研究中,研究人员识别出了包括开玩笑、挑战系统和测试其边界在内的趣味性互动。作者将这些交互描述为人们探索 AI 能力和能动性的一种方式,同时指出该样本反映的是 ChatGPT 使用早期的帖子。Nikghalb 与 Cheng,《Interrogating AI: Characterizing Emergent Playful Interactions with ChatGPT》
对于设计师而言,实际的启示并不是将每个助手都变成喜剧演员。而是要让低成本的尝试变得简单:提供尝试不同角度、比较备选方案或在不丢失早期版本的情况下修改草稿的方法。诸如“给我三个意想不到的主题”这样简短的创意提示可以在保持用户目标明确的同时激发探索。趣味性应该是一种可用的模式,而不是用户必须忍受的表演。
关于趣味性人机协作创作工具的研究将趣味性与创造力区分开来,同时将玩乐描述为创造性反应的潜在促进因素。它将界面、AI 行为和对话探讨为设计契机,同时将趣味性视为一种需要支持的体验,而不是一种可以保证的结果。Liapis 等人,《Designing for Playfulness in Human-AI Authoring Tools》
在多轮对话中保持任务状态清晰易懂
聊天界面可以感觉很自然,但仍然会遗失工作进度。任务状态包括用户当前的目标、已做出的决定、仍待选择的选项以及下一步。当交流变成多个步骤时,紧凑的概括可以展示系统当前的理解:“您还剩两个选项;您更倾向于短途步行;我尚未选择地点。”这让用户有机会在对话继续之前修正记录。
交互模式应契合任务的复杂性。Ding 与 Chan 关于人机文本协同创作的论文区分了固定范围的内容组织、独立的创作任务以及复杂的相互依赖型创作任务。它将这些任务映射到不同的交互模式,从有限的干预到迭代式协作。有用的设计推论是:单轮回答可能适合范围明确的总结,而不断发展的创作任务则受益于能够呈现选择并让用户参与塑造结果的多轮交互。Ding 与 Chan,《Mapping the Design Space of Interactions in Human-AI Text Co-creation Tasks》
要进行实用的状态检查,可以在整个对话中跟踪一个代表性任务。在每一轮中,询问用户是否能分辨已完成的内容、仍未解决的问题,以及如何纠正错误的假设。如果答案依赖于记住前几轮的对话内容,请添加简明扼要的概括或可见的决策列表。如果系统无法可靠地保留某个细节,请明确这一局限性,而不是暗示它具备并不存在的连贯性。
赋予用户有意义的控制权
控制权意味着为用户提供一种可用的方式来引导或修正交互。在聊天中,这可以像让用户在选项之间进行选择、编辑生成的草稿、更改限制条件或要求系统停下来进行总结一样简单。当这些控制项影响到用户关心的决定时,它们最有价值;如果一组调整选项无法改变任何实质内容,那只会增加复杂性而没有带来实际的自主权。
一项涉及在群组讨论中使用对话代理的实验比较了多种设定对其识别贡献较少参与者能力预期的方法。它测试了有关准确性的信息、对检测方法和数据的解释,以及一个调整控制项。在那项特定研究中,解释有助于用户理解算法,并且总体上最有效;仅仅提供一个调整控制项反而导致了更负面的感知讨论体验。这一结果告诫我们,不要仅仅因为一个控制项存在就认为它有用:解释它改变了什么,并使后果易于理解。Do 等人,《Inform, Explain, or Control: Techniques to Adjust End-User Performance Expectations for a Conversational Agent Facilitating Group Chat Discussions》
一个实用的设计顺序是:展示当前的理解,提供少数有意义的下一步操作,并使纠错变得容易。例如,在生成出游计划后,系统可能会询问是缩短路线、更换活动还是保留草稿。每个选项都指明了具体的更改。该示例仅作说明之用;它描述的是通用的交互模式,而非任何特定产品的功能。
将目标转化为审查清单
在评估聊天设计时,从头到尾审查一个常规任务。检查第一轮交互是否明确了系统的角色;用户能否区分建议与已完成的操作;探索性的交互是否在不强加嬉闹人设的情况下鼓励尝试;以及对话是否准确展示了各项决定和未决步骤。然后检查用户是否能够纠正系统,并理解每个可用控制项的效果。
最后,审查语言和表现形式,看是否存在可能暗示人类身份或特殊可靠性的线索。考量第一人称陈述、语音、情绪化语言或类人头像是否会影响用户对回答的判断。这种审查是对测试交互是否易于理解和实用的一种补充,而非替代。衡量聊天设计的更高标准是用户能否在清楚了解 AI 的贡献和下一步选择的情况下推进自己的任务——而不是该交流是否能伪装成与真人的对话。
