Metlivi 博客

AI 模拟读者能——以及不能——告诉你关于写作的哪些事

如果你正在修改某个页面、指南或操作说明,语言模型可以帮助你发现可能会让读者困惑的措辞。它可以指出表意不明的短语、描述某种潜在的误解,或者检查初稿是否回答了所提出的问题。但是,模拟出来的反应并不能证明你的目标读者确实理解了文本、具备正确的背景认知,或者完成了文本所指导的任务。要做到这一点,需要观察几位来自目标受众的真实用户尝试完成该任务,并让他们说明自己的理解。

2026年9月30日6 分钟阅读阅读、艺术与文化作者:Metlivi Editorial Team
第 1 节

模型能对初稿进行哪些有价值的推敲

模型可以审视你提供给它的文字和结构。你可以让它指出可能生僻的术语、看似遗漏的步骤、存在多种合理理解的指示,或者初稿中尚未解答的问题。你还可以让它说明是文本中的哪些依据引出了这些观察。这作为初步的编辑审查非常有用:它能为你提供需要进一步调研的候选问题,而不是关于真实读者的最终结论。

要让任务保持具体。例如,针对一个解释如何选择一日游的页面,可以让模型指出读者对比选项时需要哪些细节,以及这些细节出现在何处。让它给出具体的段落和可能产生的误解,然后对照你的写作目的和文本来检查每条建议。模型给出的流畅回答并不能证明任何真人都会以这种方式阅读该段落。

设定角色(Persona)的提示词可能会增加一些有用的结构,但诸如“匆忙的初次访客”这样的描述并不会让模型真正变成那个访客。关于角色提示词的研究发现,其效果取决于角色变量是否与人类标注中的模式相符;在许多主观数据集中,这些变量对差异的解释力微乎其微。应将基于角色的反应视为假设,而非受众意见的代表性样本。Hu 和 Collier,“Quantifying the Persona Effect in LLM Simulations”

第 2 节

模拟反应无法证实什么

模型的回复无法证实某位特定读者究竟注意到了什么、推断出了什么、记住了什么或做了什么。它接收文本和提示词,然后生成答案。而真实读者在接触材料时,带有他们自己的知识储备、目标、干扰因素、心理预期和实际处境。这些因素决定了一个句子是否讲得通,以及此人是否能够据此采取行动。

当问题涉及具体行为时,这种差异最为关键:读者能否找到正确的信息?他们对指导的理解是否符合初衷?他们能否在没有提示的情况下完成任务?模型可以对这些问题进行推理,但它所描述的“自己会怎么做”依然只是生成的文本。它并没有真正独立浏览过该页面,也没有证明你受众中的一员确实能使用它。

针对模型模拟的研究也提醒我们,不要把生动或多样化的回复当成高保真度的证据。一项 2025 年关于问卷调查响应模拟的研究发现,所测试的方法很难准确复现用户的真实反应;模型在人口统计特征变化时往往仍固守某些观点,并且难以适应不同画像之间的细微差异。该研究虽然并未直接测试每一种写作批评或可用性任务,但它支持了一个实用的界限:听起来合情合理的模拟读者,并不能证明真实受众也会做出同样的反应。Yu 等人,“An Analysis of Large Language Models for Simulating User Responses in Surveys”

第 3 节

小型真实读者测试能揭示什么

小规模的定性测试能够显示出真实参与者在何处迟疑、忽略了什么、如何理解某个短语,以及他们是否达到了预期的最终目标。你可以给每个人布置一个贴近现实的任务,让他们使用初稿或页面,并观察发生的情况。随后的追问可以弄清他们认为某个词是什么意思,或者他们为何选择某个特定步骤。这把可观察到的行为与参与者自己的解释结合在了一起。

对于内容任务,应在测试前定义成功的标准。例如,如果文本是一篇一日游指南,你可能会要求参与者选择一个符合特定偏好的选项,并解释是什么信息促成了该选择。注意观察他们是否找到了相关细节,哪些词语或段落拖慢了他们的进度,以及他们的解释是否符合指南意图传达的区别。这个例子是一个建议的测试设计,并非针对任何特定指南或结果的定论。

政府关于定性可用性测试的指南建议招募潜在用户、为他们分配任务、避免过度指导,并在事后回顾任务完成情况和常见错误。尼尔森诺曼集团(Nielsen Norman Group)同样将可用性研究描述为一种调查内容是否易于查找和理解、或者人们能否完成任务的方法。两者都强调观察参与者的实际操作;而这正是模拟反应所无法提供的证据。GOV.UK,“Usability testing: qualitative studies”,尼尔森诺曼集团,“Checklist for Planning Usability Studies”

第 4 节

如何开展一次有效的小型测试

从文本旨在支持的某项决定或任务入手。招募在相关方面(特别是在该主题的经验上)与目标受众相似的人员。然后编写一个场景,给他们一个使用该材料的理由,但不要告诉他们答案在哪里,也不要告诉他们要寻找哪些词。如果任务直接复述了页面上的某个标签,可能会无意中变成字面匹配测试,而无法检验内容是否帮助人们达成了目标;NN/G 建议编写具体的任务,避免提供会产生行为诱导的线索。

在测试过程中,让参与者在最少的指导下进行操作。记录他们的行为、停顿的地方、用他们自己的话所表达的内容,以及他们是否完成了任务。如果他们寻求帮助,记下他们在哪一步需要帮助。之后,让他们描述自己理解了什么以及接下来会怎么做。GOV.UK 指南建议定性可用性测试采用五到六名参与者;NN/G 通常建议传统定性研究采用五名。这些都是发现问题的实用切入点,而不是能让结论代表整个人口特征的样本量。如果你需要具有普适性的百分比或对比,则需要采用更大样本量和受控指标的定量设计。GOV.UK,“Usability testing: qualitative studies”,NN/G,“Quantitative vs. Qualitative Usability Testing”

第 5 节

将观察转化为修改方案,而非宽泛的结论

经过几次测试后,寻找反复出现的障碍和后果严重的个别失误。如果几位参与者都误解了同一个短语,那就是非常明确的修改候选点。如果某个人无法完成任务,请检查当时的环境条件,并思考该失误对于目标受众是否重要;不要把单次测试的结果当成普遍概率。小型定性研究旨在发现问题并指导改进,而不是估算更大范围内会有多少人遇到这些问题。NN/G 指出,定性发现取决于参与者样本和研究者的解读,而数值化的可用性结论则需要适当规模的定量研究。

修改文本后,尽可能换一批新读者来测试修改后的版本。模型可以帮助你探索备选表述,或在各轮测试之间标记出新的歧义。在你的笔记中要明确区分证据的类型:“模型预测这可能会令人困惑”是展开调查的诱因;“两名参与者对这步操作有不同理解,且有一人未达到最终目标”则是测试中的观察结果。仅凭两者中的任何一个都不能证明每位读者都会有相同的体验,但后者切实反映了你在所观察的任务中实际发生的情况。

第 6 节

实用的分工方式

利用模型来针对初稿提出疑问。利用真实读者来回答关于实际理解度和任务执行情况的问题。当任务依赖于特定的受众、环境或先验经验时,应针对这些条件进行招募,而不是让模型去虚构它们。当你需要可靠的概率或对比时,应设计定量研究,而不是将寥寥数个定性测试强行拔高为统计结论。

这种分工既能让模拟审查加快修改进度,又不会将看似合理的反应误认为是读者能够成功理解的证据。决定性的问题不在于模型是否能模仿出令人信服的读者口吻,而在于目标读者能否理解这些材料,并完成文本旨在协助他们完成的事情。

相关阅读

继续探索这个主题