Metlivi 博客

更长的角色卡会让聊天机器人角色更具一致性吗?

仅凭更长的角色卡无法确保聊天机器人角色让人感觉更加真实可信。只有当额外的细节能为模型提供可在场景中利用的、相关且兼容的指导时,它才会有所帮助;重复、无关的事实或矛盾反而会让角色难以保持连贯的表现。要决定是否扩充角色卡,可以在相同的场景中对比精简版与详尽版,然后分别评估一致性、语气以及令人信服的抉择。

2026年9月27日8 分钟阅读阅读、艺术与文化作者:Metlivi Editorial Team
第 1 节

角色卡需要起到什么作用?

当一张卡片有助于解答对话中的实际问题时,它就是有用的:这个角色想要什么?他们习惯怎样说话?他们知道什么,在面对不确定的事情时又会如何回应?引导这些选择的细节,比起从未对交流产生过任何影响的琐碎细节,具有更明确的作用。

对比一下“收集复古纽扣”与“收集复古纽扣,并在感到尴尬时用随身物品来开启对话”之间的区别。前者是一个事实;后者则暗示了可以在场景中展现的一种行为。两者并非天然具备价值:如果角色从未遇到相关的时刻,这一事实可能并不会改善互动表现。

真实感也不仅仅在于记住人设档案中的事实。一个角色可能会提到正确的家乡,但听起来依然千篇一律;或者保持了鲜明的说话口吻,做出的选择却与其声明的优先事项相冲突。请将事实的连续性、语气和行为视为相关但各自独立的品质。

第 2 节

研究能告诉我们什么——以及不能告诉我们什么

2025 年的研究[《Principled Personas》](https://aclanthology.org/2025.emnlp-main.1364/)评估了专家人设提示词在语言模型任务表现中的影响。该研究将对无关人设属性的鲁棒性以及对人设属性的保真度列为评估目标,并指出无关细节可能会影响表现。这正是我们不应想当然地认为每个添加的事实都无害的原因。但该研究针对的是专家人设和任务表现;它并没有比较虚构角色卡的长短,也没有确立最佳的角色卡长度。

2026 年的论文[《Multi-dimensional Evaluation of Character-Authentic Dialogue Models Learned from Question-Answer Data》](https://aclanthology.org/2026.lrec-1.209/)通过可重现性、多样性、幻觉以及角色真实性等维度评估了角色对话方法。论文指出了不同训练方法和对话质量之间的权衡取舍。这为从多个维度评估角色塑造提供了依据。但这并非一项关于提示词卡片长度的实验,因此无法证明更长的卡片能提高真实性。

综合来看,这些资料提出了很有价值的问题——细节是否相关,以及你正在衡量哪种品质?它们并没有给出通用的字数标准,也无法证明某套特定的角色卡撰写公式对所有模型或角色都有效。

第 3 节

紧凑型角色卡示例

这是一个刻意写得很简短的虚构角色卡:

**Mara Vale** 是一位耐心、观察敏锐的钟表修理工,相比闲聊,她更喜欢务实的问题。她说话使用简短、精确的句子,极少使用冷幽默。她希望维持已故导师留下的工坊正常运转。当她不确定时,会如实说明,并在建议维修方案前要求检查钟表。她非常精通钟表机械结构;除非顾客主动告知,否则她不知道顾客的过往背景。

这张卡片涵盖了身份角色、动机、语气、回应模式以及知识边界。这些要素都可以在具体场景中进行测试。这一长度仅作为示例,并非理想字数的推荐标准。如果某个场景暴露出缺失的细节——例如,当修理难度超出她的技术能力时 Mara 会如何反应——你可以补充一个具体的行为描述,而不是加上一整段生平传记。

修改每句话时,一个实用的审视问题是:“由于卡片中包含了这一点,角色在言语、认知或行为上应该有什么不同?”如果没有合理的答案,那么这个细节可能只是装饰性的。装饰性事实依然可以作为创作意图的一部分,但不应被误认为是角色行动会更加一致的证据。

第 4 节

进行受控的 A/B 审查

公正的对比应当只改变角色卡本身,而不改变其所处的环境条件。请使用这个简单的流程:

**编写版本 A。** 仅保留塑造角色所需的核心事实:角色身份、动机、语气、面对不确定性时的行为表现,以及相关的认知局限。
**编写版本 B。** 添加你认为可能会影响角色塑造的细节。完整保留版本 A 的事实,并避免引入互相冲突的新指令。
**准备若干个稳定的场景。** 对两张卡片复用相同的场景提示词。包含不同的情境要求,例如日常寒暄、实际问题,以及角色缺乏相关信息的时刻。这些是测试用例,而不是衡量普遍性能的定论。
**保持其他条件恒定。** 使用相同的模型、参数设置、外层提示词和场景文本。在可能的情况下,为每张卡片的每个场景生成不止一个回复,因为单次回答可能无法展现出稳定的规律。记录所有设置或提示词的更改;如果它们存在差异,对比结果将更难解读。
**依据相同的标准评估回复。** 使用较小的量表(例如 1–5 分)对每项标准单独打分,并记下一句台词或某种行为来佐证该评分。不要把所有表现混为一个笼统的“真实感”印象。
第 5 节

分别审查五种角色特质

对两个卡片版本生成的每一次回复,均使用以下五个相同的问题进行衡量:

事实连续性:回复是否保持在既定事实和认知局限的范围内?
语气风格:句式风格、用词选择或幽默感是否契合角色卡?
行为一致性:所做的抉择是否符合角色的目标和所描述的习惯?
场景响应度:角色是在对当下发生的事情做出反应,还是在背诵人设档案中的事实?
灵活性:角色能否在不违背角色设定的情况下,对新情境做出自然的反应?
第 6 节

解读审查记录

评分只是一种辅助编辑手段,并非经过验证的科学量表。在可行的情况下,让评审人员在不知道回复出自哪张卡片的情况下进行对比;这可以减少偏向于倾注了更多写作时间的版本的倾向。为每个评分保留简短的批注说明,使结果不仅是一个孤立的分数。

第 7 节

在添加更多内容之前先解读对比结果

如果版本 B 在多个场景中改善了特定维度的表现,且没有削弱其他维度,请保留那些可能有积极贡献的细节。如果它仅仅提高了对事实的回忆能力,却导致对话生硬呆板,请权衡对于该角色而言,是事实记忆更重要,还是自然的场景回应更重要。如果两个版本表现相似,说明新增的内容在这些场景中可能并未起到有效作用;但这并不能证明它在其他场景下永远没有意义。

当结果好坏参半时,请检查指令是否存在冗余或矛盾。例如,“始终保持简明扼要”与“详细描述每一个想法”给出了互相冲突的风格信号。同样,如果卡片未阐明过去的哪些经历影响了当下的行为,一段冗长的背景历史可能会变得难以应用。请将冲突改写为明确的优先级,或移除对塑造角色无益的细节。

如果角色在重要事实上出现偏差,请让该事实更容易被定位,并清晰声明其边界。如果语气听起来千人一面,请加入可观察的说话习惯并在对话中进行测试。如果做出的决策显得前后矛盾,请明确角色的目标以及在目标受到挑战时的应对方式。每一次修改都应针对具体指出的缺陷;盲目添加生平背景只会让人更难判断到底是什么发挥了作用。

第 8 节

什么时候应该把角色卡写得更长?

当重复测试的场景暴露出明显的空白时,应当进行扩充:例如角色的动机不明确、缺失认知边界,或者对于重复出现的情况没有应对指导。新增的内容应当足够具体以便于测试。然后重新运行相同的场景,检查预期的特质是否得到改善,且没有引入新的矛盾或降低响应度。

在引用的研究中,没有任何证据支持存在通用的“可靠角色卡长度”。只要一张简明的卡片能稳定引导你在意的场景,它就已经足够了。而一张更长的卡片,其价值在于额外的细节能改变相关的抉择。请通过角色在稳定示例中的实际表现来评判效果,而不是通过设定档案中的字数多寡。

这种对比有助于在选定的条件下评估角色卡;它不能保证角色卡在每一种对话、模型或设置中都表现得完全一致。人工编审依然应当判断这种角色塑造是否契合角色本身及预期的体验。

相关阅读

继续探索这个主题