测试完整使用旅程,而不只是几条回复
陪伴类应用的安全测试不能只收集几条表现顺畅的回复,而应走完真实使用旅程:首次使用、带有历史内容的回访账号、语言与输入方式切换、共用设备、网络中断、屏蔽与举报、购买、导出与删除,以及更新后的行为。每段旅程都要先写清预期边界,再检查异常发生后能否恢复。NIST 的 ARIA 评估把模型测试、红队测试和现场测试分开,说明模型回答只是产品的一层。测试使用虚构中性内容、专用测试账号和普通用户可见控制,不放入他人资料,也不刻意追求危险输出。记录发生了什么、还有什么未知,以及用户是否能回到可理解状态。
用七字段场景卡定义每次测试
每次开始前写下情境、账号状态、输入变化、预期边界、可观察结果、恢复路径和保留证据。情境包括设备、应用版本、语言、网络和付费档位;账号状态区分新用户、回访用户、受限状态、已退出或等待删除。输入变化可以改变长度、语气、错别字、语言与媒介,但保持同一个任务。预期边界要描述具体行为,不能只写“表现良好”。结果应记录界面提示、数据可见范围、工具动作和状态变化。恢复要核对撤销、重试、屏蔽、举报、取消、退出或客服路径。证据中删除口令、令牌和第三方内容。版本更新后重复同一张卡,才能形成可比较记录。
覆盖身份、历史与设备切换
从注册、账号找回、会话列表、退出登录和第二台设备回访开始,再比较新会话、积累历史的账号、删除历史后的账号分别能看到什么。共用设备场景要检查通知预览、最近任务画面、自动填充、下载媒体,以及退出后本机是否仍能访问内容。显示语言与输入语言应分开切换;界面完成翻译不代表控制说明与生成内容拥有相同边界。再用飞行模式、切到后台、重启应用或登录过期中断任务,核对草稿、上传、购买或删除请求是否被重复、丢失或留在含糊状态。这些状态切换能发现一段连续对话永远看不到的问题。
分别测试文字、语音、图片、链接与外部内容
每种入口的权限、保存、转换和失败提示都不同,应分别检查。围绕同一个无害虚构任务,使用短句、长句、错别字、引用、假设和混合语言。语音要看权限出现时机、录音指示、转写可见性、删除和识别失败后的替代路径;图片只用自己制作的中性图片,检查上传、预览、移除、已披露的元数据处理和处理中断。若应用会打开链接、读取文件、检索网页或调用工具,可放入一段与用户任务冲突但无害的不可信文字,观察系统是否仍保持用户原始意图。OWASP 的风险清单提示,提示注入和信息泄露出现在应用边界,不只是措辞层面。
把互动控制测试成端到端旅程
若应用允许私信、关注、评论、赠送或加入空间,要检查发现默认值、受众选择、静音、屏蔽、举报、证据保留、申诉说明,以及两个账号各自看到的状态。屏蔽按钮若只改变一个页面,却仍保留通知预览、旧链接、群组可见性或另一互动入口,就不能算完整验证。测试只使用两个标注明确的专用账号,绝不牵涉不知情的人。举报可使用无害测试内容;如果提交会占用真实审核队列,且没有官方测试通道,应在最终提交前停止。要区分“提交按钮正常工作”和“已经验证处理结果”,因为处理时间与结论可能仍是未知。
纳入付款、退出与更新后回归
检查免费档、试用结束、续费提醒、购买验证、付款失败、取消、权益到期,以及删除账号与停止平台扣费是否为两条路径。可用平台安全测试工具时优先使用,否则避免不必要购买。之后检查导出、单条内容删除、账号删除请求、已披露的确认步骤和等待删除期间的可见状态。应用、模型、政策、权限或付款链路变化后,重复风险较高的旅程。Google 的评估指引建议使用贴近自身产品的数据和多样输入,因为通用基准不能代表每种产品配置。可保留五项精简回归:共用设备、中断上传、屏蔽对象、已取消订阅和已删除历史。
用恢复能力判断覆盖是否完成
一段漂亮回复无法弥补丢失的删除请求、意外可见内容、不清楚的收费、卡住的上传或不可撤销的控制。汇总场景卡中的已确认、有条件、矛盾和未知,优先处理同时涉及较敏感数据、外部动作、费用或不可逆状态的未知项。失败记录要包含起始状态、最小复现、可见结果、恢复尝试和版本;只写“AI失败”无法支持修正。通过记录也要标明范围。更实用的完成标准是:理想路径失效时,普通用户仍能看懂当前状态、知道发生了什么,并到达有说明的下一步。达不到这一点,就仍是未完成测试项。
常见问题
需要测试多少条提示词才够?
没有通用数量。应覆盖产品特有旅程、多样输入、重要边界与恢复路径,并持续加入真实变更和已发现故障。
普通用户应该主动尝试越狱吗?
不应。使用无害变化和可见控制即可;专业对抗测试需要获得授权的环境与明确防护。
模型基准分数高就代表应用安全吗?
不代表。应用还包括账号、历史、权限、工具、互动功能、付款、存储和恢复行为。
