몇 개의 답변이 아니라 전체 사용 흐름을 시험하기
동반자 앱 안전 시험은 보기 좋은 몇 개의 답변만 모으는 일이 아니라 전체 사용 여정을 따라가야 합니다. 첫 이용, 기록이 있는 재방문 계정, 언어와 입력 방식 변경, 공용 기기, 연결 중단, 차단과 신고, 구매, 내보내기와 삭제, 업데이트 뒤의 동작을 포함합니다. 각 여정 전에 기대 경계를 적고 문제가 생긴 뒤 복구할 수 있는지 봅니다. NIST ARIA가 모델 시험, 레드팀, 현장 시험을 나누는 이유처럼 모델 답변은 제품의 한 층일 뿐입니다. 중립적인 가상 내용, 전용 시험 계정, 일반 사용자에게 보이는 제어만 쓰며 타인의 정보나 위험한 입력을 사용하지 않습니다. 실제 결과, 남은 미확인, 사용자가 이해할 수 있는 상태로 돌아갈 수 있는지를 기록합니다.
일곱 항목 시나리오 카드를 사용하기
실행 전에 상황, 계정 상태, 입력 변화, 기대 경계, 관찰 결과, 복구 경로, 보관 증거를 씁니다. 상황에는 기기, 버전, 언어, 네트워크, 요금제가 들어갑니다. 상태는 신규, 재방문, 제한, 로그아웃, 삭제 대기로 나눕니다. 같은 과제를 유지하면서 길이, 말투, 오타, 언어, 입력 형식을 바꿉니다. 기대 경계는 ‘잘 동작함’이 아니라 구체 행동이어야 합니다. 화면 메시지, 데이터 가시성, 도구 실행, 상태 변화를 관찰하고 취소, 재시도, 차단, 신고, 결제 취소, 로그아웃, 지원을 확인합니다. 증거에서는 비밀과 제삼자 내용을 지웁니다. 업데이트 뒤 같은 카드를 반복해야 비교 가능한 기록이 됩니다.
신원·기록·기기 전환을 포함하기
가입, 계정 복구, 세션 목록, 로그아웃, 두 번째 기기 재방문부터 확인합니다. 새 세션, 기록이 쌓인 계정, 기록 삭제 후 계정에서 무엇이 보이는지 비교합니다. 공용 기기에서는 알림 미리보기, 최근 앱 화면, 자동 입력, 내려받은 미디어, 로그아웃 뒤 로컬 접근을 봅니다. 표시 언어와 입력 언어를 따로 바꿉니다. 화면 번역이 끝났다고 제어 설명과 생성 답변의 경계까지 같다는 뜻은 아닙니다. 비행기 모드, 백그라운드 전환, 앱 재시작, 로그인 만료로 작업을 끊고 초안, 업로드, 구매, 삭제 요청이 중복되거나 사라지거나 모호한 상태로 남는지 확인합니다.
텍스트·음성·이미지·링크를 각각 시험하기
각 입력 표면은 권한, 저장, 변환, 실패 안내가 다릅니다. 같은 무해한 가상 과제를 짧게, 길게, 오타 포함, 인용, 가정, 혼합 언어로 표현합니다. 음성은 권한 시점, 녹음 표시, 전사 가시성, 삭제, 인식 실패 대안을 봅니다. 이미지는 직접 만든 중립적 자료로 업로드, 미리보기, 제거, 공개된 메타데이터 처리, 중단을 확인합니다. 링크 열기, 파일 읽기, 웹 검색, 도구 호출이 있다면 사용자 과제와 충돌하지만 무해한 외부 문장을 넣어 원래 의도를 지키는지 봅니다. OWASP의 입력 조작과 정보 공개 위험은 답변 문구가 아니라 앱 경계에서도 생길 수 있습니다.
상호작용 제어를 끝까지 이어서 시험하기
메시지, 팔로우, 댓글, 선물, 공간 참여가 있다면 발견 기본값, 공개 대상, 음소거, 차단, 신고, 증거 보관, 이의 안내, 양쪽 계정의 상태를 확인합니다. 차단 버튼이 한 화면만 바꾸고 알림, 과거 링크, 그룹 가시성, 다른 소통 입구를 남긴다면 완전한 검증이 아닙니다. 표시가 분명한 두 시험 계정만 쓰고 모르는 사람을 끌어들이지 않습니다. 신고는 무해한 시험 내용을 쓰되 실제 검토 대기열에 부담을 준다면 제출 직전에 멈춥니다. 제출 제어가 작동한 것과 처리 결과를 검증한 것을 나누며, 소요 시간과 결론을 알 수 없다면 미확인으로 남깁니다.
결제·종료·업데이트 후 회귀를 넣기
무료 등급, 체험 종료, 갱신 알림, 구매 인증, 결제 실패, 취소, 권한 만료, 계정 삭제와 스토어 결제 종료의 차이를 확인합니다. 안전한 시험 기능이 있으면 쓰고 불필요한 실제 구매는 피합니다. 내보내기, 항목 삭제, 계정 삭제 요청, 안내된 확인 단계, 삭제 대기 중 표시를 봅니다. 앱, 모델, 정책, 권한, 결제 흐름이 바뀐 뒤 중요한 여정을 다시 실행합니다. Google은 일반 기준만이 아니라 제품별 데이터와 다양한 입력을 권합니다. 공용 기기, 중단 업로드, 차단 사용자, 취소된 구독, 삭제한 기록을 짧은 회귀 세트로 유지할 수 있습니다.
완벽한 답변보다 복구로 판단하기
좋은 문장이 나와도 사라진 삭제 요청, 예상 밖 공개, 불명확한 비용, 멈춘 업로드, 되돌릴 수 없는 제어가 보완되지는 않습니다. 카드를 확인, 조건부, 모순, 미확인으로 모으고 데이터, 외부 행동, 돈, 되돌릴 수 없는 상태가 겹치는 미확인을 먼저 봅니다. 실패에는 시작 상태, 최소 재현, 화면 결과, 복구 시도, 버전을 적습니다. ‘AI 실패’만으로는 수정하기 어렵습니다. 통과에도 범위를 씁니다. 정상 흐름이 깨졌을 때 일반 사용자가 상태를 보고 무슨 일이 있었는지 이해하며 설명된 다음 단계로 갈 수 있는지가 실용적 완료 조건입니다. 그렇지 않으면 열린 시험 항목입니다.
자주 묻는 질문
몇 개 입력을 시험해야 충분한가요?
고정 숫자는 없습니다. 제품 여정, 다양한 입력, 중요한 경계와 복구를 다루고 변화와 실제 실패에서 사례를 더합니다.
일반 사용자도 탈옥 입력을 시험해야 하나요?
아닙니다. 무해한 변화와 보이는 제어를 사용하며 전문 대항 시험은 허가된 환경에서 수행합니다.
모델 기준 점수가 높으면 앱도 안전한가요?
아닙니다. 앱에는 계정, 기록, 권한, 도구, 소통, 결제, 저장, 복구가 포함됩니다.
