열 번의 대화 후에도 AI 캐릭터가 여전히 매력적인지 테스트하는 방법
열 번의 대화 후에도 가상의 AI 캐릭터가 여전히 매력을 유지하는지 테스트하려면, 플레이테스터에게 일관된 캐릭터와 배경 설정을 제공한 뒤 신뢰할 수 있는 10가지 서로 다른 상황으로 초대해 보세요. 테스터가 선택하는 장면, 캐릭터가 기존 설정(캐넌)을 충실히 지키는지 여부, 각 대화가 어떤 새로운 이야기 소재를 만들어내는지, 그리고 테스터가 10개의 세트를 끝까지 완료하기로 선택하는지 추적해 보세요. 이를 단순히 대화를 얼마나 오래 지속할 수 있는지를 측정하는 지표가 아니라, 캐릭터를 개선하기 위한 관찰 가능한 단서로 활용하세요.
이번 테스트에서 “여전히 매력적임”이 의미하는 바를 정의하기
열 번째 대화는 초반의 신선함이 사라진 후에도 캐릭터가 가치 있는 플레이를 지속해서 뒷받침할 수 있는지 보여주어야 합니다. 이 테스트에서 매력이란 테스터가 다양한 장면을 선택할 이유를 찾고, 변화하는 환경 속에서도 캐릭터를 알아볼 수 있으며, 대화를 통해 유용하거나 놀라운 무언가를 얻는 것을 의미합니다. 완료는 최종적인 자발적 행동입니다. 즉, 테스터가 계획된 열 번째 대화를 마치기로 스스로 선택하는 것입니다. 이러한 관찰 결과 중 어느 하나만으로 모든 플레이어가 이 캐릭터를 매력적이라고 느낄 것임을 증명할 수는 없습니다.
질문의 범위를 좁히세요: “이 캐릭터가 플레이테스터로 하여금 10개의 대화를 선택하고 완료하게 만들 만큼 일관되고 신선한 소재를 충분히 제공하는가?” 총 소요 시간을 결정적인 점수로 사용하지 마세요. 대화가 길어졌다는 것은 몰입도 높은 장면을 반영할 수도 있지만, 혼란이나 명확하지 않은 프롬프트를 반영하는 것일 수도 있습니다. 캐릭터 플레이테스트 질문은 장면 선택, 설정 유지, 참신함, 그리고 자발적 완료에 관한 것이지, 14일 동안의 소비자 구독료가 그만한 가치가 있는지를 따지는 것이 아닙니다.
캐넌 카드와 10개의 장면 초대장 준비하기
테스트 전에 캐릭터가 반드시 지켜야 할 사실들을 담은 간단한 캐넌 카드를 작성하세요: 캐릭터의 역할, 중요한 과거사, 확립된 선호도, 관계, 한계선, 그리고 독특한 말투 등이 포함됩니다. 놀랐을 때 어떻게 행동하는지, 무엇을 주로 눈여겨보는지, 어떤 종류의 세부 사항을 놓치기 쉬운지와 같은 유연한 특성도 몇 가지 포함하세요. 이렇게 하면 캐릭터가 똑같은 유행어나 말버릇을 반복하도록 강요하지 않고도 일관성을 관찰할 수 있습니다. 페르소나 기반 대화 에이전트에 관한 연구에서는 페르소나 일관성을 평가해야 할 핵심 품질로 다루며, 상호작용하는 언어 모델 에이전트를 대상으로 한 연구에서는 프로필에 따라 상호작용 중 일관성과 언어적 일치도가 달라진다는 점을 발견했습니다. 이러한 연구들은 여러 차례의 대화에 걸친 행동 점검의 필요성을 뒷받침하지만, 열 번의 대화라는 보편적인 기준치를 제시하는 것은 아닙니다. (Building Persona Consistent Dialogue Agents with Offline Reinforcement Learning; LLM Agents in Interaction: Measuring Personality Consistency and Linguistic Alignment in Interacting Populations of Large Language Models)
캐릭터의 대사를 정해두지 않으면서 다양한 기회를 만들어내는 10개의 장면 초대장을 준비하세요. 예를 들어, 캐릭터는 작은 선물을 골라야 하거나, 익숙한 장소로의 방문을 계획하거나, 사소한 오해를 풀거나, 지역 행사의 준비를 돕거나, 갑자기 생긴 여유로운 오후에 무엇을 할지 결정해야 할 수 있습니다. 각 초대장은 캐릭터의 확립된 세계관과 일상적인 개인적 선택 범위 내에 있도록 유지하세요. 이전 사건들이 영향을 미칠 수 있을 만큼의 연속성을 유지하면서 상황과 결정의 종류를 다양화하세요.
겉모습만 살짝 바꾼 동일한 프롬프트를 10개 작성하는 것은 피하세요. 유용한 장면이란 플레이어가 의미 있는 선택을 내리거나 자신만의 아이디어를 가져오도록 유도하는 장면입니다. 인터랙티브 서사에 관한 연구 및 이론에서는 플레이어의 주도성(agency)을 단순한 선택지의 존재 이상으로 다룹니다. 즉, 플레이어의 이해와 해석 또한 경험을 형성한다는 것입니다. 이 플레이테스트에서는 캐릭터가 몇 개의 프롬프트에 답변했는지를 단순히 세는 것이 아니라, 테스터가 실제로 무엇을 선택하고 장면을 어떻게 이끌어가는지를 기록해야 함을 시사합니다. (Connecting player and character agency in videogames)
“정답” 반응을 유도하지 않고 열 번의 대화 진행하기
테스터에게 짧고 중립적인 안내를 제공하세요: 그들은 캐릭터와 장면을 체험해 보는 것이며, 이 테스트는 테스터의 수행 능력이 아닌 경험에 관한 것임을 알려주세요. 언제든지 중단할 수 있다는 점도 안내하세요. 일관된 형식으로 한 번에 한 장면씩 제시하고, 무엇이 장면을 흥미진진하게 만들 것인지나 캐릭터가 어떤 선택을 내려야 하는지 등을 넌지시 제시하지 마세요. 모더레이터가 진행하는 사용성 평가 지침에서는 정답을 드러내지 않는 명확하고 신뢰할 수 있는 과제를 제시하고, 참가자를 관찰하며 개방형 후속 질문을 던질 것을 권장합니다. 이러한 원칙을 창작 놀이에 맞게 적용해 보세요. 설정을 명확히 한 다음 테스터가 자신만의 방식으로 반응할 수 있도록 여지를 남겨두는 것입니다. (Using moderated usability testing)
각 대화가 끝난 후 구체적인 관찰 사항 몇 가지를 기록하세요: 테스터가 어떤 장면을 선택하거나 발전시켰는지, 새로운 방향성을 제시했는지, 캐릭터가 설정을 지켰는지 어겼는지, 어떤 새로운 이야기 요소가 나타났는지 등을 확인합니다. 관찰 내용을 잘 보여주는 구체적인 대사나 선택이 있다면 함께 적어 두세요. 이를 해석과 분리하여 기록하세요. “테스터가 시장에 가려던 계획을 바꿨다”는 관찰이고, “캐릭터가 주도성을 이끌어냈다”는 가능한 해석입니다. 짧고 단편적인 메모가 전반적인 인상 비평보다 세션 간 비교에 훨씬 유리합니다. (Taking notes and recording user research sessions)
대화가 끝나면 소수의 중립적인 질문을 던지세요. “이 캐릭터와 다음에 무엇을 해보고 싶으신가요?”라는 질문은 테스터가 또 다른 장면을 상상할 수 있는지 파악할 수 있게 해줍니다. “이 캐릭터에 대해 알고 계셨던 점과 어긋나는 부분이 있었나요?”는 설정 파괴를 드러낼 수 있습니다. “어떤 부분이 익숙하게 느껴졌고, 어떤 부분이 새롭게 느껴졌나요?”라는 질문은 참신함이 캐릭터, 상황, 혹은 테스터 자신의 기여 중 어디에서 비롯되었는지 명확히 해줍니다. 답을 직접 추측하여 제시하지 말고, 무엇 때문에 그렇게 답변했는지 테스터에게 물어보세요.
단순한 10행 스코어카드 사용하기
대화당 한 행을 사용하세요. 간결한 척도는 패턴을 요약하는 데 도움이 되지만, 계산된 점수 자체보다 메모와 사례가 더 중요합니다. 다음 루브릭은 실용적인 플레이테스트 도구일 뿐, 검증된 학술 연구 도구는 아닙니다.
대화: 1~10; 장면 선택 또는 방향: 테스터가 선택, 추가, 전환한 내용; 캐넌(설정 일관성): 0 = 모순; 1 = 불명확; 2 = 일관됨; 유용한 참신함: 0 = 추가 없이 반복; 1 = 일부 새로운 소재 있음; 2 = 뚜렷하고 활용 가능한 발전; 자발적 완료 여부: 예 / 아니오
캐넌 항목의 경우, 단순히 캐릭터가 새로운 상황에서 다르게 행동한다는 이유만이 아니라 캐넌 카드에 적힌 사실이나 이미 확립된 사건과 충돌할 때만 '모순'으로 채점하세요. 참신함 항목은 테스터가 반응하거나 살을 붙일 수 있는 세부 묘사, 결정, 관계의 발전, 혹은 장면의 전환이 있을 때 점수를 부여하세요. 캐릭터의 세계관에서 전혀 말이 되지 않는 엉뚱하고 놀라운 세부 묘사는 유용한 참신함이 아닙니다. 장면 선택은 테스터의 선호도를 채점하기보다 서술형으로 유지하세요. 다양성이란 캐릭터가 다양한 방향을 수용한다는 뜻이지, 테스터가 미리 정해진 범위를 골고루 선택해야 한다는 뜻이 아닙니다.
완료 여부는 다른 점수들과 분리하여 기록하세요. 테스터가 자발적으로 10번째 대화를 마쳤다면 그 사실을 기록하고, 도중에 멈췄다면 중단하게 된 계기를 말해줄 수 있는지 물어보세요. 완료를 애정의 증거로, 미완료를 실패의 증거로 해석하지 마세요. 캐릭터 외적인 이유로 중단했을 수도 있고, 끝까지 완료된 연속 대화라 할지라도 반복적이거나 모순된 장면이 여전히 포함되어 있을 수 있습니다. 행동과 그에 대한 설명이 결합할 때 단순한 이분법적 결과보다 더 많은 정보를 얻을 수 있습니다.
패턴을 읽고 무엇을 수정할지 결정하기
대화가 진행되는 동안 경험이 어디에서 변화하는지 살펴보세요. 테스터가 지속적으로 다양한 종류의 장면을 선택하는데도 캐릭터의 대답이 뻔해진다면, 다양한 상황 속에서의 목소리 톤과 의사결정 방식을 다듬으세요. 캐릭터의 개성은 뚜렷하게 유지되지만 장면이 새로운 결정이나 세부 사항 없이 반복해서 끝난다면, 초대장을 수정하거나 캐릭터에게 행동의 기반이 될 더 구체적인 목표와 선호도를 부여하세요. 테스터가 장면의 방향을 바꾸기 시작한다면, 준비된 상황들이 너무 비슷했거나, 너무 좁았거나, 혹은 테스터가 가져온 아이디어보다 단순히 흥미가 떨어졌던 것은 아닌지 검토해 보세요.
뚜렷한 개성의 목소리는 단순히 반복되는 말버릇이 아니라 캐릭터가 무엇을 알아차리고, 무엇을 원하며, 무엇을 말하는지를 통해 드러나야 합니다. 대화 작법에 관한 스토리텔링 가이드에서는 대사를 성격의 반영으로 설명하며, 대사가 캐릭터의 특성, 배경, 감정에 부합하도록 작성할 것을 권장합니다. 대화 기록을 검토할 때 이 원칙을 적용해 보세요. 이 대사가 이 상황에서 이 캐릭터에게 타당하게 어울리는가, 그리고 알아볼 수 있는 관점을 보여주고 있는가? (Section 8 – Writing Dialogue – A Beginner’s Guide to Storytelling)
그런 다음 특정한 수정 사항 하나를 선택하고 다른 플레이테스터와 함께 동일한 10개 장면 테스트를 반복하거나, 명확하게 기록된 새로운 테스트를 실행해 보세요. 버전 간을 비교할 때는 프롬프트와 점수 정의를 동일하게 유지하여, 테스트 자체의 변화가 캐릭터의 변화로 오인되지 않도록 해야 합니다. 첫 번째 테스트에서 설정 모순이 드러났다면 해당 사실을 자연스럽게 테스트할 수 있는 장면을 추가하세요. 반복적인 대화가 드러났다면 다양한 종류의 선택이 필요한 상황을 추가하세요. 이것은 진단 루프이지 모집단 추정이 아닙니다. 한 명의 플레이테스터만으로도 구체적인 마찰과 가능성을 파악할 수 있지만, 그 결과가 얼마나 폭넓게 일반화될 수 있는지는 알 수 없습니다.
열 번의 대화가 알려줄 수 있는 것—그리고 알려줄 수 없는 것
10회 대화 형식은 집중적인 스트레스 테스트로서 유용합니다. 첫 대화를 넘어 장면의 다양성, 뚜렷한 설정 유지, 신선한 소재가 살아남는지 파악하는 데 도움이 됩니다. 특정 테스터가 흥미를 잃은 지점, 유망한 방향을 발견한 지점, 혹은 설정 모순을 맞닥뜨린 지점을 보여줄 수 있습니다. 하지만 이것이 장기적인 매력을 증명하거나, 잔존율을 예측하거나, 모든 청중이 어떻게 반응할지 규명해 주는 것은 아닙니다. 이 테스트를 무엇을 점검하고 수정할지 결정하는 용도로 사용하고, 다양한 독자와 플레이 스타일에 대한 확신이 필요하다면 더 많은 플레이테스트를 진행하세요.
가장 명확한 신호는 구체적인 사례를 동반한 패턴입니다: 테스터에게 선택의 여지가 있었고, 캐릭터가 기존 설정에 부합하는 방식으로 반응했으며, 장면들이 살을 붙여갈 수 있는 고유한 소재를 만들어냈고, 테스터가 대화 세트를 끝까지 완료하기로 선택한 경우입니다. 이러한 요소 중 하나라도 무너진다면, 기록된 메모를 바탕으로 단순히 대화 프롬프트를 늘리는 대신 캐릭터의 어조 조정, 설정 명확화, 장면 초대장 재설계 등 다음 단계의 창작적 결정을 내려야 합니다.
