Metlivi 블로그

20분 만에 AI 게임 대화 플레이테스트를 관찰하는 방법

하나의 생성형 대화 씬을 테스트하는 소규모 스튜디오라면, 플레이어가 NPC의 답변을 바탕으로 어떻게 행동하는지 관찰하세요. 플레이어가 다양한 질문을 시도하는지, 유용한 정보에 따라 행동하는지, 허구의 사실(환각)로부터 원래 목적을 회복하는지, 씬을 완료하기 위해 대화를 종료하는지 확인해야 합니다. 간단한 설문지는 플레이어가 나중에 느꼈거나 이해했다고 말하는 바를 포착할 수는 있지만, 순간순간 발생한 선택과 우회 과정을 그 자체만으로 보여주지는 못합니다. 플레이 중에는 단순한 이벤트 시트를 사용하고, 이후에 집중적인 후속 질문을 진행하세요. 이러한 관찰 결과는 만족도의 척도나 모든 플레이어의 행동을 증명하는 증거가 아니라, 해당 씬과 빌드에 대한 단서로 다루어야 합니다.

2026년 9월 27일6분 분량독서·예술·문화작성: Metlivi Editorial Team
섹션 1

생성형 대화 씬에서 무엇을 관찰해야 할까요?

하나의 명확한 목표가 있고 NPC의 답변이 플레이어의 목표 달성 방식을 바꿀 수 있는 씬을 선택하세요. 예를 들어, 가상의 씬에서 플레이어는 환기 주기가 끝나기 전에 밀폐된 온실 문을 열어야 합니다. 정비 NPC는 자유로운 대화를 통해 단서를 제공할 수 있습니다. 의도된 경로는 공구 창고에서 파란색 밸브 손잡이를 찾는 것이지만, NPC는 손잡이가 물에 잠긴 펌프실에 있다고 주장하는 등 가끔 세부 사항을 지어낼 수도 있습니다.

아래의 네 가지 지표는 플레이어의 행동과 씬의 결과에 초점을 맞춥니다. 질문이 기발한지, 플레이어가 게임을 즐기는 것처럼 보이는지 판단할 필요는 없습니다.

지표: **다양한 질문** — 이벤트 기록 시점: 플레이어가 답변을 들은 후 표현, 주제 또는 접근 방식을 바꿀 때. 예: 밸브가 어디에 있는지 묻고 나서 무슨 색인지 또는 어느 방이 안전한지 묻는 경우. — 기록할 상태 증거: 플레이어가 무엇을 물었는지, NPC가 어떻게 답했는지, 다음 질문이 그 답변에서 비롯된 것인지 여부. 완전히 다른 질문과 거의 반복에 가까운 질문을 구분하세요. — 사후 질문: “그 질문들을 통해 무엇을 알아내려고 하셨나요?”

지표: **답변이 다음 행동을 변화시킴** — 이벤트 기록 시점: 플레이어가 NPC의 답변에 따라 이동하거나, 무언가를 조사하거나, 계획을 변경할 때. — 기록할 상태 증거: 답변 내용, 플레이어의 다음 행동, 지나쳐 간 눈에 보이는 대안들. 연관성을 명확함, 그럴듯함, 불확실함으로 표시하세요. 답변 뒤에 행동이 따랐다고 해서 반드시 답변 때문에 행동했다는 증거는 아닙니다. — 사후 질문: “대화의 어느 부분이 다음 행동에 영향을 주었나요(영향을 준 부분이 있다면)?”

지표: **허구의 사실이 잘못된 방향으로 유도** — 이벤트 기록 시점: 플레이어가 NPC의 근거 없거나 거짓된 주장을 따르다 비생산적인 행동을 하게 될 때. — 기록할 상태 증거: 정확한 주장 내용, 그로 인해 유발된 행동, 빌드에서 확인되는 손실이나 우회 경로, 플레이어가 오류를 발견하거나 수정한 방식. 주장을 허구로 분류하기 전에 세션이 끝난 후 씬의 의도된 사실관계를 확인하세요. — 사후 질문: “어떤 점 때문에 그 경로가 맞다고 생각하셨나요? 언제 경로를 바꾸기로 결정하셨나요?”

지표: **플레이어가 대화를 중단하고 씬을 완료할 수 있음** — 이벤트 기록 시점: 플레이어가 대화를 종료, 일시 정지하거나 추가 대화를 거부하면서도 목표를 계속 추구하여 완료할 수 있을 때. — 기록할 상태 증거: 대화 종료 수단이 눈에 보이는지, 대화를 떠난 후 어떤 일이 일어나는지, 유의미한 진행이 여전히 가능한지, 플레이어가 씬의 완료 상태에 도달하는지 여부. 플레이어가 대화를 계속하기로 선택한 것과 방해 요소를 구분하여 기록하세요. — 사후 질문: “대화를 끝낼 수 있다고 느끼셨나요? 대화를 계속하거나 중단하게 만든 이유는 무엇인가요?”

이것들은 이벤트 정의이며, 품질에 대한 점수가 아닙니다. 표정, 침묵, 플레이 시간에서 의도를 추론하기보다 플레이어의 실제 발언과 행동을 기록하세요. 이벤트가 발생하지 않았다면 실패로 간주하지 말고 '이 세션에서는 관찰되지 않음'으로 기록하세요.

섹션 2

관찰 시트를 빌드와 항상 연결해 두세요

각 세션 전에 빌드 버전, 시작 목표, 알려진 씬의 사실관계 및 허용된 완료 상태를 기록하세요. 플레이 중에는 플레이어의 질문, NPC의 답변, 눈에 보이는 다음 행동, 확정된 게임 상태 변화를 기록하세요. 그럴듯하게 들리는 대사라도 이 빌드에 존재하지 않는 위치를 가리키고 있다면 잘못된 것일 수 있습니다.

세션이 끝난 후, 허구로 의심되는 사실을 실제 씬 시트와 비교하세요. 씬의 사실관계와 모순될 때만 근거 없는 주장으로 확정하고, 그렇지 않은 경우 미해결로 표시한 뒤 조사하세요. 진행자의 힌트나 기술적 중단은 플레이어의 다음 행동을 바꿀 수 있으므로 별도로 기록해 두어야 합니다. 이러한 작은 증거 추적 기록은 단 한 번의 플레이 결과를 일반화하지 않으면서도 추후 논의를 훨씬 정밀하게 만들어 줍니다.

섹션 3

제한된 20분 세션을 운영하는 방법

참가자에게 다음과 같이 안내하세요: “평소처럼 이 씬을 플레이해 주세요. 원할 때는 언제든 캐릭터와 대화하거나 대화를 끝낼 수 있습니다. 여러분이 시도하는 것을 지켜보기 위해 제가 말을 하지 않을 수도 있습니다.” 다양한 질문을 유도하거나 허구의 사실에 대해 경고하지 마세요. 이는 세션에서 확인하려는 본래의 행동을 변화시킬 수 있습니다. 도움을 요청받으면 일관되게 응대하고, 해당 개입을 기록한 뒤, 그 도움을 염두에 두고 이후 행동을 다루세요.

실행 가능한 일정은 다음과 같습니다:

**0~2분: 준비.** 의도된 해결책을 설명하지 않고 과제와 조작법을 안내합니다. 플레이어가 조작 권한을 얻는 순간 타이머를 시작하고, 모든 참가자에게 동일한 상태로 씬을 시작합니다.

**2~15분: 관찰.** 플레이어가 자유롭게 탐색하고 대화하도록 둡니다. 관련된 각 답변과 다음 행동을 기록하며, 특히 특정 주장으로 인해 어딘가로 이동할 때 주의 깊게 기록합니다. 플레이어가 멈춰 서서 계속하기 위해 유도가 필요할 때는 “무슨 생각을 하고 계신가요?”와 같은 중립적인 질문을 사용하고, 개입했다는 사실을 기록하세요.

**15~20분: 마무리 및 질의.** 플레이어가 완료하지 못했더라도 15분 플레이 시점에서 멈추고 현재 상태를 기록하세요. 속도 테스트에서 실패했다는 뉘앙스를 주어서는 안 됩니다. 관찰된 이벤트와 연결된 후속 질문을 한 뒤, 광범위한 질문을 하나 던지세요: “대화나 다음 단계에 대해 명확하지 않은 부분이 있었나요?” 자기 보고 내용은 관찰된 행동과 분리하여 기록하세요.

20분이라는 제한은 이 예시를 위한 실질적인 세션 경계일 뿐이며, 경험적 기준점이 아닙니다. 대화에 더 오랜 시간을 썼다고 해서 더 큰 만족도를 보인 것은 아니며, 빨리 끝냈다고 해서 반드시 씬을 이해했거나 즐겼다는 의미도 아닙니다. 사용 중인 빌드의 과제에 더 많은 시간이 필요하다면, 세션 전에 일정을 조정하고 이를 일관되게 유지하세요.

섹션 4

실제 일어난 일과 플레이어의 말을 분리하세요

[The Turing Test 포스트모텀](https://www.gamedeveloper.com/business/postmortem-building-i-the-turing-test-i-around-a-secret-mechanic)에서 디자인 디렉터인 David Jones는 학생들을 대상으로 퍼즐을 테스트하며 재미와 난이도 평가, 플레이 시간을 수집하는 한편, 플레이어의 행동을 관찰하는 데 더 큰 비중을 두었다고 설명합니다. 그는 난이도 곡선을 평가하기 위해 평가 점수와 관찰을 결합했다고 말합니다. 대화 씬의 경우 유용한 교훈은 두 종류의 증거를 함께 유지하되 명확히 구분하는 것입니다. 이벤트 로그는 플레이어가 '무엇을 했는지'를 보여주고, 후속 질의는 그들의 '설명이나 평가'를 기록합니다. 둘 중 어느 하나가 다른 하나를 자동으로 설명해 주지는 않습니다.

Klei의 [Mark of the Ninja 포스트모텀](https://www.gamedeveloper.com/design/classic-postmortem-klei-entertainment-s-i-mark-of-the-ninja-i-)에서는 디자인 가설을 검토하기 위해 새로운 플레이어를 대상으로 빈번한 테스트를 진행했다고 설명합니다. 개발팀은 불만 뒤에 숨겨진 동기를 찾고 새로운 플레이어가 어디서 어려움을 겪는지 관찰한 다음 신호(단서)와 디자인을 조정했습니다. 이를 여기에 적용해 보면, 플레이어가 잘못된 방향으로 전환하는 것은 조사해야 할 단서이지, 단순히 NPC의 대사를 더 길게 늘려야 한다는 신호가 아닙니다. 답변, 인터페이스, 씬의 어떤 요소가 그 경로를 타당해 보이게 만들었는지 묻고, 변경 사항을 결정하기 전에 녹화본이나 빌드 상태를 확인하세요.

Ubisoft의 [Teammates 발표](https://staticctf.ubisoft.com/8aefmxkxpxwl/2QCAorjku7w7gH1LGORV3t/6e8f347be3ecab7daa4769e5300086bc/Ubisoft_Unveils_%C3%A2__Teammates%C3%A2____Its_First_Playable_Generative_AI_Experience_Through_Closed_Player_Testing.pdf)는 플레이 가능한 생성형 AI 경험에 대한 비공개 플레이어 테스트를 설명합니다. 이 문서는 팀이 비공개 테스트를 발표했다는 사실만을 보여줄 뿐, 인용된 발표 자료에 공개된 플레이어 결과가 포함되어 있지 않으므로 플레이어가 무엇을 했는지 또는 그 경험이 성공적이었는지에 대한 주장을 뒷받침할 수는 없습니다.

섹션 5

관찰 결과를 다음 빌드를 위한 결정으로 전환하세요

세션이 끝난 후 타임라인을 검토하고 각 NPC 답변을 플레이어의 다음 행동과 연결해 보세요. 명백히 잘못된 방향으로 전환한 모든 경우에 대해 관련 씬의 사실관계를 검증한 다음, NPC가 거짓 세부 정보를 제공했는지, 플레이어가 참인 답변을 오해했는지, 특정 장소나 상호작용 신호가 엉뚱한 곳을 가리켰는지 등 유력한 원인을 파악하세요. 이러한 설명은 기록된 시퀀스와 (필요한 경우) 다른 세션을 통해 대조하기 전까지는 가설에 불과합니다.

네 가지 지표를 활용하여 구체적인 후속 수정이나 테스트 항목을 선정하세요. 플레이어가 여러 차례 구체적인 질문을 던졌음에도 행동으로 이어질 만한 답변을 얻지 못했다면, 씬이 실행 가능한 정보를 제공하고 있는지 검토하세요. 특정 허구의 주장 때문에 잘못된 방으로 들어갔다면, 주장을 검증하거나 막다른 길 없이 복구할 수 있는 방법이 씬에 필요한지 고려하세요. 플레이어가 대화를 끝내고 씬을 완료하지 못한다면 종료 방식과 목표 흐름을 점검하세요. 만약 대화를 마치고 씬을 완료했다면 이 빌드에서 그 경로가 유효했음을 기록하고, 명확했다고 결론짓기 전에 플레이어가 무엇을 이해했었는지 물어보세요.

단 한 번의 20분 세션으로 특정한 혼란이나 누락된 경로를 발견할 수는 있지만, 그 문제가 얼마나 흔한지까지 입증할 수는 없습니다. 다음에 무엇을 조사할지 결정할 때는 관찰자의 이벤트 메모, 검증된 씬의 사실관계, 플레이어의 회고적 답변을 엄격히 분리하세요. 이를 통해 소규모 팀은 단순한 설문지만으로는 얻을 수 없는, 이 플레이어가 생성형 대화 씬을 어떻게 탐색했는지에 대한 유용한 기록을 확보할 수 있습니다.

관련 글

이 주제 더 살펴보기