AI 시뮬레이션 독자가 글에 대해 알려줄 수 있는 것과 알려줄 수 없는 것
웹페이지, 가이드, 설명서 등을 수정할 때 언어 모델을 활용하면 독자에게 혼란을 줄 수 있는 표현을 찾아내는 데 도움을 받을 수 있습니다. 언어 모델은 불명확한 문구를 짚어내거나, 발생할 수 있는 오독을 설명하거나, 초안이 제시된 질문에 제대로 답하고 있는지 확인해 줄 수 있습니다. 하지만 시뮬레이션된 반응만으로는 실제 타깃 독자가 글을 제대로 이해했는지, 적절한 맥락을 파악했는지, 또는 설명된 과업을 완수했는지 확인할 수 없습니다. 이를 확인하려면 실제 타깃 오디언스 중 몇 명을 섭외해 해당 과업을 수행해 보게 하고, 그들이 이해한 바를 설명하도록 관찰해야 합니다.
초안 검토 시 모델이 유용하게 비판해 줄 수 있는 부분
모델은 제공된 단어와 구조를 면밀히 검토할 수 있습니다. 낯설 수 있는 용어, 누락된 것으로 보이는 단계, 여러 가지 그럴듯한 의미로 해석될 수 있는 지침, 혹은 초안이 답하지 않고 남겨둔 질문을 찾아내도록 요청해 보세요. 또한 텍스트의 어떤 근거를 바탕으로 그러한 의견을 도출했는지 설명해 달라고 요청할 수도 있습니다. 이는 1차 편집 검토로서 유용합니다. 즉, 실제 독자에 대한 확정적 결과가 아니라 조사해 볼 만한 후보 항목들을 만들어 줍니다.
과업은 구체적으로 부여하세요. 예를 들어 당일치기 여행 코스를 선택하는 방법을 설명하는 페이지라면, 독자가 옵션을 비교하는 데 필요한 세부 정보가 무엇인지, 그 세부 정보가 어디에 나와 있는지를 짚어내도록 모델에 요청할 수 있습니다. 구체적인 구절과 발생 가능한 오해를 제시하도록 요청한 다음, 각 제안을 본래의 의도 및 텍스트와 대조하여 확인하세요. 답변이 유창하다고 해서 실제 사람이 그 구절을 그렇게 읽을 것이라는 증거는 되지 못합니다.
페르소나 프롬프트가 유용한 구조를 일부 더해줄 수는 있지만, “바쁜 첫 방문자”와 같은 설명이 모델을 실제로 그 방문자로 만들어 주지는 않습니다. 페르소나 프롬프트에 관한 연구에 따르면, 그 효과는 페르소나 변수가 인간의 주석 패턴과 일치하는지 여부에 달려 있었습니다. 수많은 주관적 데이터셋 전반에서 이러한 변수는 변량의 극히 일부만을 설명했습니다. 페르소나 기반 반응은 타깃 오디언스 의견의 대표성 있는 표본이 아니라 하나의 가설로 취급해야 합니다. Hu and Collier, “Quantifying the Persona Effect in LLM Simulations”
시뮬레이션된 반응이 입증할 수 없는 것
모델의 반응은 특정 독자가 실제로 무엇을 인지하고, 추론하고, 기억하고, 행동했는지를 입증할 수 없습니다. 모델은 텍스트와 프롬프트를 입력받아 답변을 생성할 뿐입니다. 반면 실제 독자는 자신만의 지식, 목표, 주의 분산 요소, 기대치 및 상황을 안고 자료를 접합니다. 이러한 요소들이 모여 문장이 이해되는지, 그리고 그 사람이 그에 따라 행동할 수 있는지를 결정합니다.
이러한 차이는 질문이 행동과 관련될 때 가장 중요해집니다. 사용자가 적절한 정보를 찾을 수 있는가? 지시사항을 의도한 대로 해석하는가? 힌트 없이 과업을 완수할 수 있는가? 모델은 이러한 질문에 대해 추론할 수 있지만, 자신이 어떻게 행동할 것인지에 대한 모델의 설명은 결국 생성된 텍스트에 불과합니다. 모델이 독자적으로 페이지를 탐색해 보았거나 타깃 오디언스에 속한 사람이 이를 사용할 수 있음을 실제로 증명한 것은 아닙니다.
모델 시뮬레이션에 관한 연구에서도 생생하거나 다양한 응답을 충실도의 증거로 오인하지 말라고 경고합니다. 2025년에 진행된 설문 응답 시뮬레이션 연구에 따르면, 테스트된 접근 방식들은 사용자 응답을 정확하게 재현하는 데 어려움을 겪었습니다. 모델들은 인구통계학적 변화에도 기존 관점을 그대로 유지하는 경향이 있었고, 프로필 간의 미묘한 차이에 적응하는 데 한계를 보였습니다. 이 연구가 모든 글쓰기 피드백이나 사용성 과업을 직접 테스트한 것은 아니지만, 실질적인 경계선을 뒷받침합니다. 즉, 그럴듯하게 들리는 시뮬레이션 독자가 실제 오디언스의 반응을 보증해 주지는 않는다는 점입니다. Yu et al., “An Analysis of Large Language Models for Simulating User Responses in Surveys”
소규모 실제 독자 테스트가 밝혀낼 수 있는 것
소규모 정성적 테스트는 실제 참여자가 어디에서 주저하는지, 무엇을 간과하는지, 특정 문구를 어떻게 해석하는지, 그리고 의도한 최종 단계에 도달하는지 보여줄 수 있습니다. 각 사람에게 현실적인 과업을 부여하고, 초안이나 페이지를 사용하게 한 뒤 일어나는 현상을 관찰할 수 있습니다. 후속 질문을 통해 특정 단어의 의미를 무엇으로 생각했는지, 혹은 왜 특정 단계를 선택했는지 명확히 파악할 수 있습니다. 이는 관찰 가능한 행동과 참여자 자신의 설명을 결합해 줍니다.
콘텐츠 관련 과업의 경우, 세션을 진행하기 전에 성공의 기준을 정의하세요. 예를 들어 텍스트가 당일 여행 가이드라면, 참여자에게 명시된 선호도에 부합하는 옵션을 선택하고 어떤 정보가 그 선택에 영향을 미쳤는지 설명하도록 요청할 수 있습니다. 관련된 세부 정보를 찾는지, 어떤 단어나 섹션에서 속도가 느려지는지, 그리고 그들의 설명이 가이드가 전달하고자 했던 차이점과 일치하는지 기록하세요. 이 예시는 제안된 테스트 설계일 뿐이며, 특정 가이드나 결과에 대한 주장이 아닙니다.
정성적 사용성 테스트에 대한 영국 정부(GOV.UK)의 지침에서는 실제 사용자가 될 수 있는 사람을 모집하고, 과업을 부여하며, 지나친 지시를 피하고, 이후 과업 완료 여부와 일반적인 오류를 검토할 것을 권장합니다. Nielsen Norman Group 역시 사용성 연구를 콘텐츠가 찾기 쉽고 이해하기 쉬운지, 혹은 사용자가 과업을 완수할 수 있는지를 조사하는 방법으로 설명합니다. 두 기관 모두 참여자가 '무엇을 하는지' 관찰하는 것을 강조하며, 이는 시뮬레이션된 응답으로는 결코 얻을 수 없는 증거입니다. GOV.UK, “Usability testing: qualitative studies”, Nielsen Norman Group, “Checklist for Planning Usability Studies”
유용한 소규모 테스트를 운영하는 방법
해당 텍스트가 지원하고자 하는 단 하나의 결정이나 과업에서부터 시작하세요. 특히 주제에 대한 경험 측면에서 타깃 독자와 유의미하게 닮은 사람들을 모집합니다. 그런 다음, 정답이 어디에 있는지 또는 어떤 단어를 찾아야 하는지 알려주지 않으면서 해당 자료를 사용해야 하는 이유를 제공하는 시나리오를 작성합니다. 페이지의 레이블을 그대로 반복하는 과업은 콘텐츠가 목표 달성에 도움이 되는지 테스트하는 대신 부지불식간에 '단어 일치 여부'를 테스트하게 될 수 있습니다. NN/G는 행동을 유도하는 단서 없이 구체적인 과업을 작성할 것을 권장합니다.
세션 중에는 참여자가 최소한의 안내만으로 진행하도록 합니다. 그들이 무엇을 하는지, 어디에서 멈추는지, 자신의 말로 무엇을 이야기하는지, 그리고 과업을 완수하는지 기록하세요. 만약 도움을 요청한다면 어떤 시점에서 도움이 필요했는지 기록해 둡니다. 테스트가 끝난 후, 그들이 무엇을 이해했는지, 그리고 다음으로 무엇을 할 것인지 설명하도록 요청하세요. GOV.UK 지침은 정성적 사용성 테스트에 5~6명의 참여자를 권장하며, NN/G는 전통적인 정성 연구에 일반적으로 5명을 권장합니다. 이는 문제를 발견하기 위한 실용적인 출발점이지, 전체 모집단을 대표할 수 있는 표본 크기는 아닙니다. 일반화할 수 있는 백분율이나 비교가 필요하다면 더 큰 표본과 통제된 측정 방식을 갖춘 정량적 설계가 필요합니다. GOV.UK, “Usability testing: qualitative studies”, NN/G, “Quantitative vs. Qualitative Usability Testing”
관찰 결과를 성급한 일반화가 아닌 구체적인 수정으로 전환하기
몇 번의 세션을 거친 후, 반복되는 장애물과 중대한 단일 실패 사례를 찾아보세요. 여러 참여자가 동일한 문구를 오해한다면 이는 강력한 수정 대상입니다. 한 사람이 과업을 완수하지 못했다면 당시 조건을 면밀히 살펴보고 그 실패가 타깃 독자에게 중요한 문제인지 자문해 보세요. 단 한 번의 세션을 전체 인구 수준의 비율로 취급해서는 안 됩니다. 소규모 정성 연구는 문제를 드러내고 수정을 안내하기 위한 것이지, 더 넓은 범위의 독자 중 몇 명이나 그 문제를 겪을지 추정하기 위한 것이 아닙니다. NN/G는 정성적 발견이 참여자 표본과 연구자의 해석에 의존하는 반면, 수치적인 사용성 주장은 적절한 규모의 정량적 연구가 필요하다고 지적합니다.
텍스트를 수정한 다음, 가능하면 새로운 독자들을 대상으로 수정본을 테스트하세요. 모델은 수정 과정 사이사이에 대안적인 표현을 탐색하거나 새로운 모호성을 짚어내는 데 도움을 줄 수 있습니다. 메모를 작성할 때는 증거의 유형을 명확히 구분하세요. “모델은 이 부분이 혼란스러울 수 있다고 예측했다”는 조사를 위한 시발점이며, “두 명의 참여자가 이 단계를 다르게 해석했고 한 명은 최종 단계에 도달하지 못했다”는 테스트에서 얻은 실제 관찰 결과입니다. 둘 중 어느 것도 모든 독자가 동일한 경험을 할 것이라고 단독으로 증명하진 못하지만, 두 번째는 관찰된 과업에서 실제로 무슨 일이 일어났는지를 알려줍니다.
실용적인 역할 분담
모델은 초안에 대한 질문을 생성하는 데 활용하세요. 실제 이해도와 과업 수행에 대한 질문에 답을 얻는 데는 실제 독자를 활용하세요. 과업이 특정 대상, 환경 또는 사전 경험에 의존하는 경우, 모델에게 이를 지어내도록 요구하기보다 그러한 조건을 갖춘 실제 사용자를 모집하세요. 그리고 신뢰할 수 있는 비율이나 비교가 필요할 때는 소수의 정성적 세션을 통계적 주장으로 무리하게 확장하지 말고 정량적 연구를 설계하세요.
이러한 역할 분담을 통해 그럴듯한 반응을 독자의 성공에 대한 증거로 오인하지 않으면서도 시뮬레이션 기반 비판으로 수정 속도를 높일 수 있습니다. 결정적인 질문은 모델이 설득력 있는 독자의 목소리를 낼 수 있는가가 아닙니다. 타깃 독자가 자료를 이해하고, 텍스트가 돕고자 하는 바를 독자가 실제로 해낼 수 있는가입니다.
