AI 탐지기를 “속이는 것”이 바람직한 글쓰기 목표가 아닌 이유
초안을 수정할 때는 탐지기가 원하는 점수를 부여하는지가 아니라, 내용이 정확하고 명확하며 구체적이고 유용한지를 기준으로 판단해야 합니다. AI 텍스트 탐지기는 텍스트의 패턴을 기반으로 작성자를 추정할 뿐이며, 논증의 질, 근거, 구성, 독자와의 적합성을 직접 측정하지는 않습니다. 더 탄탄한 퇴고 과정은 독자에게 필요한 것이 무엇인지 묻고, 각 주요 주장을 점검하며, 필자의 선택을 의도적이고 분명하게 만드는 것입니다.
AI 탐지기 점수가 알려줄 수 있는 것과 알려줄 수 없는 것
탐지기는 분류기(classifier)입니다. 텍스트를 분석하여 그것이 인간이 작성한 사례와 유사한지, AI가 생성한 사례와 유사한지를 추정합니다. 그 결과는 사용된 도구, 텍스트, 그리고 해당 도구가 평가된 환경에 따라 달라집니다. 이는 문장을 누가 썼는지에 대한 직접적인 판독도 아니며, 그 문장이 사실인지 또는 유용한지에 대한 평가도 아닙니다.
작성 주체와 글의 질은 서로 다른 문제이기 때문에 이러한 차이는 중요합니다. 사실과 다른 문단도 유려하게 읽힐 수 있고, 신중하게 조사된 설명도 평이하고 예측 가능할 수 있습니다. 탐지기 점수가 높다고 해서 초안이 훌륭하다는 의미는 아니며, 점수가 낮다고 해서 그 주장의 타당성이 입증되는 것도 아닙니다. 이러한 결과가 확실성과 얼마나 크게 다를 수 있는지 보여주는 예로, OpenAI의 이전 분류기는 자체 평가에서 AI가 작성한 텍스트의 26%만을 “AI가 작성했을 가능성이 높음”으로 올바르게 식별했고, 인간이 작성한 텍스트를 9%의 확률로 잘못 분류했습니다. OpenAI는 이후 낮은 정확도를 이유로 해당 분류기의 제공을 중단했습니다. 이러한 수치는 특정 도구와 평가에 국한된 것이며, 현재의 모든 탐지기에 적용되는 것은 아닙니다. OpenAI의 분류기 발표 및 한계
탐지기 연구 결과가 제한적이고 조건부일 수밖에 없는 이유
모든 탐지기가 모든 종류의 텍스트에서 실패한다는 보편적인 단 하나의 주장을 뒷받침하는 연구는 없습니다. 2025년에 발표된 미국 국립표준기술연구소(NIST)의 2024 텍스트-투-텍스트(text-to-text) 파일럿 연구에 따르면, 탐지기 성능은 시스템마다 달랐습니다. 일부 탐지기는 인간이 작성한 요약문과 생성된 요약문을 효과적으로 구분한 반면, 일부 생성 모델은 대부분 혹은 모든 탐지기를 속이는 요약문을 만들어냈습니다. NIST는 이 연구를 특정 작업, 데이터 세트 및 시스템 세트에 대한 벤치마크 평가로 설명합니다. 이 결과는 해당 환경에 대한 유용한 증거일 뿐이며, 필자가 제출할 수 있는 모든 문단에 대한 작성자 보증서가 아닙니다. NIST 파일럿 연구 개요 및 결과
다른 연구 결과들도 결과에 수반되는 제반 조건을 염두에 두어야 할 필요성을 강조합니다. 14개 탐지 시스템을 평가한 2023년의 한 연구는 테스트된 도구들이 해당 연구 환경에서 정확하지도 신뢰할 수도 없었다고 결론지었습니다. 스탠퍼드 연구진은 조사 대상 탐지기들이 영어가 모국어가 아닌 필자가 쓴 에세이를 AI가 생성한 것으로 불균형하게 분류했다고 보고했습니다. 그들의 기사는 표본으로 추출된 TOEFL 에세이의 61.22%가 탐지기에 의해 AI 생성으로 표시되었다는 연구를 요약하고 있습니다. 이 발견은 평가된 도구와 표본에 관한 것일 뿐, 모든 탐지기나 모든 다국어 필자에게 해당하는 것은 아닙니다. 이러한 연구들을 종합하면, 탐지기 결과가 글쓰기의 질을 대체할 수 있는 타당한 기준이 아니며, 특정 조건에서 도구가 패턴을 일치시킨 결과에 대한 증거일 뿐인 이유를 알 수 있습니다. Weber-Wulff 등, “Testing of Detection Tools for AI-Generated Text”; 비모국어 필자 연구에 관한 Stanford HAI 보고
탐지기 결과를 불확실하게 만드는 요인
도구는 특정 데이터 세트, 언어, 장르 및 텍스트 길이에 맞춰 개발되고 평가됩니다. 이러한 조건이 바뀌면 도구의 성능도 달라질 수 있습니다. 합성 콘텐츠에 관한 NIST 보고서는 탐지 성능이 방법론과 데이터 세트에 따라 달라진다고 설명하며, 시스템이 본 적 없는 데이터나 교차 도메인 데이터에서는 성능이 저하될 수 있음을 지적합니다. 또한 다양한 시나리오에서의 테스트와 견고성(robustness) 및 일반화 가능성에 대한 추가 평가를 촉구합니다. 실질적으로 말하자면, 하나의 초안에 대해 하나의 도구가 매긴 점수는 독자가 그 글을 어떻게 이해할지, 사실관계가 탄탄한지, 또는 다른 도구가 그것을 어떻게 분류할지를 보여주는 안정적인 척도가 되지 못합니다. NIST AI 100-4, “합성 콘텐츠로 인한 위험 완화”
또 다른 한계도 있습니다. 탐지기의 목표는 출처에 따른 분류인 반면, 퇴고의 목적은 소통의 질을 높이는 것입니다. 통제된 평가에서 우수한 성능을 보이는 탐지기라도 “이 문단이 결론을 제대로 뒷받침하는가?”라는 질문에는 답하지 못합니다. NIST의 파일럿 연구는 특정 벤치마크에서 유망한 결과가 나올 수 있지만 시스템과 생성기에 따라 여전히 결과가 달라질 수 있음을 상기시켜 줍니다. 탐지기 점수를 글쓰기 전반에 대한 절대적인 점수로 취급하는 것은 평가가 검증한 범위를 벗어나는 일입니다.
독자 중심 기준에 맞춰 초안 수정하기
먼저 독자의 과제를 한 문장으로 적어보는 것으로 시작하세요. 예를 들면 다음과 같습니다. “이 글을 읽은 후 독자는 두 가지 옵션을 비교하고 어떤 조건이 중요한지 파악할 수 있다.” 그런 다음 초안이 실제로 그 과제를 가능하게 하는지 확인합니다. 이 간단한 테스트는 탐지기 점수로는 결코 짚어낼 수 없는 빈틈을 드러내 줍니다.
다음과 같은 5단계 퇴고 과정을 활용해 보세요:
의미(Meaning): 핵심 요지를 한 문장으로 말할 수 있는가? 각 섹션이 이를 설명하거나 뒷받침하거나 한정하는 데 도움이 되는가?
근거(Evidence): 사실적 주장을 신뢰할 수 있는 출처까지 추적할 수 있는가? 출처가 날짜, 대상 집단, 한계점 등을 포함하여 해당 주장을 정확하게 뒷받침하는가?
일관성(Coherence): 각 문단이 앞선 문단에서 자연스럽게 이어지는가? 핵심 용어가 일관되게 사용되었으며, 전환 어구가 실제 관계를 잘 설명하고 있는가?
구체성(Specificity): 관련된 인물, 조건, 단계, 사례 또는 한계를 명시했는가? 독자가 필자의 의도를 짐작할 필요 없이 정보에 따라 실행할 수 있는가?
작성자 수정(Author revision): 사실관계를 확인하고, 포함할 내용을 취사선택했으며, 불명확하거나 부정확한 구절을 본인이 책임질 수 있는 언어로 다시 썼는가?
이 목록은 검증된 채점 시스템이 아니라 실질적인 퇴고 보조 수단입니다. 이는 “글을 더 낫게 만들자”라는 막연한 생각을 주장의 검증, 필요한 조건 추가, 근거 없는 일반화 삭제, 단계 설명 등 구체적인 점검 작업으로 전환해 줍니다. 유용한 퇴고는 탐지기의 출력값이 바뀌든 말든 독자가 글을 더 쉽게 이해하고 활용할 수 있도록 돕습니다.
간단한 퇴고 실습 예시
“이 방법이 최선의 선택이며 언제나 시간을 절약해 줍니다.”와 같은 초안 문장을 생각해 보십시오. 문제는 자동화 도구가 이 문장의 어휘를 어떻게 분류하느냐가 아닙니다. 이 문장은 누구에게 최선인지, 무엇과 비교했을 때인지, 또는 어떤 조건에서인지 밝히지 않은 채 ‘최선’과 ‘언제나 시간을 절약한다’라는 두 가지 광범위한 주장을 펴고 있습니다.
실질적인 퇴고라면 비교 대상과 근거를 명확히 밝힐 것입니다: “이미 동일한 일정 관리 앱을 사용하는 팀의 경우, 이 방법을 쓰면 별도의 계획 단계를 줄일 수 있습니다. 다만 참여자들의 도구가 서로 다를 때는 덜 편리할 수 있습니다.” 이 예시는 설명을 돕기 위한 것이지 연구 결과는 아닙니다. 요점은 독자 대상을 구체화하고, 주장의 범위를 좁히며, 관련 조건을 명시하는 것이야말로 초안을 개선하는 진정한 작업이라는 점입니다. 시간 절약 주장에 대한 근거를 찾을 수 없다면 문장을 삭제하거나 사실이 아닌 조사해 볼 과제로 제시해야 합니다.
초안 마무리를 위한 실용적 점검
글이 완성되었다고 선언하기 전에, 목표 독자의 입장에서 한 번 읽어보며 자문해 보십시오. 정답은 무엇인가? 어떤 근거가 있다면 이를 신뢰할 수 있는가? 이를 실행하기 위해 아직 더 알아야 할 정보는 무엇인가? 그런 다음 출처 링크, 인명, 날짜, 사례 및 한계 조건을 확인하십시오. 탐지기를 하나의 참고 자료로 사용했다면 그 결과를 제한적인 신호로만 취급하고 독자 중심의 질문으로 돌아가십시오. 단순히 숫자를 맞추기 위해 의미 있는 내용을 다시 쓰는 일은 피해야 합니다.
이러한 접근법은 퇴고를 위한 더 명확한 기준을 제공합니다. 바로 본질적인 내용과 독자의 경험을 개선하는 것입니다. 탐지기 연구는 작성자 분류의 한계를 이해하는 데 여전히 유용하며, NIST와 같이 발전하는 평가는 성능이 왜 특정 테스트와 연계되어야 하는지 보여줍니다. 하지만 어떠한 점수도 주장을 정밀하게 다듬고, 근거를 명확히 추적할 수 있게 하며, 설명을 일관성 있게 구성하는 필자의 노력을 대신할 수는 없습니다. NIST 생성형 AI(GenAI) 평가 프로그램
