Metlivi 블로그

장르와 스타일별로 창작 글쓰기 모델을 테스트하는 방법

글쓰기 모델이 특정 장르나 스타일에 적합한지 확인하고 싶다면, 통제된 프롬프트 아래에서 동일한 소규모 글쓰기 작업을 부여한 뒤 미리 정해둔 기준에 따라 결과물을 비교해 보세요. 장르와 스타일을 결합하기 전에 먼저 따로 테스트해야 합니다. 이렇게 하면 모델이 이야기의 요구 사항을 놓쳤는지, 문체(voice)를 잘못 이해했는지, 아니면 단순히 대대적인 수정이 필요한 글을 만들어냈는지 더 쉽게 파악할 수 있습니다. 아래의 워크플로는 특정 단편 소설 작업을 위한 모델을 선택하려는 작가들을 위한 실용적인 비교 방법이며, 품질을 보장하는 절대적인 기준은 아닙니다.

2026년 9월 27일11분 분량일상의 미학과 자기 표현작성: Metlivi Editorial Team
섹션 1

무엇을 먼저 테스트해야 할까요: 장르일까요, 스타일일까요?

장르와 스타일은 글의 서로 다른 부분을 형성합니다. 장르는 플롯의 전개, 분위기, 배경, 중요하게 다뤄야 할 세부 요소 등 독자의 기대치를 설정합니다. 반면 스타일은 문장 길이, 어휘 선택, 시점, 리듬, 글에서 사용되는 묘사의 양과 같은 선택과 관련이 있습니다. 이 두 범주는 겹치는 부분이 있지만, 별도의 단계로 나누어 테스트하면 훨씬 더 명확한 평가가 가능합니다.

먼저 장르부터 시작하세요. 모델이 장면의 기본적인 역할을 수행할 수 있는지 확인해 보세요. 예를 들어 고스트 스토리에서 기묘한 전제를 설정하거나, 미스터리에서 단서의 흔적을 유지하거나, 일관성 있는 사변적 배경을 만들어낼 수 있는지 살펴보는 것입니다. 그런 다음 고정된 장면 전제에서 스타일을 테스트하되, '문학적인' 혹은 '영화 같은'과 같은 모호한 수식어에 의존하기보다는 관찰 가능한 특성을 구체적으로 지정하세요. '긴장감 속의 짧은 문장, 절제된 묘사, 인물의 감정에 대한 설명 배제, 밀착된 3인칭 시점'과 같은 요청은 '분위기 있게 만들어 달라'는 요청보다 훨씬 더 구체적인 평가 기준을 제공합니다.

이러한 구분은 실용적인 작업 방법일 뿐, 장르나 스타일을 객관적으로 측정할 수 있다는 주장은 아닙니다. [Google Cloud 프롬프트 디자인 가이드](https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/prompts/introduction-prompt-design)에서는 명확하고 구체적인 지침, 맥락 정보, 예시 및 프롬프트 비교를 권장합니다. [OpenAI의 프롬프팅 가이드](https://developers.openai.com/api/docs/guides/prompting) 역시 실험을 거치고 예시와 작업별 세부 정보를 명확하게 유지할 것을 조언합니다. 이러한 원칙들은 통제된 실험을 뒷받침하지만, 하나의 프롬프트 형식이 모든 창작 작업에 가장 적합하다고 단정하지는 않습니다.

섹션 2

작고 공정한 비교 환경 구축하기

실제로 도움이 필요한 글쓰기 작업을 대표할 수 있는 한 가지 과제를 선택하세요. 면밀히 검토할 수 있을 만큼 짧게 유지하는 것이 좋습니다. 250단어 분량의 한 장면, 배경 묘사, 혹은 한 단락의 퇴고만으로도 테스트를 누가 더 긴 초안을 작성하는지 겨루는 경쟁으로 변질시키지 않으면서 유의미한 차이를 발견할 수 있습니다.

고정된 이야기적 사실, 분량, 시점, 그리고 모든 내용적 제한 사항이 포함된 공통 프롬프트를 작성하세요. 그런 다음 검증하고자 하는 특징 하나만 변경하여 몇 가지 테스트 프롬프트를 만듭니다. 장르 처리 능력을 비교할 때는 동일한 전제를 유지하면서 서로 다른 장르적 접근을 요청하세요. 스타일을 비교할 때는 동일한 장르와 장면 설정을 유지한 채 요청하는 문체 특성만 변경합니다. 전제, 분량, 시점, 스타일을 한꺼번에 바꾸지 마세요. 결과물이 달라졌을 때 어떤 변경 사항 때문에 차이가 발생했는지 알 수 없게 됩니다.

가능하면 동일한 모델 설정을 사용하고, 모델 이름, 날짜, 프롬프트 텍스트 및 변경한 설정을 기록해 두세요. 설정을 통제할 수 없다면 해당 한계점을 기록해 두고 단 한 번의 결과물을 모델에 대한 안정적인 척도로 취급하지 마세요. 두 번째 생성을 진행해 보면 유망하거나 실망스러운 결과가 재현 가능한지 파악하는 데 도움이 될 수 있지만, 그렇다고 해서 개인적인 소규모 테스트가 포괄적인 벤치마크가 되는 것은 아닙니다.

프롬프트를 입력하기 전에 작업에 중요한 세 가지에서 다섯 가지 기준을 정하세요. 미스터리 장면이라면 단서가 제시되되 설명되지 않을 것, 서술자의 지식이 일관되게 유지될 것, 문장이 긴장감을 유지할 것, 장면이 의미 있는 의문으로 끝날 것 등이 될 수 있습니다. 스타일 테스트의 경우 기준에는 시점의 일관성, 문장의 다양성, 구체적인 이미지, 절제미 등이 포함될 수 있습니다. 최소한 하나의 '반드시 지켜야 할' 요구 사항과 하나의 '절대 포함해서는 안 될' 기준을 포함하세요. 그렇지 않으면 유려한 문장에 현혹되어 놓친 제약 조건을 알아차리지 못할 수 있습니다.

섹션 3

실제 사례: 정적인 미스터리 장면 테스트하기

잠긴 기록 보관소 안에서 젖은 발자국을 발견하는 관리인에 대한 현대 미스터리를 집필 중이라고 가정해 보겠습니다. 이 글은 밀착된 3인칭 시점이어야 하며 절제된 톤이어야 합니다. 아래 내용은 예시를 위한 프롬프트 입력값이며, 실제 모델 테스트 결과는 아닙니다.

먼저 다음과 같은 프롬프트로 장르 점검을 실행합니다:

테스트 프롬프트 예시: 밀착된 3인칭 시점으로 250단어 분량의 현대 미스터리 장면을 작성해 줘. 관리인이 새벽에 잠긴 기록 보관소에 들어갔다가 마른 창문 옆에서 젖은 발자국 하나를 발견한다. 원인은 설명되지 않은 채로 남겨 둘 것. 단서가 될 수 있는 구체적인 세부 사항 하나를 포함하되, 용의자를 특정하거나 발자국에 대해 설명하지 말 것. 절제된 산문을 사용하고 해결되지 않은 선택으로 끝맺을 것.

체크리스트와 대조하여 결과물을 검토하세요. 보관소가 잠겨 있고 창문이 말라 있는 상태를 유지했나요? 불확실성을 유지했나요, 아니면 제멋대로 설명을 만들어 냈나요? 단서라는 이름표를 붙이지 않고도 단서로 기능할 만한 세부 사항이 있나요? 결말이 단순히 멈추는 것이 아니라 선택의 상황을 만들어 내나요? 각 항목에 '충족', '부분 충족', '미흡'으로 표시하고, 그러한 판단을 내리게 된 정확한 문장을 복사해 두세요. 이 인용문은 기록용이며, '긴장감이 좋다'와 같은 막연한 인상이 구체적인 관찰을 대체하지 않도록 방지해 줍니다.

다음으로, 장면의 사실 관계와 미스터리 요구 사항은 고정한 채 스타일 지침만 변경합니다. 한 가지 변형에서는 군더더기 없는 짧은 문장과 최소한의 내면 성찰을 요청할 수 있고, 또 다른 변형에서는 시점의 밀착성을 유지하면서 더 길고 관찰력이 돋보이는 문장을 요청할 수 있습니다. 이러한 구체적인 지침이 산문에 어떤 영향을 미치는지 비교해 보세요. 어떤 스타일이 보편적으로 더 우월한지 묻는 것이 아닙니다. 이 장면과 당신이 의도한 고유한 문체에 어떤 결과물이 더 유용한 재료를 제공하는지 판단하는 것입니다.

마지막으로, 가장 만족스러운 결과물에 대해 한 가지 표적 수정 요청을 진행하세요. 예를 들어: '발자국과 밀실 상황에 대한 사실은 그대로 유지해 줘. 관리인의 의심을 설명하는 문장은 삭제하고, 대신 행동을 통해 불안감을 전달해 줘.' 수정본에서 이야기의 사실 관계가 우발적으로 변경되지는 않았는지, 실제로 설명적 문장이 제거되었는지 점검하세요. 유용한 모델 시험에는 초안의 유려함뿐만 아니라 수정 시의 반응도 포함되어야 합니다. 실제 작업 흐름에서는 국소적인 수정을 여러 번 거쳐야 할 수 있기 때문입니다.

섹션 4

스코어카드를 활용한 후 편집자로서 결정 내리기

간단한 스코어카드를 사용하면 비교를 객관적으로 유지할 수 있습니다:

마지막 행은 문학적 가치에 대한 객관적인 측정이 아니라 작업 프로세스에 대한 결정으로 취급하세요. 미스터리를 너무 일찍 풀어버리는 매끄러운 글보다는, 전제를 잘 지키고 강렬한 이미지를 제공하는 다소 거친 초안이 더 마음에 들 수도 있습니다. 또는 두 모델 모두 해당 작업에 유용하지 않다는 결론을 내릴 수도 있습니다. 수치 점수를 사용하는 경우 시작하기 전에 각 점수가 의미하는 바를 정의하고, 미세한 점수 차이를 통계적으로 유의미한 것처럼 포장하지 마세요.

이 방법은 창작 활동을 반복적인 과정으로 바라보는 더 넓은 관점과도 일치합니다. 신진 작가들을 대상으로 한 실증 연구에서 Chakrabarty와 동료 연구자들은 협업 글쓰기 시스템과 작가들의 상호작용을 조사하며 글쓰기를 반복적인 활동으로 설명했습니다. 이 연구는 단일 프롬프트로 완성된 이야기를 만들어내는 것이 아니라 상호작용적인 과정을 묘사합니다. 연구 참가자, 시스템 및 글쓰기 과제의 특성상 그 관찰 결과를 일반화하는 데는 한계가 있습니다. 이는 특정 모델이나 워크플로가 모든 작가에게 통할 것이라는 증거가 아니라, 자신만의 퇴고 루프를 테스트하기 위한 유용한 맥락을 제공합니다. [“대규모 언어 모델 시대의 창의성 지원: 신진 작가 대상 실증 연구”](https://arxiv.org/abs/2309.12570)를 참조하세요.

고정된 이야기 사실: 각 모델별로 충족, 부분 충족, 미흡을 표시하고, 변경된 사실이 있다면 인용하세요.
장르 작업: 단서, 긴장감 또는 장면의 전개가 프롬프트의 요구에 부합하는지 기록하세요.
스타일 특성: 요청한 시점, 리듬 또는 어휘가 잘 유지되었는지를 보여주는 문장 하나를 인용하세요.
표적 수정: 무엇이 변경되었는지, 장면의 사실 관계가 왜곡되지는 않았는지 기록하세요.
유지할 가치가 있는 내용: 보존하거나 편집하고 싶은 문장을 기록한 후, 편집자로서 본인의 결정을 내리세요.
섹션 5

도구를 바꾸기 전에 만족스럽지 못한 결과물 진단하기

결과물이 실망스러울 때는 무엇이 잘못되었는지 정확하게 짚어내세요. 고정된 사실과 모순된다면 해당 사실을 프롬프트에서 눈에 띄게 배치하고 상충되는 세부 정보를 제거하세요. 글이 전제는 따르지만 원하는 문체를 구현하지 못한다면, 모호한 형용사를 구체적인 특성으로 대체하거나 직접 작성한 짧은 예시를 추가하세요. 모델이 의도된 미스터리를 자꾸 해결해 버린다면, 불확실성을 유지하고 원인을 서술하지 말 것을 명시적으로 요구하세요. 한 번에 하나의 지침만 변경한 후 비교를 다시 실행해 보세요.

글이 체크리스트는 만족하지만 여전히 어색하게 느껴진다면, 지침 준수 여부보다는 취향이나 적합성의 문제일 수 있습니다. 무엇이 어색한지 구체적인 표현으로 기록해 보세요. 과도한 설명, 진부한 이미지, 뻔한 대사, 또는 원하지 않는 리듬 등이 원인일 수 있습니다. 그런 다음 집중적인 수정 요청을 시도해 볼 가치가 있는지, 아니면 직접 장면을 쓰는 것이 더 나을지 결정하세요. 모델이 그럴듯한 산문을 생성할 수 있다고 해서 모델이 당신의 의도를 이해했다거나 그 글을 반드시 살려두어야 한다는 의미는 아닙니다.

섹션 6

모델 시험의 한계

몇 번의 생성 결과만으로 모델이 특정 장르 전체에 지속적으로 뛰어나다고 단정할 수는 없으며, 한 작가의 평가 기준이 모든 독자를 대변할 수도 없습니다. 결과물은 매번 다를 수 있고, 프롬프트가 특정 모델에 유리하게 작용할 수도 있으며, 장르에 대한 친숙도가 검토자의 눈에 띄는 요소에 영향을 미치기도 합니다. 결론은 좁은 범위로 한정하세요. '이 두 번의 테스트에서는 이 버전이 장면의 사실 관계를 더 잘 보존했다'는 결론이 '이 모델이 최고의 미스터리 글쓰기 모델이다'라는 결론보다 훨씬 더 타당합니다.

또한 특정 작가의 문체를 흉내 내도록 요청할 때는 주의해야 합니다. 진정으로 필요한 것이 특정한 작법 효과라면, 절제된 문장 구조, 면밀한 관찰, 혹은 건조한 유머처럼 그 효과를 직접 설명하고 해당 특성을 평가하세요. 그렇게 하면 작가의 이름을 신뢰할 수 있는 스타일 사양으로 취급하지 않고도, 실제로 원하는 글쓰기 선택 요소를 훨씬 더 명확하게 테스트할 수 있습니다.

시험을 통해 얻을 수 있는 유용한 결과는 수행된 작업, 프롬프트, 모델과 설정, 체크리스트, 결과물 근거, 그리고 시도해 본 수정 내역이 담긴 기록 그 자체입니다. 이러한 기록이 있으면 하나의 명확한 작업을 가장 잘 지원하는 모델을 선택할 수 있으며, 혹은 해당 장면을 직접 퇴고하는 데 시간을 쓰는 것이 더 낫다는 결정을 내릴 수도 있습니다.

관련 글

이 주제 더 살펴보기