캐릭터 카드가 길어지면 챗봇 캐릭터의 일관성이 더 높아질까?
캐릭터 카드가 길어진다고 해서 챗봇 캐릭터가 저절로 더 그럴듯하게 느껴지는 것은 아닙니다. 장면에 활용할 수 있는 관련성 높고 일관된 지침을 모델에 제공할 때는 추가적인 세부 사항이 도움이 되지만, 반복, 무관한 사실 또는 모순은 캐릭터를 일관되게 묘사하는 것을 더 어렵게 만들 수 있습니다. 카드를 확장할지 결정하려면 동일한 장면에서 간결한 버전과 상세한 버전을 비교한 다음 일관성, 어조, 그럴듯한 선택을 개별적으로 검토해 보세요.
캐릭터 카드는 어떤 역할을 해야 할까?
카드는 대화 중에 실질적인 질문에 답하는 데 도움이 될 때 유용합니다. 캐릭터가 원하는 것은 무엇인가? 주로 어떤 방식으로 말하는가? 무엇을 알고 있으며, 불확실한 상황에서는 어떻게 반응하는가? 이러한 선택을 안내하는 세부 정보는 대화에 전혀 영향을 미치지 않는 시시한 잡학 지식보다 훨씬 명확한 역할을 수행합니다.
“앤티크 단추를 수집한다”와 “앤티크 단추를 수집하며, 어색함을 느낄 때 물건을 이용해 대화를 시작한다”의 차이를 생각해 보세요. 전자는 단순한 사실입니다. 후자는 장면에서 드러날 수 있는 행동을 시사합니다. 둘 중 어느 것도 무조건 가치 있는 것은 아닙니다. 캐릭터가 관련된 순간을 마주치지 않는다면 그 사실은 상호작용을 개선하지 못할 수도 있습니다.
그럴듯함은 프로필 속 사실을 기억해 내는 것 이상의 문제입니다. 캐릭터가 올바른 고향을 언급하면서도 판에 박힌 말투를 쓸 수도 있고, 독특한 어조를 유지하면서도 자신이 명시한 우선순위와 상충하는 선택을 내릴 수도 있습니다. 사실의 연속성, 어조, 행동을 서로 연관되어 있지만 구별되는 특성으로 다루어야 합니다.
연구가 알려줄 수 있는 것과 알려줄 수 없는 것
2025년 연구인 [“원칙적인 페르소나(Principled Personas)”](https://aclanthology.org/2025.emnlp-main.1364/)는 언어 모델의 작업 수행 전반에서 전문가 페르소나 프롬프트를 평가합니다. 이 연구는 평가 목표 중 하나로 무관한 페르소나 속성에 대한 강건성과 페르소나 속성에 대한 충실도를 명시하며, 무관한 세부 정보가 성능에 영향을 미칠 수 있다고 보고합니다. 이는 추가된 모든 사실이 무해하다고 가정해서는 안 되는 이유가 됩니다. 하지만 이 연구는 전문가 페르소나와 작업 수행을 다루고 있으며, 가상 캐릭터 카드의 길고 짧음을 비교하거나 최적의 카드 길이를 규정하지는 않습니다.
2026년 논문인 [“질의응답 데이터로 학습된 캐릭터 진정성 대화 모델의 다차원 평가(Multi-dimensional Evaluation of Character-Authentic Dialogue Models Learned from Question-Answer Data)”](https://aclanthology.org/2026.lrec-1.209/)는 재현성, 다양성, 환각, 캐릭터 진정성 등의 차원을 사용하여 캐릭터 대화 접근 방식을 평가합니다. 이 논문은 학습 접근 방식과 대화 품질 간의 트레이드오프를 보고합니다. 이는 캐릭터 묘사를 둘 이상의 차원에서 평가해야 한다는 점을 뒷받침합니다. 다만 프롬프트 카드의 길이에 관한 실험이 아니므로, 카드가 길어질수록 진정성이 향상된다는 점을 증명하지는 못합니다.
종합해 보면, 이러한 자료들은 세부 정보가 관련성이 있는지, 어떤 품질을 측정하고 있는지와 같은 유용한 질문을 던져줍니다. 그러나 보편적인 단어 수를 제시하거나 특정 카드 작성 공식이 모든 모델이나 캐릭터에 작동한다고 입증하지는 않습니다.
간결한 카드 예시
의도적으로 짧게 작성한 가상 카드 예시입니다:
**마라 베일(Mara Vale)**은 한담보다 실용적인 질문을 선호하는 참을성 있고 관찰력이 뛰어난 시계 수리공이다. 그녀는 짧고 정확한 문장으로 말하며 건조한 유머를 드물게 구사한다. 그녀는 작고한 스승의 공방을 계속 운영하고 싶어 한다. 확신이 서지 않을 때는 솔직히 밝히고 수리를 제안하기 전에 시계를 먼저 살펴보겠다고 요청한다. 그녀는 시계 메커니즘을 잘 알지만, 손님이 직접 말해주지 않는 한 손님의 내력은 알지 못한다.
이 카드는 역할, 동기, 어조, 반응 패턴, 지식의 경계를 다룹니다. 이러한 요소들은 장면 속에서 테스트해 볼 수 있습니다. 이 길이는 예시일 뿐, 이상적인 단어 수로 권장하는 것이 아닙니다. 만약 어떤 장면에서 빠진 세부 정보(예: 마라가 자신의 능력을 벗어난 수리를 마주했을 때 어떻게 반응하는지)가 드러난다면, 장황한 전기적 사실 대신 구체적인 행동을 추가할 수 있습니다.
모든 문장에 대해 던져볼 수 있는 유용한 퇴고 질문은 다음과 같습니다: “이 내용이 카드에 포함됨으로써 캐릭터가 다르게 말하거나, 알게 되거나, 행동해야 하는 부분은 무엇인가?” 타당한 답이 나오지 않는다면 그 세부 정보는 장식적인 것에 불과할 수 있습니다. 장식적인 사실도 창작 의도의 일부일 수는 있지만, 캐릭터가 더 일관되게 행동할 것이라는 근거로 오인해서는 안 됩니다.
통제된 A/B 테스트 진행하기
공정한 비교를 위해서는 주변 환경이 아닌 카드만을 변경해야 합니다. 다음과 같은 간단한 순서를 활용해 보세요:
다섯 가지 캐릭터 특성을 개별적으로 검토하기
두 카드 버전의 모든 응답에 대해 동일한 다섯 가지 질문을 적용합니다.
검토 메모 해석하기
이러한 평가는 편집을 돕기 위한 도구일 뿐, 과학적으로 검증된 척도가 아닙니다. 실질적으로 가능하다면 검토자가 어떤 카드로 생성되었는지 모른 채 응답을 비교하게 하세요. 그렇게 하면 작성하는 데 더 많은 시간을 들인 버전을 편애하려는 유혹을 줄일 수 있습니다. 결과가 단순한 점수에 그치지 않도록 각 평가 점수를 설명하는 짧은 메모를 남겨두세요.
더 추가하기 전에 비교 결과 해석하기
B 버전이 다른 차원을 약화시키지 않으면서 여러 장면에 걸쳐 특정 차원을 향상시킨다면, 그에 기여한 것으로 보이는 세부 정보를 유지하세요. 만약 사실 기억력만 향상되고 대화가 뻣뻣해진다면, 이 캐릭터에게 사실 기억과 자연스러운 장면 반응 중 어느 것이 더 중요한지 결정해야 합니다. 두 버전이 비슷해 보인다면, 추가된 내용이 해당 장면에서는 유용한 역할을 하지 못하고 있는 것일 수 있습니다. 그렇다고 다른 곳에서도 결코 중요하지 않을 것이라는 뜻은 아닙니다.
결과가 엇갈린다면 지침에 중복이나 상충되는 부분이 없는지 점검하세요. 예를 들어 '항상 간결하게 답할 것'과 '모든 생각을 자세히 묘사할 것'은 상충되는 스타일 신호를 줍니다. 마찬가지로 방대한 과거 이력도 어떤 경험이 현재의 행동을 형성하는지 카드가 명확히 밝히지 않는다면 적용하기 어려울 수 있습니다. 충돌하는 내용을 구체적인 우선순위로 다시 작성하거나, 묘사에 도움이 되지 않는 세부 정보를 제거하세요.
캐릭터가 중요한 사실에서 실수를 범한다면, 해당 사실을 찾기 쉽게 만들고 그 경계를 명확하게 명시하세요. 어조가 평범하게 느껴진다면 관찰 가능한 말투 패턴을 추가하고 대화에서 테스트해 보세요. 판단이 일관되지 않게 느껴진다면 캐릭터의 목표와 그 목표가 도전을 받았을 때 어떻게 반응하는지를 명확히 하세요. 각 수정은 특정한 약점을 겨냥해야 합니다. 전기를 무분별하게 추가하면 무엇이 개선에 기여했는지 파악하기 어려워집니다.
언제 카드를 더 길게 만들어야 할까?
반복되는 장면에서 의미 있는 공백이 드러날 때 카드를 확장하세요. 예를 들어 캐릭터의 동기가 불분명하거나, 지식의 경계가 빠져 있거나, 반복되는 상황에 대한 반응 지침이 없을 때입니다. 추가하는 내용은 테스트할 수 있을 만큼 구체적으로 유지하세요. 그런 다음 동일한 장면을 다시 실행하여 새로운 모순이 생기거나 반응성이 떨어지지 않으면서 의도한 품질이 향상되는지 확인합니다.
인용된 연구 어디에도 보편적으로 '신뢰할 수 있는 카드 길이'에 대한 증거는 없습니다. 간결한 카드로도 여러분이 중요하게 생각하는 장면들을 일관되게 이끌어낼 수 있다면 충분합니다. 더 긴 카드는 추가된 세부 정보가 유의미한 선택을 변화시킬 때 유용할 수 있습니다. 프로필의 단어 수가 아니라, 안정적인 예시 전반에서 캐릭터가 어떻게 행동하는지를 보고 결과를 판단하세요.
이러한 비교는 선택된 조건에서 캐릭터 카드를 평가하는 데 도움이 되지만, 모든 대화, 모델 또는 환경에서 카드가 동일하게 작동할 것임을 보장하지는 않습니다. 묘사가 캐릭터와 의도한 경험에 부합하는지는 궁극적으로 사람 에디터가 판단해야 합니다.
