Blog de Metlivi

¿Cómo pueden los guionistas de videojuegos mantener coherente la voz de un personaje al cambiar de modelo de IA?

Al migrar los diálogos generados de los PNJ de un juego a un modelo de IA diferente, trate el cambio como una revisión de regresión editorial. Fije una ficha de referencia que separe el canon, los hechos de la escena y las reglas de voz; ejecute ambos modelos con los mismos prompts variados; compare sus resultados entre sí y con la ficha; y luego haga que un escritor decida qué revisar y si el candidato está listo para su lanzamiento. Esto hace visible la desviación del personaje sin confundir cada cambio específico de la escena con un fallo en la voz.

27 de septiembre de 20269 min de lecturaLectura, arte y culturaPor Metlivi Editorial Team
Sección 1

Fije lo que el personaje sabe y cómo habla

Antes de realizar las pruebas, cree una ficha de referencia versionada para el personaje y la escena evaluada. Mantenga diferenciados tres tipos de información:

La distinción es importante porque una respuesta puede sonar adecuada mientras inventa información, o preservar los hechos mientras suena como una persona diferente. Una revisión de migración debe detectar ambos fallos y registrar cuál de ellos ocurrió.

Haga que las reglas de voz sean comprobables en lugar de depender de etiquetas como «ingenioso» o «reservado». Describa el ritmo de las oraciones (respuestas cortas y directas o frases más largas y sinuosas), el vocabulario (formal, sencillo, especializado), los límites del humor (de qué bromean y qué evitan) y los límites de conocimiento (lo que saben, sospechan o no pueden saber). Añada algunos ejemplos breves aprobados si aclaran una regla, pero no permita que los ejemplos sustituyan a las reglas mismas.

Por ejemplo, un capitán de puerto ilustrativo podría hablar en oraciones breves y prácticas, usar términos náuticos solo cuando sea útil, burlarse de los clientes habituales por su tardanza y evitar bromear sobre el retraso de un ferry. Esas son pautas evaluables. «Tiene una personalidad curtida» no lo es.

Canon: hechos estables sobre el personaje y el mundo, como su nombre, rol, historia y relaciones.
Hechos de la escena: qué ha sucedido aquí, quién está presente, qué ha presenciado el personaje y qué se le permite saber ahora.
Reglas de voz: formas recurrentes y observables en las que el personaje se expresa.
Sección 2

Construya un conjunto reducido de escenas que evalúe diferentes situaciones de presión

No juzgue un modelo a partir de un solo saludo. Prepare prompts para situaciones conversacionales variadas utilizando el mismo canon, los hechos de la escena y las instrucciones pertinentes. Incluya al menos estas seis pruebas:

Estas son categorías de diagnóstico, no una prueba de rendimiento ni un tamaño de muestra obligatorio. Elija prompts concretos que se adapten a su juego y personaje. Por ejemplo, una prueba de revelación puede proporcionarle al capitán de puerto un hecho nuevo y presenciado sobre un barco dañado; un prompt independiente debería evaluar un rumor que el capitán no ha verificado. Esa distinción puede revelar si el modelo comprende el límite de conocimiento además de la voz.

Saludo: ¿Establece el personaje su registro habitual y su relación con el jugador?
Corrección: Cuando el jugador afirma algo falso, ¿el PNJ lo corrige manteniendo su personalidad y sin añadir hechos no fundamentados?
Incertidumbre: ¿Puede el personaje decir que no sabe algo, o expresar una sospecha delimitada, con su propio estilo?
Pregunta repetida: ¿Una petición reiterada produce una respuesta verosímil sin perder la paciencia, sin repetirse textualmente por defecto o sin contradecir diálogos anteriores?
Revelación: Al recibir un hecho nuevo de la escena, ¿reacciona el personaje adecuadamente sin fingir repentinamente un conocimiento previo?
Silencio: Cuando no se justifica ninguna respuesta, ¿el PNJ permanece en silencio o responde de forma mínima si eso es lo que exige la escena?
Sección 3

Conserve los resultados antiguos como material de comparación

Guarde los prompts y las respuestas del modelo actualmente en producción como línea base. Registre junto a ellos el identificador del modelo y los ajustes de generación relevantes, así como la ficha exacta y los hechos de la escena utilizados. Si alguna de esas entradas cambia durante la migración, necesitará saber qué cambió antes de atribuir una diferencia al modelo.

Los resultados antiguos son material de comparación, no automáticamente la respuesta ideal. Una línea base puede contener frases poco naturales, hechos omitidos o un problema de voz que el equipo ya planea corregir. Marque los defectos conocidos y las variaciones intencionadas aprobadas para que los revisores no traten cada diferencia como una regresión. La ficha define el objetivo; la línea base ayuda a mostrar cómo se comporta el candidato bajo las mismas condiciones.

Sección 4

Cambie una variable a la vez y registre la desviación

Ejecute el modelo candidato con los mismos prompts de prueba, con la misma ficha de referencia, hechos de escena y ajustes de generación siempre que la configuración lo permita. Cambie el modelo manteniendo constantes las demás variables de prueba. Si también modifica el prompt, la temperatura o las restricciones del diálogo, no sabrá si la respuesta cambió debido al modelo o a la otra modificación. Cuando un ajuste deba diferir para el candidato, regístrelo como un cambio independiente y compárelo cuidadosamente en lugar de afirmar que se trata de una comparación controlada y exclusiva del modelo.

Revise cada par de respuestas en dos pasadas. Primero compruebe la continuidad: ¿el PNJ inventó un recuerdo, contradijo el canon, reveló información que no podía saber o no utilizó un hecho relevante de la escena? Luego compruebe la voz: ¿se mantuvieron el ritmo de las oraciones, el vocabulario, los límites del humor y el nivel de certeza dentro de las reglas del personaje? Mantenga separada la coherencia de la trama de la semejanza estilística; una no debe ocultar a la otra.

Un registro compacto de desviaciones puede utilizar los siguientes campos:

Describa la evidencia, no solo las impresiones. «Demasiado genérico» es una reacción inicial útil, pero «utiliza una explicación larga y formal a pesar de la regla de la ficha que exige respuestas breves y prácticas» proporciona al escritor algo concreto para evaluar.

Prueba: La situación de la escena y la versión exacta del prompt
Resultado del candidato: La respuesta completa sujeta a revisión
Desviación: El problema específico observado, si lo hubiera
Categoría: Canon, conocimiento de la escena, ritmo, vocabulario, humor, incertidumbre u otra pauta definida
Evidencia: La regla de la ficha o el hecho de la escena relevante para el problema
Disposición: Decisión del escritor: aceptar, revisar, investigar o bloquear el lanzamiento
Sección 5

Separe la voz del personaje de la variación intencionada de la escena

Un personaje no debería expresarse con la misma cadencia en cada situación práctica o emocional. Una advertencia urgente puede ser más corta que una conversación casual; una presentación formal puede suprimir el humor; la incertidumbre puede dar lugar a una pregunta en lugar de a una declaración categórica. Estos cambios pueden ser coherentes con el personaje cuando la escena ofrece un motivo para ellos.

Para cada aparente desviación, pregúntese: ¿justifica la escena este cambio, lo permite la ficha y sigue siendo reconocible el personaje a través de otras pautas? Si un PNJ normalmente conciso ofrece una explicación más larga para evitar un error inmediato, puede ser apropiado. Si el mismo modelo convierte habitualmente intercambios breves en discursos recargados sin motivo en la escena, ese patrón merece una revisión. Registre el motivo para aceptar una variación intencionada, de modo que los revisores posteriores puedan distinguirla de un cambio involuntario e inexplicable.

Sección 6

Utilice la investigación como contexto, no como prueba de este flujo de trabajo

La investigación sobre el diálogo fundamentado en personajes ofrece un contexto relevante, pero no valida este procedimiento de migración exacto. El estudio de 2025 de Pal y Traum compara la fusión temprana, la generación aumentada por recuperación (RAG) y los enfoques basados en relevancia en dos dominios con gran peso de personajes, utilizando métricas que incluyen la implicación lógica, la alineación con la personalidad y la alucinación. Los autores señalan ventajas y desventajas claras entre relevancia, alineación y alucinaciones en los enfoques estudiados. Esos hallazgos respaldan la necesidad de comprobar algo más que la apariencia superficial al evaluar el diálogo de un personaje; no establecen cómo debe un equipo de desarrollo llevar a cabo las migraciones de modelos. Lea el artículo de Pal y Traum de SIGDIAL 2025.

El artículo de Wang y colaboradores en ACL 2026 Findings examina el uso del conocimiento del personaje en diálogos de rol abiertos y más prolongados, y presenta un marco para diagnosticar varias etapas de ese uso. El desafío expuesto —mantener la caracterización mientras se recupera y aplica el conocimiento del personaje— hace que valga la pena verificar los límites de conocimiento junto con la voz durante partidas extensas. El artículo no pone a prueba la lista de control de migración ni las seis pruebas de escena descritas aquí. Lea el artículo de Wang et al. en ACL 2026 Findings.

Sección 7

Permita que un escritor humano tome la decisión de lanzamiento

Una revisión útil concluye con una decisión editorial, no con una puntuación sin explicar. Haga que un escritor examine la respuesta candidata, la línea base, la ficha y el registro de desviaciones. Podrá decidir si una respuesta es aceptable, si las reglas de voz necesitan aclaración, si un prompt o un hecho de la escena requiere revisión, o si el candidato debe esperar a otra revisión.

Si el equipo edita la ficha o los prompts, conserve el registro de prueba original y vuelva a ejecutar las pruebas afectadas con las entradas revisadas. De lo contrario, resultará difícil saber si una aparente mejora provino del modelo o de la modificación de las instrucciones. Mantenga las excepciones aceptadas vinculadas a las condiciones de su escena y conserve las desviaciones no resueltas visibles para las personas responsables de dar luz verde al lanzamiento.

La secuencia práctica es sencilla: fije el objetivo, ponga a prueba diferentes situaciones, compare elementos equivalentes en igualdad de condiciones, documente las desviaciones específicas y pida a un escritor que decida. Ayuda a los equipos a debatir la coherencia de los personajes a partir de pruebas compartidas, sin dejar de dar espacio para que un personaje responda de forma distinta cuando la historia le proporciona un motivo.

Sección 8

Lista de control para la revisión de la migración

Esta lista de control es una ayuda editorial para revisar un cambio de modelo. No garantiza diálogos idénticos ni sustituye la aprobación humana ni las comprobaciones de lanzamiento propias del equipo del juego.

¿Están el canon, el conocimiento de la escena y las pautas de voz en una única ficha versionada?
¿Son observables las pautas de voz, incluidos el ritmo, el vocabulario, los límites del humor y los límites de conocimiento?
¿Abarcan los prompts el saludo, la corrección, la incertidumbre, la repetición, la revelación y el silencio?
¿Se han guardado las respuestas antiguas con sus respectivos prompts, ficha y ajustes?
¿Mantiene la prueba del candidato las demás entradas fijas, registrando cualquier diferencia inevitable?
¿Se registran los fallos de trama o de conocimiento de forma independiente a las desviaciones de voz?
¿Ha revisado un escritor las evidencias y registrado la decisión de lanzamiento?
Lecturas relacionadas

Sigue explorando este tema