Blog Metlivi

Como os roteiristas de jogos podem manter a voz de um personagem consistente quando os modelos de IA mudam?

Ao migrar os diálogos gerados de NPCs de um jogo para um modelo de IA diferente, trate a alteração como uma revisão de regressão editorial. Congele um brief de origem que separe o cânone, os fatos da cena e as regras de voz; execute ambos os modelos com os mesmos prompts variados; compare as saídas entre si e com o brief; depois, peça a um escritor para decidir o que revisar e se o candidato está pronto para o lançamento. Isso torna o desvio de personagem visível sem confundir cada mudança específica da cena com uma falha de voz.

27 de setembro de 20269 min de leituraLeitura, artes e culturaPor Metlivi Editorial Team
Seção 1

Congele o que o personagem sabe e como ele fala

Antes de testar, crie um brief de origem versionado para o personagem e a cena testada. Mantenha três tipos de informação distintos:

A distinção é importante porque uma resposta pode soar correta enquanto inventa conhecimento, ou preservar fatos enquanto soa como uma pessoa diferente. Uma revisão de migração deve identificar ambas as falhas e registrar qual tipo ocorreu.

Torne as regras de voz testáveis em vez de depender de rótulos como “espirituoso” ou “cauteloso”. Descreva o ritmo das frases (respostas curtas e secas ou mais longas e sinuosas), o vocabulário (formal, simples, especializado), os limites do humor (sobre o que brincam e o que evitam) e os limites de conhecimento (o que sabem, suspeitam ou não podem saber). Adicione alguns exemplos curtos e aprovados se eles esclarecerem uma regra, mas não deixe que os exemplos substituam as próprias regras.

Por exemplo, um capitão do porto ilustrativo pode falar em frases breves e práticas, usar termos náuticos apenas quando útil, provocar os frequentadores habituais sobre seus atrasos e evitar fazer piadas sobre uma balsa atrasada. Essas são pistas analisáveis. “Tem uma personalidade rude” não é.

Cânone: fatos estáveis sobre o personagem e o mundo, como seu nome, papel, história e relacionamentos.
Fatos da cena: o que aconteceu aqui, quem está presente, o que o personagem testemunhou e o que ele tem permissão para saber agora.
Regras de voz: maneiras recorrentes e observáveis pelas quais o personagem se expressa.
Seção 2

Construa um pequeno conjunto de cenas que teste diferentes pressões

Não julgue um modelo a partir de uma única saudação. Prepare prompts para situações conversacionais variadas usando o mesmo cânone, fatos da cena e instruções relevantes. Inclua pelo menos estas seis sondagens:

Estas são categorias diagnósticas, não uma referência de desempenho ou um tamanho de amostra prescrito. Escolha prompts concretos que se ajustem ao seu jogo e personagem. Por exemplo, uma sondagem de revelação pode dar ao capitão do porto um fato novo e testemunhado sobre um barco danificado; um prompt separado deve testar um boato que o capitão não verificou. Essa distinção pode revelar se o modelo compreende o limite de conhecimento tão bem quanto a voz.

Saudação: O personagem estabelece seu registro habitual e seu relacionamento com o jogador?
Correção: Quando o jogador afirma algo falso, o NPC corrige de acordo com o personagem e sem adicionar fatos sem suporte?
Incerteza: O personagem consegue dizer que não sabe, ou expressar uma suspeita fundamentada, em seu próprio estilo?
Pergunta repetida: Uma solicitação repetida produz uma resposta plausível sem perder a paciência, sem repetir palavra por palavra por padrão ou contradizer diálogos anteriores?
Revelação: Ao receber um novo fato da cena, o personagem reage apropriadamente sem alegar repentinamente conhecimento prévio?
Silêncio: Quando nenhuma resposta é necessária, o NPC permanece quieto ou responde minimamente se for isso o que a cena pede?
Seção 3

Mantenha os resultados antigos como material de comparação

Salve os prompts e os resultados do modelo atualmente lançado como uma linha de base. Registre o identificador do modelo e as configurações de geração relevantes junto a eles, bem como o brief exato e os fatos da cena utilizados. Se alguma dessas entradas mudar durante a migração, você precisará saber o que mudou antes de atribuir uma diferença ao modelo.

Os resultados antigos são material de comparação, não necessariamente a resposta ideal. Uma linha de base pode conter frases desajeitadas, fatos omitidos ou um problema de voz que a equipe já pretende corrigir. Marque os defeitos conhecidos e as variações intencionais aprovadas para que os revisores não tratem cada diferença como uma regressão. O brief define o objetivo; a linha de base ajuda a mostrar como o candidato se comporta sob as mesmas condições.

Seção 4

Altere uma variável por vez e registre o desvio

Execute o modelo candidato nos mesmos prompts de sondagem, com o mesmo brief de origem, fatos da cena e configurações de geração onde a configuração permitir. Mude o modelo enquanto mantém as outras entradas de teste inalteradas. Se você também revisar o prompt, a temperatura ou as restrições de diálogo, não saberá se a saída mudou por causa do modelo ou da outra edição. Quando uma configuração precisar ser diferente para o candidato, registre-a como uma alteração separada e compare com cuidado, em vez de alegar uma comparação controlada apenas de modelos.

Revise cada par de saídas em duas etapas. Primeiro verifique a continuidade: o NPC inventou uma memória, contradisse o cânone, revelou informações que não poderia saber ou deixou de usar um fato relevante da cena? Depois verifique a voz: o ritmo das frases, o vocabulário, os limites do humor e o nível de certeza permaneceram dentro das regras do personagem? Mantenha a correção do enredo separada da semelhança estilística; uma não deve ocultar a outra.

Um registro de desvios compacto pode usar estes campos:

Descreva evidências, não apenas impressões. “Genérico demais” é uma reação inicial útil, mas “usa uma explicação longa e formal, apesar da regra do brief exigir respostas curtas e práticas” dá ao escritor algo para avaliar.

Sondagem: A situação da cena e a versão exata do prompt
Saída candidata: A resposta completa sob revisão
Desvio: O problema específico observado, se houver
Categoria: Cânone, conhecimento da cena, ritmo, vocabulário, humor, incerteza ou outra pista definida
Evidência: A regra do brief ou o fato da cena relevante para o problema
Disposição: Decisão do escritor: aceitar, revisar, investigar ou bloquear o lançamento
Seção 5

Separe a voz do personagem da variação intencional da cena

Um personagem não deve apresentar a mesma cadência em todas as situações emocionais ou práticas. Um aviso urgente pode ser mais curto do que uma conversa casual; uma apresentação formal pode suprimir o humor; a incerteza pode levar a uma pergunta em vez de uma declaração confiante. Essas mudanças podem ser consistentes com o personagem quando a cena oferece um motivo para elas.

Para cada desvio aparente, pergunte: a cena justifica essa mudança, o brief a permite e o personagem permanece reconhecível em outras pistas? Se um NPC normalmente conciso der uma explicação mais longa para evitar um erro imediato, isso pode ser apropriado. Se o mesmo modelo rotineiramente transformar trocas curtas em discursos floreados sem motivo de cena, esse padrão merece revisão. Registre o motivo para aceitar uma variação intencional para que os revisores posteriores possam distingui-la de um desvio inexplicável.

Seção 6

Use a pesquisa como contexto, não como prova deste fluxo de trabalho

A pesquisa sobre diálogos fundamentados em personas oferece um contexto relevante, mas não valida exatamente este procedimento de migração. O estudo de 2025 de Pal e Traum compara a fusão inicial, a geração aumentada por recuperação (RAG) e abordagens baseadas em relevância em dois domínios ricos em personagens, usando medidas que incluem implicação (entailment), alinhamento de persona e alucinação. Os autores relatam equilíbrios e compensações distintos entre relevância, alinhamento e alucinações nas abordagens que estudaram. Essas descobertas apoiam a verificação de mais do que a semelhança superficial ao avaliar diálogos de personagens; elas não estabelecem como uma equipe de jogos deve realizar migrações de modelos. Leia o artigo de Pal e Traum no SIGDIAL 2025.

O artigo de Wang e colaboradores nas conclusões da conferência (Findings) do ACL 2026 examina o uso do conhecimento da persona em diálogos de dramatização mais longos e abertos e apresenta uma estrutura para diagnosticar várias etapas desse uso. Seu desafio declarado — sustentar a caracterização enquanto recupera e aplica o conhecimento da persona — torna os limites do conhecimento dignos de serem verificados junto à voz durante sessões de jogo estendidas. O artigo não testa o checklist de migração ou as seis sondagens de cena descritas aqui. Leia o artigo de Wang et al. no ACL 2026 Findings.

Seção 7

Deixe a decisão de lançamento para um escritor humano

Uma revisão útil termina com uma decisão editorial, não com uma pontuação sem explicação. Peça a um escritor para inspecionar a saída candidata, a linha de base, o brief e o registro de desvios. Ele pode decidir se uma saída é aceitável, se as regras de voz precisam de esclarecimento, se um prompt ou fato da cena precisa de revisão, ou se o candidato deve aguardar outra revisão.

Se a equipe editar o brief ou os prompts, preserve o registro de teste original e execute novamente as sondagens afetadas contra as entradas revisadas. Caso contrário, torna-se difícil dizer se uma melhoria aparente veio do modelo ou da alteração nas instruções. Mantenha as exceções aceitas vinculadas às suas condições de cena e mantenha os desvios não resolvidos visíveis para as pessoas responsáveis pela decisão de lançamento.

A sequência prática é simples: congele o objetivo, teste diferentes situações, compare semelhantes com semelhantes, documente desvios específicos e peça a um escritor para decidir. Isso ajuda as equipes a discutir a consistência do personagem com evidências compartilhadas, deixando espaço para que o personagem responda de forma diferente quando a história lhe dá um motivo.

Seção 8

Checklist de revisão de migração

Este checklist é um auxílio editorial para revisar uma mudança de modelo. Ele não garante diálogos idênticos nem substitui a aprovação humana e as próprias verificações de lançamento da equipe do jogo.

O cânone, o conhecimento da cena e as orientações de voz estão em um único brief versionado?
As pistas de voz são observáveis, incluindo ritmo, vocabulário, limites de humor e limites de conhecimento?
Os prompts cobrem saudação, correção, incerteza, repetição, revelação e silêncio?
As saídas antigas foram salvas com seus prompts, brief e configurações?
O teste do candidato mantém outras entradas estáveis, com quaisquer diferenças inevitáveis registradas?
As falhas de enredo ou conhecimento são registradas separadamente dos desvios de voz?
Um escritor revisou as evidências e registrou a decisão de lançamento?
Leituras relacionadas

Continue explorando o tema