Blog Metlivi

Pourquoi les scènes de groupe avec l'IA sont plus difficiles à coordonner que les discussions avec un seul personnage

Une discussion avec un seul personnage ne comporte qu'une seule voix et un seul fil conversationnel à suivre. Une scène avec plusieurs personnages générée par IA doit également déterminer qui parle ensuite, ce que sait chaque personnage, quelles répliques sont affichées et comment la situation partagée évolue. Pour rendre une scène de groupe cohérente, traitez ces éléments comme des tâches de coordination distinctes : établissez une règle de prise de parole, suivez les connaissances de chaque personnage, étiquetez chaque intervention de manière cohérente et enregistrez explicitement les évolutions importantes de l'histoire.

30 septembre 20267 min readLecture, arts et culturePar Metlivi Editorial Team
Section 1

Une scène de groupe implique plusieurs tâches conversationnelles

Dans un échange en tête-à-tête, le modèle peut généralement considérer le dernier message comme l'élément suivant auquel répondre. Dans une scène de groupe, un personnage peut s'adresser à quelqu'un d'autre que l'utilisateur, répondre à la question d'un autre personnage ou garder le silence pendant que la scène progresse. Choisir une réplique plausible n'est qu'une partie de la tâche ; le système doit également sélectionner l'interlocuteur et veiller à ce que l'on sache qui répond à qui.

Cette distinction apparaît dans la recherche sur le dialogue multipartite. Une étude sur le suivi des objectifs à plusieurs participants décrit des personnes qui partagent des objectifs, se répondent mutuellement et fournissent des informations sur les objectifs d'un autre intervenant — des interactions qui ne se déroulent pas de la même manière dans un dialogue à deux. Les auteurs rapportent également que cette tâche est restée difficile pour les modèles de langage qu'ils ont évalués. Cette conclusion concerne des conversations axées sur des tâches précises, mais elle illustre pourquoi l'ajout de participants modifie la structure du problème, et pas seulement le nombre de voix. Multi-party Goal Tracking with LLMs

Une méthode efficace pour planifier une scène consiste à distinguer trois décisions à chaque étape : ce qui vient de se passer, qui a une raison de répondre, et quelle réponse ferait progresser la scène commune. Si un personnage ne parle que pour occuper un tour de parole, le résultat ressemble souvent à un simple appel de présence. Si un personnage est autorisé à dominer chaque réplique, la scène risque de se réduire à nouveau à un échange avec un seul interlocuteur auquel sont rattachés des noms supplémentaires.

Section 2

L'ordre de prise de parole nécessite une règle que la scène peut suivre

Il n'existe pas d'ordre de parole universellement idéal pour chaque scène créative. Une rotation fixe est facile à anticiper et utile lorsque chaque personnage a besoin d'une occasion régulière de contribuer. Une sélection contextuelle peut paraître plus naturelle : un personnage parle lorsque l'action ou la question la plus récente lui en donne une raison évidente. Une séquence contrainte peut préserver une structure particulière, par exemple en permettant à un personnage de proposer un plan avant que les autres ne réagissent.

Les cadres d'agents multiples pour les discussions de groupe rendent ces distinctions explicites. La documentation d'AutoGen de Microsoft décrit des intervenants choisis par le modèle, des tours de rôle alternés et des fonctions de sélection personnalisables ; son sélecteur peut utiliser les noms des participants, leurs descriptions et l'historique de la conversation. La documentation mentionne également une option par défaut qui empêche le même participant de parler lors de tours consécutifs. Ce sont des choix d'orchestration et non des règles d'écriture, mais ils offrent une gamme d'options pratiques pour la conception de scènes. AutoGen Selector Group Chat

Pour une scène créative, définissez une règle de sélection simple en langage naturel avant la génération. Par exemple : « Laisser d'abord répondre la personne à qui l'on s'adresse directement. Sinon, choisir le personnage dont l'objectif établi ou l'action en cours est le plus pertinent. Ignorer toute personne qui n'a pas de réaction utile. Éviter d'accorder deux tours consécutifs à la même personne, sauf si elle termine une action. » Il s'agit d'une suggestion de règle de conception, et non d'une garantie infaillible. Son intérêt est de donner au système une raison de choisir un intervenant plutôt que de s'en remettre à une rotation arbitraire.

Section 3

Les connaissances des personnages doivent être suivies séparément

Une scène partagée ne signifie pas que chaque personnage doit connaître chaque détail. Un personnage a pu voir une note, un autre n'a peut-être entendu qu'une explication partielle, et un troisième n'est peut-être pas encore arrivé. Si le processus d'écriture ne conserve qu'un unique historique de conversation indifférencié, un modèle peut facilement traiter un fait mentionné n'importe où dans le fil de discussion comme une connaissance commune à l'ensemble des protagonistes.

Utilisez un registre simple des connaissances en complément du résumé de la scène. Pour chaque fait important, notez qui le sait et comment il l'a appris. Distinguez bien les informations incertaines des informations confirmées : « Mira soupçonne que l'enveloppe est adressée à Jo » n'équivaut pas à « Mira a lu l'enveloppe ». Avant une réplique, comparez le personnage censé parler avec ce registre. S'il ne dispose pas de l'information, il peut poser une question, observer, deviner ou rester ignorant ; il ne doit pas l'énoncer comme s'il s'agissait d'un fait qu'il connaît.

La recherche sur la poursuite d'histoires basée sur les personnages identifie la cohérence du personnage, les relations entre protagonistes et la progression logique de l'intrigue comme des défis connexes. L'étude intègre des informations sur les relations entre personnages dans le contexte de l'histoire et indique que cela a amélioré la précision de la suite du récit par rapport aux modèles de référence. Elle n'établit pas de méthode universelle pour suivre les connaissances dans chaque scène générée par IA, mais elle soutient un principe de conception plus large : le contexte interpersonnel fait partie de l'état de la scène, et non d'une biographie décorative. Telling Stories through Multi-User Dialogue by Modeling Character Relations

Section 4

Les étiquettes d'identification des interlocuteurs font partie intégrante du sens

Les noms placés à côté des dialogues peuvent sembler n'être qu'une question de mise en forme, mais une attribution correcte aide à préserver la fluidité de la conversation. Une réplique change de signification selon la personne qui la prononce : une question posée par l'hôte peut inviter à une réponse, tandis que la même question posée par un visiteur peut marquer une hésitation ou une contestation. Si les attributions se brouillent, les lecteurs ne peuvent plus savoir de manière fiable qui a remarqué un événement, qui a fait une promesse ou qui répond à qui.

Une étude sur la classification des actes de dialogue multipartites prenant en compte l'interlocuteur explicite ce lien : elle soutient que le fait de savoir qui a parlé aide à comprendre l'intention de la réplique en contexte, et que la modélisation des interactions devient plus difficile à mesure que le nombre d'interlocuteurs augmente. Les chercheurs testent des méthodes qui représentent le comportement de l'interlocuteur dans le contexte conversationnel local. Il s'agit de travaux sur la compréhension du dialogue plutôt que d'une évaluation d'écriture créative, mais ils soulignent pourquoi une attribution d'interlocuteur stable constitue une information structurelle. Who Is Speaking? Speaker-Aware Multiparty Dialogue Act Classification

Conservez l'identité de l'interlocuteur sous forme de données structurées aussi longtemps que possible, puis affichez-la sous forme d'étiquette visible. Utilisez un seul nom canonique par personnage et évitez d'alterner de façon désordonnée entre surnom, titre et prénom si cela risque d'induire en erreur quant à l'attribution. Séparez également la narration des dialogues. Une ligne telle que Mira : « Je l'ai laissé près de la porte. » attribue clairement à Mira à la fois la parole et l'affirmation ; une réplique sans auteur assigné intégrée dans une scène dense est source d'ambiguïté.

Section 5

L'état partagé de l'histoire nécessite des mises à jour explicites

Les personnages peuvent se souvenir de ce qui s'est produit, mais la scène nécessite aussi un état condensé de ce qui est désormais vrai. Après un moment clé, mettez à jour des éléments concrets tels que le lieu, les personnes présentes, l'objet déplacé, la décision prise et ce qui reste en suspens. Considérez cela comme un registre d'événements observables plutôt que comme un long compte rendu des dialogues.

C'est important car une scène de groupe comprend plusieurs points de vue sur une même suite d'actions. L'affirmation d'une personne peut être erronée, une autre peut la corriger, et une troisième peut agir avant d'avoir entendu l'une ou l'autre. Le fait d'enregistrer le résultat séparément des répliques prononcées évite d'ériger chaque affirmation en vérité absolue. Une mention utile pourrait être : « La clé est sur le comptoir de la cuisine ; Jo l'y a posée. Mira ne l'a pas vue. » Cette seule mise à jour englobe l'état partagé du monde et la limite de connaissance individuelle.

La documentation sur l'orchestration des discussions de groupe décrit la synchronisation de l'historique des conversations entre les participants avant chaque tour, ainsi que la diffusion de chaque réponse pour que les autres puissent utiliser le contexte mis à jour. Cette approche technique offre une analogie utile pour la fiction : les participants ont besoin d'accéder au compte rendu de la scène actuelle, mais le champ de connaissances de chaque personnage doit conserver ses propres limites. Microsoft Agent Framework: Group Chat Orchestration

Section 6

Une étape de coordination pratique avant la rédaction

Avant de générer une scène, rédigez quatre courtes notes : la liste des personnages et l'objectif immédiat de chacun ; la situation partagée actuelle ; un registre des connaissances pour les faits que tout le monde ne connaît pas ; et la règle de sélection du prochain intervenant. Pendant la rédaction, vérifiez chaque réplique par rapport à ces notes. Après la rédaction, repérez les erreurs d'attribution d'interlocuteur, les connaissances non justifiées, les tours de parole répétés sans raison et les changements dans la scène qui n'ont jamais été consignés.

Par exemple, supposons que trois amis choisissent l'itinéraire à emprunter dans un marché de fin de semaine. L'un d'eux a remarqué qu'un stand d'artisanat allait bientôt fermer ; un autre compare les files d'attente pour la nourriture ; le troisième n'a encore vu aucun de ces deux panneaux. Le premier personnage peut mentionner la fermeture du stand, le deuxième peut peser cela face à la file d'attente, et le troisième peut demander ce qu'il a manqué. Si le troisième mentionne immédiatement le panneau sans qu'on le lui ait dit ou sans l'avoir vu, le registre des connaissances met en évidence l'erreur de continuité. Il s'agit d'un scénario explicatif et non d'une expérience documentée.

La différence fondamentale réside dans la coordination : les répliques avec un seul personnage poursuivent essentiellement un échange unique, tandis que les scènes de groupe doivent maintenir en parallèle la cohérence des tours de parole, des identités, des connaissances et des événements partagés. Séparer ces responsabilités permet de créer plus facilement des scènes vivantes, sans forcer chaque personnage à s'exprimer à chaque réplique ni attribuer les mêmes informations à tout le monde.

À lire aussi

Continuer sur ce thème