Metlivi Blog

Warum KI-Gruppenszenen schwerer zu koordinieren sind als Chats mit einzelnen Charakteren

Ein Chat mit einem einzelnen Charakter hat eine Stimme und einen Gesprächsfaden, dem gefolgt werden muss. Eine KI-Szene mit mehreren Charakteren muss zusätzlich entscheiden, wer als Nächstes spricht, was jeder Charakter weiß, wessen Worte gezeigt werden und wie sich die gemeinsame Situation verändert. Um eine Gruppenszene kohärent zu gestalten, sollten Sie dies als separate Koordinationsaufgaben betrachten: Legen Sie eine Sprechregel fest, verfolgen Sie das Wissen nach Charakteren, kennzeichnen Sie jeden Redebeitrag einheitlich und halten Sie wichtige Handlungsänderungen explizit fest.

30. September 20267 min readLesen, Kunst & KulturVon Metlivi Editorial Team
Abschnitt 1

Eine Gruppenszene hat mehr als eine Gesprächsaufgabe

In einem 1:1-Austausch kann das Modell die letzte Nachricht üblicherweise als den nächsten Punkt behandeln, auf den es antworten muss. In einer Gruppenszene kann sich ein Charakter an jemand anderen als die Nutzerin oder den Nutzer wenden, die Frage eines anderen Charakters beantworten oder schweigen, während die Szene weitergeht. Die Wahl einer plausiblen Replik ist nur ein Teil der Aufgabe; das System muss auch den Sprecher auswählen und festhalten, wer auf wen reagiert.

Diese Unterscheidung zeigt sich in der Forschung zu Mehrparteiendialogen. Eine Studie zum Goal-Tracking mit mehreren Parteien beschreibt Personen, die gemeinsame Ziele verfolgen, einander antworten und Informationen über die Ziele anderer Teilnehmender liefern – Interaktionen, die in einem Zweiparteiendialog so nicht vorkommen. Die Autoren berichten zudem, dass diese Aufgabe für die von ihnen evaluierten Sprachmodelle eine Herausforderung blieb. Dieser Befund bezieht sich zwar auf aufgabenorientierte Gespräche, veranschaulicht aber, warum zusätzliche Teilnehmende die Struktur des Problems verändern und nicht nur die Anzahl der Stimmen. Multi-party Goal Tracking with LLMs

Ein nützlicher Weg zur Planung einer Szene besteht darin, bei jedem Takt drei Entscheidungen zu unterscheiden: Was ist gerade passiert, wer hat einen Grund zu reagieren und welche Reaktion würde die gemeinsame Szene voranbringen. Wenn ein Charakter nur spricht, weil der Redebeitrag gefüllt werden muss, wirkt das Ergebnis oft wie ein bloßes Durchzählen von Anwesenheiten. Wenn ein einzelner Charakter jeden Takt dominieren darf, kann die Szene wieder zu einem 1:1-Austausch mit bloß angehängten zusätzlichen Namen zusammenfallen.

Abschnitt 2

Die Reihenfolge des Sprechens braucht eine Regel, der die Szene folgen kann

Es gibt keine allgemeingültige beste Reihenfolge der Redebeiträge für jede kreative Szene. Eine feste Rotation ist leicht vorhersehbar und nützlich, wenn jeder Charakter eine regelmäßige Gelegenheit für einen Beitrag benötigt. Eine kontextbezogene Auswahl kann lebendiger und reaktiver wirken: Ein Charakter spricht, wenn die jüngste Handlung oder Frage ihm einen klaren Anlass dazu gibt. Eine eingeschränkte Abfolge kann eine bestimmte Struktur absichern, etwa indem ein Charakter zuerst einen Plan vorschlagen darf, bevor andere darauf reagieren.

Frameworks für Multi-Agenten-Gruppenchats machen diese Unterscheidungen explizit. Die Dokumentation von Microsofts AutoGen beschreibt modellbasierte Sprecherauswahlen, Round-Robin-Runden und anpassbare Auswahlfunktionen; der Selektor kann dabei Namen von Teilnehmenden, Beschreibungen und den bisherigen Gesprächsverlauf nutzen. Die Dokumentation weist zudem auf eine Standardoption hin, die verhindert, dass derselbe Teilnehmer in aufeinanderfolgenden Beiträgen spricht. Dabei handelt es sich um Orchestrierungsentscheidungen und nicht um Erzählregeln, aber sie bieten eine praktische Auswahl für das Szenendesign. AutoGen Selector Group Chat

Definieren Sie für eine kreative Szene vor der Generierung eine kurze Auswahlregel in natürlicher Sprache. Zum Beispiel: „Lass die direkt angesprochene Person zuerst antworten. Wähle andernfalls den Charakter, dessen festgelegtes Ziel oder aktuelle Handlung am relevantesten ist. Überspringe jeden, der keine nützliche Reaktion beizutragen hat. Vermeide es, einer Person zwei Redebeiträge hintereinander zu geben, es sei denn, sie schließt gerade eine Handlung ab.“ Dies ist eine empfohlene Gestaltungsregel, keine gemessene Garantie. Ihr Wert liegt darin, dass sie dem System einen logischen Grund zur Sprecherauswahl gibt, anstatt sich auf eine willkürliche Rotation zu verlassen.

Abschnitt 3

Das Wissen der Charaktere muss getrennt erfasst werden

Eine gemeinsame Szene bedeutet nicht, dass jeder Charakter jede Tatsache kennen sollte. Ein Charakter hat vielleicht eine Notiz gesehen, ein anderer hat nur eine unvollständige Erklärung gehört und ein dritter ist womöglich noch gar nicht eingetroffen. Wenn der Schreibprozess nur einen einzigen, undifferenzierten Gesprächsverlauf speichert, kann ein Modell eine irgendwo im Chat erwähnte Tatsache leicht als allgemeines Wissen für das gesamte Ensemble behandeln.

Nutzen Sie neben der Szenenzusammenfassung ein einfaches Wissensverzeichnis. Halten Sie für jede wichtige Tatsache fest, wer sie weiß und wie er oder sie davon erfahren hat. Unterscheiden Sie ungewisse Informationen klar von bestätigten Informationen: „Mira vermutet, dass der Umschlag an Jo adressiert ist“ ist nicht gleichbedeutend mit „Mira hat den Umschlag gelesen.“ Gleichen Sie den vorgeschlagenen Sprecher vor einem Redebeitrag mit diesem Verzeichnis ab. Fehlt ihm die Information, kann er fragen, beobachten, raten oder unwissend bleiben; er sollte sie jedoch nicht als etwas darstellen, das er weiß.

Die Forschung zur charaktergesteuerten Fortsetzung von Geschichten nennt Personakonsistenz, Charakterbeziehungen und logische Handlungsfortschritte als miteinander verbundene Herausforderungen. Die Studie fügt Informationen über Charakterbeziehungen in den Kontext der Geschichte ein und berichtet, dass dies die Genauigkeit der Weiterführung der Geschichte gegenüber ihren Baselines verbessert hat. Sie legt zwar keine universelle Methode zur Wissensverfolgung für jede KI-Szene fest, stützt jedoch ein breiteres Gestaltungsprinzip: Der Kontext von Charakter zu Charakter ist Teil des Szenenstatus und keine bloß dekorative Biografie. Telling Stories through Multi-User Dialogue by Modeling Character Relations

Abschnitt 4

Sprecherbezeichnungen sind Teil der Bedeutung

Namen neben dem Dialog mögen wie reine Formatierung aussehen, aber eine korrekte Zuordnung hilft, den Gesprächsfluss aufrechtzuerhalten. Eine Zeile ändert ihre Bedeutung je nachdem, wer sie ausspricht: Eine Frage des Gastgebers lädt möglicherweise zu einer Antwort ein, während dieselbe Frage eines Besuchers Unsicherheit oder einen Widerspruch signalisieren kann. Wenn Bezeichnungen ungenau werden, können die Lesenden nicht mehr verlässlich erkennen, wer ein Ereignis bemerkt hat, wer ein Versprechen abgegeben hat oder wer wem antwortet.

Eine Studie zur sprecherbewussten Klassifizierung von Mehrparteiendialogen macht diesen Zusammenhang deutlich: Sie argumentiert, dass das Wissen darüber, wer gesprochen hat, dabei hilft, die Absicht der Äußerung im Kontext zu erfassen, und dass die Modellierung von Interaktionen schwieriger wird, je mehr Gesprächspartner beteiligt sind. Die Forschenden testen Methoden, die das Verhalten von Sprechern im lokalen Gesprächskontext abbilden. Es handelt sich hierbei um Forschung zum Dialogverständnis und nicht um eine Evaluation des kreativen Schreibens, aber sie unterstreicht, warum eine stabile Sprecherbezeichnung eine strukturelle Information darstellt. Who Is Speaking? Speaker-Aware Multiparty Dialogue Act Classification

Führen Sie die Sprecheridentität so lange wie möglich als strukturierte Daten und rendern Sie sie erst dann als sichtbare Bezeichnung. Verwenden Sie einen kanonischen Namen pro Charakter und wechseln Sie nicht beiläufig zwischen Spitznamen, Titeln und Vornamen, wenn dies die Zuordnung verwirren könnte. Trennen Sie zudem Narration und Dialog klar voneinander. Eine Zeile wie Mira: „Ich habe es an der Tür gelassen.“ weist sowohl das Gesagte als auch dessen Behauptung eindeutig Mira zu; eine nicht zugeordnete Zeile inmitten einer belebten Szene führt zu Unklarheiten.

Abschnitt 5

Der gemeinsame Handlungsstatus braucht explizite Aktualisierungen

Charaktere können sich daran erinnern, was passiert ist, aber die Szene benötigt auch ein kompaktes Protokoll darüber, was im Moment wahr ist. Aktualisieren Sie nach einem bedeutungsvollen Takt Fakten wie den Ort, die Anwesenden, welchen Gegenstand jemand bewegt hat, welche Entscheidung getroffen wurde und was ungelöst bleibt. Behandeln Sie dies als ein Protokoll beobachtbarer Ereignisse und nicht als eine lange Nacherzählung des Dialogs.

Das ist wichtig, weil eine Gruppenszene verschiedene Blickwinkel auf einen gemeinsamen Ablauf beinhaltet. Die Behauptung einer Person kann falsch sein, eine andere kann sie korrigieren und eine dritte kann handeln, bevor sie von beiden gehört hat. Indem das Ergebnis getrennt von den gesprochenen Zeilen festgehalten wird, lässt sich verhindern, dass jede Behauptung zu einer kanonischen Tatsache wird. Ein nützlicher Eintrag könnte lauten: „Der Schlüssel liegt auf der Küchentheke; Jo hat ihn dort abgelegt. Mira hat ihn nicht gesehen.“ Dieses einzelne Update deckt sowohl den gemeinsamen Weltstatus als auch eine individuelle Wissensgrenze ab.

Die Dokumentation zur Gruppenchat-Orchestrierung beschreibt die Synchronisierung des Gesprächsverlaufs für alle Teilnehmenden vor jedem Redebeitrag und das Ausstrahlen jeder Antwort, damit andere den aktualisierten Kontext nutzen können. Dieses technische Muster bietet eine hilfreiche Analogie für fiktionale Texte: Die Teilnehmenden benötigen Zugriff auf das aktuelle Szenenprotokoll, das Wissen der Charaktere benötigt jedoch weiterhin eigene Grenzen. Microsoft Agent Framework: Group Chat Orchestration

Abschnitt 6

Ein praktischer Koordinationsdurchlauf vor dem Entwurf

Schreiben Sie vor dem Generieren einer Szene vier kurze Notizen auf: das Ensemble und das unmittelbare Ziel jeder Person; die aktuelle gemeinsame Situation; ein Wissensverzeichnis für Fakten, die nicht jedem bekannt sind; und die Regel zur Auswahl des nächsten Sprechers. Gleichen Sie während des Entwerfens jeden Redebeitrag mit diesen Notizen ab. Prüfen Sie den Text nach dem Entwurf auf Fehler bei den Sprecherbezeichnungen, unbelegtes Wissen, grundlos wiederholte Wortmeldungen und Änderungen an der Szene, die nie festgehalten wurden.

Nehmen wir beispielsweise an, drei Freunde wählen ihre Route über einen Wochenendmarkt. Einer hat bemerkt, dass ein Handwerksstand bald schließt; ein anderer vergleicht die Warteschlangen vor den Essensständen; der Dritte hat noch keines der Schilder gesehen. Der erste Charakter kann den schließenden Stand erwähnen, der zweite kann dies gegen die Warteschlange abwägen und der Dritte kann fragen, was er verpasst hat. Wenn der Dritte sich sofort auf das Schild bezieht, ohne dass man es ihm gesagt hat oder er es sieht, deckt das Wissensverzeichnis den Kontinuitätsfehler auf. Dies ist ein illustratives Szenario und kein berichtetes Experiment.

Der entscheidende Unterschied liegt in der Koordination: Antworten einzelner Charaktere führen hauptsächlich ein einziges Gespräch fort, während Gruppenszenen Redebeiträge, Identitäten, Wissensstände und gemeinsame Ereignisse gleichzeitig im Einklang halten müssen. Indem diese Aufgaben getrennt werden, wird es einfacher, lebendige Szenen zu schaffen, ohne jeden Charakter in jeder Runde sprechen zu lassen oder allen dieselben Informationen zu geben.

Weitere Artikel

Dieses Thema weiter erkunden