Metlivi Blog

Machen längere Character Cards Chatbot-Charaktere konsistenter?

Eine längere Character Card allein kann nicht gewährleisten, dass ein Chatbot-Charakter glaubwürdiger wirkt. Zusätzliche Details helfen, wenn sie dem Modell relevante, stimmige Anweisungen liefern, die es in der Szene nutzen kann; Wiederholungen, irrelevante Fakten oder Widersprüche können es hingegen erschweren, den Charakter konsistent darzustellen. Um zu entscheiden, ob eine Card erweitert werden sollte, vergleichen Sie prägnante und detaillierte Versionen anhand derselben Szenen und überprüfen Sie Konsistenz, Stimme und glaubwürdige Entscheidungen jeweils separat.

27. September 20268 min LesezeitLesen, Kunst & KulturVon Metlivi Editorial Team
Abschnitt 1

Was muss eine Character Card leisten?

Eine Card ist nützlich, wenn sie dabei hilft, praktische Fragen während eines Gesprächs zu beantworten: Was will der Charakter? Wie spricht er für gewöhnlich? Was weiß er, und wie reagiert er, wenn etwas ungewiss ist? Details, die diese Entscheidungen leiten, erfüllen einen klareren Zweck als Nebensächlichkeiten, die den Austausch nie beeinflussen.

Bedenken Sie den Unterschied zwischen „sammelt antike Knöpfe“ und „sammelt antike Knöpfe und nutzt Gegenstände, um Gespräche zu beginnen, wenn er sich unwohl fühlt“. Das Erste ist ein Fakt. Das Zweite deutet auf ein Verhalten hin, das eine Szene offenbaren kann. Keines von beiden ist automatisch wertvoll: Wenn der Charakter nie in eine passende Situation gerät, verbessert der Fakt die Interaktion möglicherweise nicht.

Glaubwürdigkeit ist zudem mehr als das bloße Abrufen von Profilfakten. Ein Charakter erwähnt vielleicht die richtige Heimatstadt, klingt dabei aber austauschbar, oder er behält eine unverwechselbare Stimme bei, trifft jedoch Entscheidungen, die seinen erklärten Prioritäten widersprechen. Betrachten Sie die Kontinuität von Fakten, Stimme und Verhalten als zusammenhängende, aber getrennte Qualitäten.

Abschnitt 2

Was die Forschung uns sagen kann – und was nicht

Die Studie [„Principled Personas“](https://aclanthology.org/2025.emnlp-main.1364/) aus dem Jahr 2025 evaluiert Prompting mit Experten-Personas hinsichtlich der Aufgabenleistung von Sprachmodellen. Sie nennt Robustheit gegenüber irrelevanten Persona-Attributen und Treue zu Persona-Attributen als Evaluierungsziele und berichtet, dass irrelevante Details die Leistung beeinträchtigen können. Dies ist ein Grund, nicht davon auszugehen, dass jeder zusätzliche Fakt harmlos ist. Die Studie befasst sich jedoch mit Experten-Personas und der Aufgabenleistung; sie vergleicht keine kurzen und langen fiktiven Character Cards und legt keine optimale Card-Länge fest.

Das Papier [„Multi-dimensional Evaluation of Character-Authentic Dialogue Models Learned from Question-Answer Data“](https://aclanthology.org/2026.lrec-1.209/) aus dem Jahr 2026 bewertet Ansätze für Charakterdialoge anhand von Dimensionen wie Reproduzierbarkeit, Diversität, Halluzination und Charakterauthentizität. Es berichtet über Kompromisse zwischen Trainingsansätzen und Dialogqualitäten. Dies stützt die Praxis, die Darstellung von Charakteren anhand von mehr als nur einer Dimension zu bewerten. Es handelt sich nicht um ein Experiment zur Länge von Prompt-Cards, weshalb es nicht belegen kann, dass längere Cards die Authentizität verbessern.

Zusammenfassend legen diese Quellen nützliche Fragen nahe: Sind die Details relevant, und welche Qualität messen Sie eigentlich? Sie liefern jedoch keine allgemeingültige Wortanzahl und beweisen nicht, dass eine bestimmte Formel beim Schreiben von Cards für jedes Modell oder jeden Charakter funktioniert.

Abschnitt 3

Ein Beispiel für eine kompakte Card

Hier ist eine bewusst kurz gehaltene fiktive Card:

**Mara Vale** ist eine geduldige, aufmerksame Uhrmacherin, die sachliche Fragen dem Smalltalk vorzieht. Sie spricht in kurzen, präzisen Sätzen und setzt trockenen Humor nur sparsam ein. Sie möchte die Werkstatt ihres verstorbenen Mentors geöffnet halten. Wenn sie sich unsicher ist, spricht sie das offen aus und bittet darum, die Uhr zu untersuchen, bevor sie eine Reparatur vorschlägt. Sie versteht sich hervorragend auf Uhrenmechanismen; die Vorgeschichte eines Kunden kennt sie nicht, es sei denn, man erzählt sie ihr.

Diese Card deckt Rolle, Motivation, Stimme, ein Reaktionsmuster und eine Wissensgrenze ab. Diese Elemente lassen sich in Szenen testen. Die Länge dient als Beispiel, nicht als Empfehlung für eine ideale Wortanzahl. Wenn eine Szene ein fehlendes Detail aufdeckt – etwa wie Mara reagiert, wenn eine Reparatur ihre Fähigkeiten übersteigt –, können Sie ein bestimmtes Verhalten ergänzen, anstatt einen ganzen biografischen Absatz hinzuzufügen.

Eine nützliche Frage beim Überarbeiten jedes einzelnen Satzes lautet: „Was sollte der Charakter anders sagen, wissen oder tun, weil dies in der Card steht?“ Gibt es darauf keine plausible Antwort, ist das Detail möglicherweise rein dekorativ. Dekorative Fakten können durchaus Teil Ihrer kreativen Absicht sein, sollten jedoch nicht fälschlicherweise als Beweis dafür angesehen werden, dass der Charakter konsistenter agieren wird.

Abschnitt 4

Einen kontrollierten A/B-Test durchführen

Ein fairer Vergleich verändert die Card, nicht die Umstände drumherum. Nutzen Sie diesen einfachen Ablauf:

**Version A schreiben.** Behalten Sie nur die Kernfakten bei, die zur Darstellung des Charakters erforderlich sind: Rolle, Motivation, Stimme, Verhalten bei Ungewissheit und relevante Wissensgrenzen.
**Version B schreiben.** Fügen Sie Details hinzu, von denen Sie glauben, dass sie die Darstellung beeinflussen könnten. Behalten Sie die Fakten aus Version A unverändert bei und vermeiden Sie neue Anweisungen, die in gegensätzliche Richtungen weisen.
**Mehrere stabile Szenen vorbereiten.** Verwenden Sie dieselben Szenen-Prompts für beide Cards wieder. Bauen Sie unterschiedliche Anforderungen ein, wie ein beiläufiges Kennenlernen, ein praktisches Problem und einen Moment, in dem dem Charakter Informationen fehlen. Dies sind Testfälle, kein Beweis für eine universelle Leistung.
**Andere Bedingungen konstant halten.** Verwenden Sie dasselbe Modell, dieselben Einstellungen, denselben umgebenden Prompt und denselben Szenentext. Generieren Sie nach Möglichkeit mehr als eine Antwort pro Szene für jede Card, da eine einzelne Antwort möglicherweise kein konsistentes Muster zeigt. Dokumentieren Sie alle Änderungen an Einstellungen oder Prompts; weichen diese ab, ist der Vergleich schwieriger zu interpretieren.
**Antworten anhand derselben Kriterien prüfen.** Bewerten Sie jedes Kriterium separat auf einer kleinen Skala, beispielsweise von 1 bis 5, und notieren Sie eine Textzeile oder ein Verhalten, das die Punktzahl begründet. Fassen Sie nicht alles zu einem einzigen Gesamteindruck von „Glaubwürdigkeit“ zusammen.
Abschnitt 5

Fünf Charakterqualitäten separat bewerten

Verwenden Sie dieselben fünf Fragen für jede Antwort aus beiden Versionen der Card.

Faktenkontinuität: Bleibt die Antwort innerhalb der etablierten Fakten und Wissensgrenzen?
Stimme: Passen Satzbau, Wortwahl oder Humor zur Card?
Verhaltenskonsistenz: Passen die Entscheidungen zu den Zielen und beschriebenen Gewohnheiten des Charakters?
Szenenreaktionsfähigkeit: Reagiert der Charakter auf das Geschehen, anstatt Profilfakten aufzusagen?
Flexibilität: Kann der Charakter natürlich auf eine neue Situation reagieren, ohne der Card zu widersprechen?
Abschnitt 6

Die Auswertungsnotizen interpretieren

Die Bewertungen sind eine redaktionelle Hilfestellung, keine validierte wissenschaftliche Skala. Lassen Sie die Antworten nach Möglichkeit von einer prüfenden Person vergleichen, ohne dass diese weiß, aus welcher Card sie stammen; das verringert die Verlockung, jene Version zu bevorzugen, in deren Ausarbeitung mehr Zeit geflossen ist. Halten Sie eine kurze Notiz fest, die jede Bewertung begründet, damit das Ergebnis mehr als nur eine bloße Zahl ist.

Abschnitt 7

Den Vergleich analysieren, bevor Sie mehr hinzufügen

Wenn Version B eine bestimmte Dimension über mehrere Szenen hinweg verbessert, ohne andere zu schwächen, behalten Sie die Details bei, die plausibel dazu beigetragen haben. Wenn sie nur den Faktenabruf verbessert, den Dialog aber hölzern macht, entscheiden Sie, ob Faktenreue oder eine natürliche Reaktion in der Szene für diesen Charakter wichtiger sind. Wenn sich die beiden Versionen stark ähneln, leistet das hinzugefügte Material in diesen Szenen womöglich keinen spürbaren Beitrag; das beweist jedoch nicht, dass es an anderer Stelle niemals eine Rolle spielen könnte.

Fallen die Ergebnisse gemischt aus, prüfen Sie die Anweisungen auf Redundanzen oder Spannungen. Beispielsweise senden „fasse dich immer kurz“ und „beschreibe jeden Gedanken ausführlich“ widersprüchliche Signale zum Stil. Ebenso kann eine umfangreiche Hintergrundgeschichte schwer anzuwenden sein, wenn die Card nicht verdeutlicht, welche Erfahrungen das gegenwärtige Verhalten prägen. Formulieren Sie den Widerspruch in eine konkrete Priorität um oder entfernen Sie das Detail, das der Darstellung nicht dient.

Wenn ein Charakter bei einem wichtigen Fakt Fehler macht, sorgen Sie dafür, dass dieser Fakt leichter auffindbar ist, und definieren Sie seine Grenze klar. Wenn die Stimme austauschbar wirkt, fügen Sie ein beobachtbares Sprachmuster hinzu und testen Sie es im Dialog. Wenn Entscheidungen inkonsistent wirken, stellen Sie das Ziel des Charakters klar und wie er reagiert, wenn dieses Ziel infrage gestellt wird. Jede Überarbeitung sollte gezielt auf eine benannte Schwachstelle eingehen; das wahllose Hinzufügen von Biografie erschwert es nur herauszufinden, was letztlich geholfen hat.

Abschnitt 8

Wann sollten Sie eine Card verlängern?

Erweitern Sie die Card, wenn eine wiederholte Szene eine bedeutsame Lücke offenbart: Die Motivation des Charakters ist unklar, seine Wissensgrenze fehlt oder es gibt keine Orientierung dafür, wie er in einer wiederkehrenden Situation reagieren soll. Halten Sie die Ergänzung so spezifisch, dass sie getestet werden kann. Führen Sie dieselben Szenen dann erneut durch und prüfen Sie, ob sich die angestrebte Qualität verbessert, ohne dass neue Widersprüche entstehen oder die Reaktionsfähigkeit leidet.

In den zitierten Studien gibt es keine Belege für eine universell „verlässliche Card-Länge“. Eine prägnante Card kann ausreichen, wenn sie die Szenen, auf die es Ihnen ankommt, konsistent leitet. Eine längere kann nützlich sein, wenn ihre zusätzlichen Details relevante Entscheidungen beeinflussen. Beurteilen Sie das Ergebnis danach, was der Charakter über stabile Beispiele hinweg tut, und nicht nach der Anzahl der Wörter im Profil.

Dieser Vergleich hilft dabei, eine Character Card unter gewählten Bedingungen zu bewerten; er gewährleistet nicht, dass sich die Card in jedem Gespräch, jedem Modell oder jedem Setting identisch verhält. Eine menschliche Redaktion sollte letztlich weiterhin entscheiden, ob die Darstellung dem Charakter und der beabsichtigten Erfahrung gerecht wird.

Weitere Artikel

Dieses Thema weiter erkunden