Wie man testet, ob ein KI-Charakter nach zehn Gesprächen noch fesselnd ist
Um zu testen, ob ein fiktiver KI-Charakter nach zehn Gesprächen immer noch reizvoll ist, geben Sie einer Testperson einen konsistenten Charakter und ein festes Setting und laden Sie sie dann in zehn unterschiedliche, glaubwürdige Situationen ein. Verfolgen Sie, welche Szenen sie wählt, ob der Charakter dem etablierten Kanon treu bleibt, welches neue Story-Material jeder Austausch hervorbringt und ob die Testperson sich entscheidet, die Reihe abzuschließen. Betrachten Sie dies als beobachtbare Hinweise zur Verbesserung des Charakters – nicht als Maßstab dafür, wie lange jemand im Chat gehalten werden kann.
Definieren Sie, was „immer noch fesselnd“ für diesen Test bedeutet
Ein zehntes Gespräch sollte zeigen, ob der Charakter auch dann noch lohnendes Spiel unterstützen kann, wenn der anfängliche Reiz des Neuen verflogen ist. Für diese Übung bedeutet Anziehungskraft, dass die Testperson Gründe findet, vielfältige Szenen zu wählen, den Charakter unter wechselnden Umständen wiedererkennt und etwas Nützliches oder Überraschendes aus dem Austausch mitnimmt. Der Abschluss ist eine abschließende freiwillige Handlung: Die Testperson entscheidet sich, das geplante zehnte Gespräch zu beenden. Keine dieser Beobachtungen allein beweist, dass jeder Spieler den Charakter fesselnd finden wird.
Halten Sie die Fragestellung eng: „Bietet dieser Charakter genug konsistentes, frisches Material, damit diese Testperson zehn Gespräche auswählt und abschließt?“ Nutzen Sie nicht die gesamte verbrachte Zeit als entscheidenden Wert. Ein langer Austausch könnte eine mitreißende Szene widerspiegeln, aber genauso gut Verwirrung oder einen ungelösten Prompt. Die Playtest-Frage zum Charakter dreht sich um Szenenwahl, Kanon, Neuartigkeit und freiwilligen Abschluss – nicht darum, ob ein Verbraucherabonnement über einen Zeitraum von vierzehn Tagen sein Geld wert ist.
Bereiten Sie eine Kanon-Karte und zehn Szeneneinladungen vor
Schreiben Sie vor dem Test eine kurze Kanon-Karte mit Fakten, die der Charakter beibehalten muss: seine Rolle, wichtige Vorgeschichte, etablierte Vorlieben, Beziehungen, Grenzen und charakteristische Ausdrucksweisen. Fügen Sie auch ein paar flexible Eigenschaften hinzu: wie er sich verhält, wenn er überrascht wird, was er wahrnimmt oder welche Arten von Details er tendenziell übersieht. Dies macht Konsistenz beobachtbar, ohne vom Charakter zu verlangen, dieselben Schlagwörter zu wiederholen. Die Forschung zu Persona-konditionierten Dialogagenten behandelt Persona-Konsistenz als ein zu bewertendes Qualitätsmerkmal, und eine Studie über interagierende Sprachmodell-Agenten ergab, dass sich Profile in Konsistenz und linguistischer Anpassung während der Interaktion unterschieden. Diese Studien motivieren dazu, das Verhalten über mehrere Austausche hinweg zu überprüfen; sie legen jedoch keinen universellen Schwellenwert von zehn Gesprächen fest. (Building Persona Consistent Dialogue Agents with Offline Reinforcement Learning; LLM Agents in Interaction: Measuring Personality Consistency and Linguistic Alignment in Interacting Populations of Large Language Models)
Bereiten Sie zehn Szeneneinladungen vor, die verschiedene Gelegenheiten schaffen, ohne dem Charakter seine Replikate vorzuschreiben. Der Charakter könnte beispielsweise ein kleines Geschenk auswählen, einen Besuch an einem vertrauten Ort planen, ein harmloses Missverständnis ausräumen, bei der Organisation einer Gemeinschaftsveranstaltung helfen oder entscheiden müssen, was er an einem unerwartet freien Nachmittag tut. Halten Sie jede Einladung innerhalb der etablierten Welt und der gewöhnlichen persönlichen Entscheidungen des Charakters. Variieren Sie die Situation und die Art der Entscheidung, während Sie genügend Kontinuität bewahren, damit frühere Ereignisse von Bedeutung sein können.
Vermeiden Sie es, zehn Versionen desselben Prompts mit oberflächlichen Änderungen zu verfassen. Eine nützliche Szene fordert den Spieler auf, eine bedeutungsvolle Entscheidung zu treffen oder eine eigene Idee einzubringen. Forschung und Theorie zur interaktiven Narration behandeln die Handlungsfähigkeit (Agency) des Spielers als mehr als das bloße Vorhandensein von Optionen: Auch das Verständnis und die Interpretation des Spielers prägen das Erlebnis. In diesem Playtest bedeutet das, festzuhalten, was die Testperson tatsächlich auswählt und wie sie eine Szene lenkt, statt nur zu zählen, wie viele Prompts der Charakter beantwortet hat. (Connecting player and character agency in videogames)
Führen Sie zehn Gespräche, ohne die „richtige“ Antwort vorzugeben
Geben Sie der Testperson eine kurze, neutrale Einführung: Sie probiert den Charakter und die Szenen aus, und beim Test geht es um das Erlebnis und nicht um ihre Leistung. Lassen Sie sie wissen, dass sie jederzeit abbrechen kann. Präsentieren Sie jeweils eine Szene in einem konsistenten Format und vermeiden Sie Hinweise darauf, was eine Szene spannend machen würde oder welche Option der Charakter wählen sollte. Leitfäden für moderierte Usability-Tests empfehlen klare, glaubwürdige Aufgaben, die die Lösung nicht vorwegnehmen, sowie das Beobachten der Teilnehmenden und offene Nachfragen. Wenden Sie dieses Prinzip auf das kreative Spiel an: Machen Sie das Setting deutlich und lassen Sie der Testperson dann Raum, auf ihre eigene Weise zu reagieren. (Using moderated usability testing)
Halten Sie nach jedem Austausch ein paar konkrete Beobachtungen fest: welche Szene die Testperson ausgewählt oder entwickelt hat, ob sie eine neue Richtung eingebracht hat, ob der Charakter den Kanon gewahrt oder ihm widersprochen hat und welches neue Story-Element entstanden ist. Notieren Sie eine bestimmte Äußerung oder Entscheidung, wenn sie eine Beobachtung veranschaulicht. Halten Sie diese getrennt von Interpretationen: „Die Testperson änderte den Plan, den Markt zu besuchen“ ist eine Beobachtung; „Der Charakter lud zur Mitgestaltung ein“ ist eine mögliche Interpretation. Kurze, punktuelle Notizen lassen sich über mehrere Sitzungen hinweg leichter vergleichen als allgemeine Eindrücke. (Taking notes and recording user research sessions)
Stellen Sie nach dem Ende des Austauschs einige wenige neutrale Fragen. „Was möchten Sie als Nächstes mit diesem Charakter tun?“ kann zeigen, ob sich die Testperson eine weitere Szene vorstellen kann. „Gab es etwas, das dem widersprach, was Sie über ihn verstanden hatten?“ kann Kanonbrüche aufdecken. „Welcher Teil fühlte sich vertraut an und welcher neu?“ kann klären, ob die Neuerung vom Charakter, der Situation oder dem eigenen Beitrag der Testperson ausging. Fragen Sie nach den Beweggründen für eine Antwort, anstatt die Erklärung selbst zu liefern.
Verwenden Sie eine einfache Bewertungsmatrix mit zehn Zeilen
Verwenden Sie eine Zeile pro Gespräch. Eine kompakte Skala hilft, Muster zusammenzufassen, aber die Notizen und Beispiele sind wichtiger als die Arithmetik. Das folgende Raster ist ein praktisches Hilfsmittel für Playtests, kein validiertes Forschungsinstrument.
Gespräch: 1–10; Szenenwahl oder Richtung: Was die Testperson gewählt, hinzugefügt oder umgelenkt hat; Kanon: 0 = Widerspruch; 1 = unklar; 2 = konsistent; Nützliche Neuerung: 0 = wiederholt sich ohne Mehrwert; 1 = etwas neues Material; 2 = deutliche, nutzbare Entwicklung; Freiwillig abgeschlossen?: Ja / Nein
Bewerten Sie beim Kanon einen Widerspruch nur dann, wenn der Charakter mit einem Fakt auf der Kanon-Karte oder einem etablierten Ereignis kollidiert – nicht bloß, weil er sich in einer neuen Situation anders verhält. Zählen Sie bei Neuartigkeit ein Detail, eine Entscheidung, eine Beziehungsentwicklung oder eine Szenenwendung, die der Testperson etwas gibt, worauf sie reagieren oder worauf sie aufbauen kann. Ein überraschendes Detail, das in der Welt des Charakters keinen Sinn ergibt, ist keine nützliche Neuerung. Halten Sie die Szenenauswahl deskriptiv, anstatt die Vorlieben der Testperson zu benoten: Vielfalt bedeutet, dass der Charakter verschiedenen Richtungen gerecht wird, nicht dass die Testperson ein vorgegebenes Spektrum abdecken muss.
Erfassen Sie den Abschluss getrennt von den anderen Bewertungen. Wenn die Testperson Gespräch zehn freiwillig beendet, halten Sie das fest; wenn sie abbricht, fragen Sie, ob sie bereit ist zu sagen, was sie dazu bewogen hat. Deuten Sie den Abschluss nicht als Beweis für Zuneigung oder den Abbruch als Beweis für ein Scheitern. Eine Person kann aus Gründen abbrechen, die außerhalb des Charakters liegen, und eine abgeschlossene Reihe kann dennoch repetitive oder widersprüchliche Szenen enthalten. Die Kombination aus Verhalten und Erklärung ist aufschlussreicher als ein einzelnes binäres Ergebnis.
Lesen Sie das Muster ab und entscheiden Sie, was überarbeitet werden muss
Achten Sie darauf, an welchen Stellen sich das Erlebnis im Verlauf der Reihe verändert. Wenn die Testperson immer wieder verschiedene Arten von Szenen wählt, die Antworten des Charakters aber generisch werden, arbeiten Sie an seiner Stimme und seiner Entscheidungsfindung unter wechselnden Umständen. Wenn der Charakter erkennbar bleibt, die Szenen aber wiederholt ohne neue Entscheidung oder neues Detail enden, überarbeiten Sie die Einladungen oder geben Sie dem Charakter konkretere Ziele und Vorlieben mit, nach denen er handeln kann. Wenn die Testperson beginnt, Szenen umzulenken, prüfen Sie, ob die vorbereiteten Situationen zu ähnlich, zu eng oder schlicht weniger interessant waren als die Ideen, die sie selbst mitbrachte.
Eine unverwechselbare Stimme sollte sich darin zeigen, was der Charakter wahrnimmt, will und sagt – nicht nur in einem wiederholten sprachlichen Tic. Ein Leitfaden zum Schreiben von Dialogen beschreibt die Stimme als Spiegelbild der Persönlichkeit und empfiehlt, den Dialog an die Eigenschaften, den Hintergrund und die Emotionen einer Figur anzupassen. Nutzen Sie diesen Grundsatz bei der Durchsicht eines Transkripts: Könnte der Satz in dieser Situation plausibel von diesem Charakter stammen, und zeigt er eine wiedererkennbare Perspektive? (Section 8 – Writing Dialogue – A Beginner’s Guide to Storytelling)
Wählen Sie dann eine gezielte Überarbeitung und wiederholen Sie denselben Zehn-Szenen-Test mit einer anderen Testperson oder in einem klar dokumentierten neuen Durchlauf. Behalten Sie die Prompts und Bewertungsdefinitionen beim Vergleichen von Versionen bei, damit sich eine Änderung des Tests selbst nicht als Veränderung des Charakters tarnt. Wenn der erste Durchlauf einen Kanonwiderspruch aufgedeckt hat, fügen Sie eine Szene hinzu, die den entsprechenden Fakt auf natürliche Weise testet; wenn er repetitive Gespräche offenbart hat, ergänzen Sie Situationen mit anderen Arten von Entscheidungen. Dies ist eine diagnostische Schleife, keine Schätzung für eine Gesamtpopulation. Eine einzelne Testperson kann konkrete Reibungspunkte und Potenziale aufzeigen, aber nicht belegen, wie breit sich das Ergebnis verallgemeinern lässt.
Was zehn Gespräche Ihnen sagen können – und was nicht
Das Zehn-Gespräche-Format ist nützlich als fokussierter Stresstest: Es hilft Ihnen zu erkennen, ob Szenenvielfalt, wiedererkennbarer Kanon und frisches Material über einen anfänglichen Austausch hinaus Bestand haben. Es kann zeigen, wo eine bestimmte Testperson das Interesse verlor, eine vielversprechende Richtung fand oder auf einen Widerspruch stieß. Es beweist keine langfristige Faszination, prognostiziert keine Bindung und legt nicht fest, wie alle Zielgruppen reagieren werden. Nutzen Sie es, um zu entscheiden, was untersucht und überarbeitet werden muss, und sammeln Sie dann weitere Playtests, wenn Sie Gewissheit über verschiedene Leserschaften und Spielstile hinweg benötigen.
Das deutlichste Signal ist ein Muster mit Beispielen: Die Testperson hatte Raum für Entscheidungen, der Charakter reagierte passend zum etablierten Kanon, die Szenen brachten eigenständiges Material hervor, auf dem sich aufbauen ließ, und die Testperson entschied sich, die Reihe zu beenden. Wenn eines dieser Elemente wegbricht, sollten die Notizen auf die nächste gestalterische Entscheidung hinweisen – die Stimme des Charakters anpassen, den Kanon klären oder die Szeneneinladungen neu gestalten –, statt einfach nur weitere Gesprächsprompts hinzuzufügen.
