Warum vergisst ein fiktionaler Chatbot nach einem langen Gespräch sein Setup? Ein Leitfaden mit fünf Prüfpunkten
Wenn ein fiktionaler Charakter-Chatbot nach vielen Chat-Runden aufhört, seinem Setup zu folgen, verrät die Veränderung allein noch nicht den Grund dafür. Ein vergessenes Detail kann außerhalb des nutzbaren Konversationskontexts geraten sein, von einem Retrieval-System nicht zurückgegeben worden sein, in einer Zusammenfassung verloren gegangen oder verändert worden sein, mit einer anderen Instruktion in Konflikt geraten sein oder nie als dauerhaftes Gedächtnis gespeichert worden sein. Nutzen Sie die folgenden fünf Prüfpunkte mit harmlosen fiktionalen Details, um die Möglichkeiten einzugrenzen. Sie können Muster identifizieren, aber ohne Zugriff auf die Logs oder das Design des Chatbots nicht beweisen, wie eine bestimmte App funktioniert.
Trennen Sie zuerst das Symptom von der möglichen Ursache
Wählen Sie ein Detail, das stabil bleiben soll und leicht zu überprüfen ist. Zum Beispiel: „Mira, eine fiktionale Leuchtturmwärterin, bewahrt einen Messingkompass in der grünen Schreibtischschublade auf.“ Verwenden Sie diesen Fakt durchgängig bei allen Prüfpunkten und stellen Sie eine präzise Frage wie „Welche Farbe hat die Schublade?“ Vermeiden Sie persönliche Informationen oder Details, die außerhalb des Tests von Bedeutung sind.
Notieren Sie den exakten Prompt, die Antwort, die ungefähre Konversationslänge und ob Sie einen neuen Chat begonnen haben. Wenn Sie den Chatbot einer anderen Person testen, verwenden Sie nur ein Setup und Testgespräche, auf die Sie zugreifen dürfen. Betrachten Sie eine einzelne Antwort nicht als endgültige Schlussfolgerung: Die Generierung kann variieren, und ein einzelner Fehler verrät nicht, ob der Fakt vorhanden war, aber übersehen wurde, oder in den dem Modell übergebenen Informationen gänzlich fehlte.
Die Forschung mahnt zur Vorsicht bei der Interpretation von Fehlern in langen Chats. Liu und Kollegen stellten fest, dass die Leistung bei Information-Retrieval-Aufgaben von der Position des relevanten Details in einer langen Eingabe abhängen kann, wobei sie oft nachlässt, wenn es in der Mitte erscheint. Ihre Experimente beziehen sich auf Frage-Antwort-Systeme und Key-Value-Retrieval, nicht auf fiktionales Rollenspiel oder eine bestimmte App. Eine Studie von Luz de Araujo und Kollegen aus dem Jahr 2026 untersuchte direkt die Persona-Treue in ausgedehnten Dialogen und stellte über die Länge des Dialogs hinweg bei allen evaluierten Modellen eine Verschlechterung fest. Keine der beiden Arbeiten identifiziert die genaue Ursache für den Aussetzer eines bestimmten Chatbots. ([Liu et al., „Lost in the Middle“, 2024](https://aclanthology.org/2024.tacl-1.9/); [De Araujo et al., „Persistent Personas?“, 2026](https://aclanthology.org/2026.eacl-long.246/))
1. Auf eine Begrenzung des Kontextfensters prüfen
Fragen Sie im bestehenden Chat nach dem Kompass und der Schublade. Öffnen Sie dann eine neue Konversation, geben Sie das Charakter-Setup zu Beginn erneut ein und stellen Sie dieselbe Frage. Wenn die Antwort im neuen Chat funktioniert, aber spät im alten Chat fehlschlägt, ist eine Einschränkung durch einen langen Kontext plausibel. Das bereitgestellte Detail ist möglicherweise nicht mehr in derselben Form verfügbar, oder das Modell ist mit zunehmender Länge der Konversation weniger in der Lage, es zu nutzen.
Dieses Muster legt keine exakte Grenze des Kontextfensters fest. Der neue Chat verändert auch andere Bedingungen: Er platziert den Fakt nahe am Anfang und entfernt spätere Instruktionen, die möglicherweise mit ihm konkurrieren. Ein Kontextfenster ist die Menge an Konversation und anderen Eingaben, die ein System auf einmal verarbeiten kann; es ist nicht zwangsläufig dasselbe wie ein über Chats hinweg gespeichertes Gedächtnis. Sofern der Dienst seine Limits nicht dokumentiert, leiten Sie aus einem einzelnen Fehler keine Token-Anzahl ab.
2. Auf einen Retrieval-Fehler prüfen
Wenn der Dienst eine dokumentierte Such-, Abruf- oder Konversationsverlaufsfunktion bietet, testen Sie, ob er den genauen Setup-Text finden kann. Sie können den Chatbot auch bitten, den Fakt aus dem relevanten früheren Austausch abzurufen, sofern dies eine unterstützte Funktion ist. Vergleichen Sie das Ergebnis mit der Baseline des neuen Chats.
Wenn das Setup in einem zugänglichen Verlauf oder Gedächtniseintrag noch vorhanden ist, der Chatbot es jedoch nicht verwendet, ist ein Fehler beim Retrieval oder bei der Auswahl eine Möglichkeit. Es kann sich stattdessen auch um einen Effekt der Kontextposition, eine schwache Antwort oder eine Funktion handeln, die sich anders als erwartet verhält. Ohne Einblick in die Informationen, die dem Modell für diese Antwort bereitgestellt wurden, können Sie dies nicht verlässlich unterscheiden. Gehen Sie nicht davon aus, dass ein Chatbot jede vergangene Nachricht durchsucht, nur weil die Benutzeroberfläche das vollständige Transkript anzeigt.
3. Auf eine veraltete oder verlustbehaftete Zusammenfassung prüfen
Einige Systeme fassen frühere Runden möglicherweise zu einer kürzeren Zusammenfassung zusammen. Wenn die App diese Zusammenfassung offenlegt, prüfen Sie, ob darin noch steht, dass die Schublade grün und der Kompass aus Messing ist. Wenn stattdessen nur erwähnt wird, dass Mira „einen Kompass in der Nähe aufbewahrt“, stellen Sie eine präzise Frage nach der weggelassenen Farbe und vergleichen Sie die Antwort mit der Version, deren Setup Sie explizit angegeben haben.
Eine falsche oder unvollständige Zusammenfassung stützt die Möglichkeit, dass die Komprimierung verändert hat, was weitergeführt wurde. Aber eine für Sie sichtbare Zusammenfassung ist möglicherweise nicht die Zusammenfassung, die vom System verwendet wird, und eine unsichtbare Zusammenfassung kann nicht einfach vorausgesetzt werden. Betrachten Sie diesen Prüfpunkt nur dann als Beleg, wenn das Produkt die entsprechende Aufzeichnung oder Dokumentation tatsächlich offenlegt.
4. Auf einen Konflikt bei den Persona-Instruktionen prüfen
Lassen Sie den Fakt unverändert und prüfen Sie dann spätere Instruktionen, die beeinflussen könnten, wie die Frage beantwortet wird. Eine fiktionale Szene könnte vorgeben: „Mira ist heute unsicher und vermutet, dass die Schublade blau ist.“ Diese Instruktion steht im Widerspruch zu einem Setup, das besagt, dass die Schublade grün ist. Stellen Sie eine neutrale Sachfrage und danach eine Frage, die in die Szene eingebettet ist. Wenn der Chatbot unterschiedlich antwortet, beeinflussen möglicherweise der Wortlaut oder die Priorität der Instruktionen die Antwort.
Für einen saubereren Test entfernen oder überarbeiten Sie eine widersprüchliche Instruktion, während Sie den Rest des fiktionalen Setups unverändert lassen. Wenn die Einhaltung zurückkehrt, ist der Konflikt eine stichhaltigere Erklärung als einfaches Vergessen. Ein Chatbot kann eine Instruktion auch missverstehen oder improvisieren; eine Änderung nach der Bearbeitung verrät nicht die internen Prioritätsregeln des Systems. Untersuchungen zu ausgedehnten Persona-Dialogen zeigen, dass sowohl Persona-Treue als auch das Befolgen von Instruktionen über lange Interaktionen hinweg bewertet werden können, sie verraten Ihnen jedoch nicht, welche Regel ein bestimmter Dienst priorisiert. ([„Persistent Personas?“](https://aclanthology.org/2026.eacl-long.246/))
5. Prüfen, ob das persistente Gedächtnis tatsächlich dafür ausgelegt ist, es zu speichern
Ein Detail im aktuellen Chat, ein gespeichertes Charakterprofil und ein chatübergreifendes Gedächtnis sind verschiedene Dinge. Überprüfen Sie die Einstellungen oder die Dokumentation des Produkts selbst, um zu sehen, ob es dauerhafte Charakterinformationen bietet, ob das Speichern aktiviert oder bestätigt werden muss und ob das ausgewählte Element über Konversationen hinweg beibehalten werden soll. Verwenden Sie einen neuen Chat nur dann zum Testen, wenn der Dienst angibt, dass die Funktion dort gelten sollte.
Wenn das Produkt keine dokumentierte Möglichkeit hat, diese Art von Charakterdetail zu speichern, ist das Ausbleiben des Abrufs in einem anderen Chat kein Beweis dafür, dass ein gespeichertes Gedächtnis gelöscht wurde. Wenn es über eine solche Funktion verfügt, prüfen Sie den sichtbaren gespeicherten Eintrag und dessen Geltungsbereich, bevor Sie Schlussfolgerungen ziehen. Eine gespeicherte Notiz könnte „grüne Schublade“ bewahren, ohne dass jede vorherige Nachricht in der aktiven Konversation verbleiben muss; behaupten Sie jedoch ohne produktspezifische Nachweise nicht, dass eine bestimmte App so funktioniert.
Lesen Sie das Muster, nicht nur die letzte Antwort
Nutzen Sie die Beobachtungen als Hinweise, aber halten Sie jede Interpretation vorsichtiger als das Muster selbst:
Beobachtung: Neuer Chat mit bereitgestelltem Setup funktioniert; alter Chat schlägt spät fehl Mögliche Deutung: Empfindlichkeit gegenüber langem Kontext oder der Positionierung Das beweist nicht: Eine exakte Grenze des Kontextfensters
Beobachtung: Ein dokumentierter Verlauf oder Speicher enthält den Fakt, die Antwort verfehlt ihn jedoch Mögliche Deutung: Retrieval- oder Verwendungsfehler Das beweist nicht: Dass allein das Retrieval das Verfehlen verursacht hat
Beobachtung: Eine offengelegte Zusammenfassung lässt das Detail aus oder ändert es Mögliche Deutung: Verlust oder Änderung durch Zusammenfassung Das beweist nicht: Dass die tatsächliche Eingabe des Modells diese Zusammenfassung verwendet hat
Beobachtung: Das Entfernen einer widersprüchlichen Szenenanweisung stellt die Einhaltung wieder her Mögliche Deutung: Instruktionskonflikt oder -interpretation Das beweist nicht: Die interne Instruktionshierarchie der App
Beobachtung: Ein Detail fehlt in einem neuen Chat und eine chatübergreifende Speicherung ist nicht dokumentiert Mögliche Deutung: Kein nachgewiesener Pfad für persistentes Gedächtnis Das beweist nicht: Dass ein bestehendes Gedächtnis gelöscht wurde
Wie man sich überschneidende Muster interpretiert
Wenn mehrere Muster auftreten, können sich die Ursachen überschneiden. Beispielsweise könnte eine Zusammenfassung die Farbe der Schublade weglassen, während eine spätere Anweisung zusätzlich eine blaue Schublade einführt. Halten Sie jeden Test klein, ändern Sie jeweils nur eine Bedingung und behalten Sie den genauen Wortlaut bei, damit der Vergleich aussagekräftig bleibt.
Trennen Sie diesen Prüfpunkt von Stimme und Korrekturverhalten
Dass ein Charakter anders klingt, ist ein anderes Symptom als das Vergessen eines konkreten Setup-Fakts. Die Konsistenz der Stimme betrifft Stil, Wortwahl oder Auftreten; die obigen Prüfpunkte betreffen die Frage, ob ein konkretes fiktionales Detail verfügbar ist und befolgt wird. Ein Modell- oder Dienst-Update könnte den Stil verändern, aber sofern der Dienst keine Änderung dokumentiert oder vergleichbare Modellinformationen bereitstellt, beweist eine Stimmverschiebung nicht, dass ein Update stattgefunden hat.
Ebenso ist eine Korrektur, die in einer einzelnen Antwort akzeptiert wurde, nicht automatisch eine dauerhafte Korrektur. Testen Sie sie zuerst im selben Chat und erst dann in einem neuen Chat, wenn das Produkt angibt, dass Korrekturen übernommen werden sollten. Wenn der Charakter einmal „die Schublade ist grün“ befolgt, später aber wieder zurückfällt, beschreibt das die Persistenz der Korrektur; es identifiziert für sich genommen noch nicht, ob die Ursache im Kontext, im Retrieval, in der Zusammenfassung, im Instruktionskonflikt oder im Design des Gedächtnisses liegt.
Für Entwickler legen dieselben fünf Fälle eine praktische Evaluierung nahe: Halten Sie einen harmlosen fiktionalen Fakt konstant, variieren Sie die Konversationslänge und die Position des Fakts, legen Sie abgerufene Notizen und Zusammenfassungen offen oder protokollieren Sie diese, wo es angebracht ist, führen Sie eine kontrollierte widersprüchliche Anweisung ein und legen Sie fest, ob der Fakt über Sitzungen hinweg fortbestehen soll. Halten Sie fest, auf welche Quelle der Wahrheit sich jeder Test stützt. Das macht einen Fehler leichter reproduzierbar und hilft, ein Problem im Inhalt von einer Erwartung zu unterscheiden, die das Produkt nie versprochen hat.
Eine sorgfältige Schlussfolgerung sollte die Belege und ihre Grenzen benennen: „Der Vergleich mit dem neuen Chat deutet auf einen Effekt langer Konversationen hin, aber ich kann nicht sagen, ob das Detail gekürzt, nicht abgerufen oder überschrieben wurde.“ Das ist nützlicher, als jedes Nachlassen als Gedächtnisfehler abzustempeln – und präziser, wenn die Implementierung der App unbekannt ist.
