Metlivi Blog

Was KI-simulierte Leser Ihnen über Ihre Texte verraten können – und was nicht

Wenn Sie eine Seite, einen Leitfaden oder eine Anleitung überarbeiten, kann Ihnen ein Sprachmodell dabei helfen, Formulierungen zu erkennen, die Leser verwirren könnten. Es kann auf unklare Phrasen hinweisen, ein mögliches Missverständnis beschreiben oder prüfen, ob ein Entwurf eine bestimmte Frage beantwortet. Eine simulierte Reaktion kann jedoch nicht belegen, dass Ihre Zielgruppe den Text tatsächlich verstanden, den richtigen Kontext eingebracht oder die beschriebene Aufgabe erfolgreich abgeschlossen hat. Beobachten Sie dafür einige echte Personen aus Ihrer Zielgruppe dabei, wie sie die Aufgabe ausführen, und lassen Sie sich erklären, was sie verstanden haben.

30. September 20266 min LesezeitLesen, Kunst & KulturVon Metlivi Editorial Team
Abschnitt 1

Was ein Modell in einem Entwurf sinnvoll kritisieren kann

Ein Modell kann den von Ihnen bereitgestellten Text und dessen Struktur untersuchen. Bitten Sie es, Begriffe zu identifizieren, die möglicherweise unvertraut sind, Schritte, die zu fehlen scheinen, Anweisungen mit mehr als einer plausiblen Bedeutung oder Fragen, die der Entwurf unbeantwortet lässt. Sie können es auch auffordern anzugeben, welche Belege im Text zu der jeweiligen Beobachtung geführt haben. Dies ist als redaktionelle Erstprüfung nützlich: Es liefert Anhaltspunkte, die man genauer untersuchen sollte, aber keine Erkenntnisse über tatsächliche Leser.

Halten Sie die Aufgabe konkret. Bitten Sie das Modell beispielsweise bei einer Seite, die erklärt, wie man einen Tagesausflug auswählt, herauszustellen, welche Details ein Leser zum Vergleichen der Optionen benötigt und wo diese Details zu finden sind. Bitten Sie um konkrete Textstellen und ein mögliches Missverständnis, und prüfen Sie dann jeden Vorschlag anhand Ihres Ziels und des Textes. Eine flüssig formulierte Antwort ist kein Beweis dafür, dass irgendeine Person den Textabschnitt tatsächlich so verstehen würde.

Persona-Prompts können eine nützliche Struktur hinzufügen, aber eine Beschreibung wie „ein gestresster Erstbesucher“ macht das Modell nicht zu diesem Besucher. Untersuchungen zum Persona-Prompting haben ergeben, dass dessen Nutzen davon abhing, ob die Persona-Variablen Mustern in den menschlichen Annotationen entsprachen; über viele subjektive Datensätze hinweg erklärten diese Variablen nur einen geringen Teil der Variation. Betrachten Sie Persona-basierte Reaktionen als Hypothesen, nicht als repräsentative Stichprobe der Meinung Ihrer Zielgruppe. Hu und Collier, „Quantifying the Persona Effect in LLM Simulations“

Abschnitt 2

Was simulierte Reaktionen nicht feststellen können

Die Antwort eines Modells kann nicht feststellen, was ein bestimmter Leser bemerkt, geschlussfolgert, behalten oder getan hat. Es empfängt Text und einen Prompt und generiert dann eine Antwort. Ein echter Leser begegnet dem Text mit eigenem Wissen, individuellen Zielen, Ablenkungen, Erwartungen und in einer konkreten Situation. Diese Faktoren bestimmen maßgeblich, ob ein Satz Sinn ergibt und ob die Person danach handeln kann.

Dieser Unterschied fällt am stärksten ins Gewicht, wenn es um Verhaltensfragen geht: Kann jemand die richtige Information finden? Wird eine Anweisung wie beabsichtigt interpretiert? Kann die Aufgabe ohne Hilfe bewältigt werden? Ein Modell kann über diese Fragen nachdenken, aber seine Beschreibung dessen, was es tun würde, bleibt generierter Text. Es hat weder unabhängig auf der Seite navigiert noch bewiesen, dass eine Person aus Ihrer Zielgruppe sie nutzen kann.

Die Forschung zu Modellsimulationen warnt auch davor, lebendige oder vielfältige Antworten als Beweis für Realitätsnähe zu verstehen. Eine Studie aus dem Jahr 2025 zur Simulation von Umfrageantworten ergab, dass die getesteten Ansätze Schwierigkeiten hatten, Nutzerantworten akkurat zu reproduzieren; die Modelle behielten Standpunkte über demografische Veränderungen hinweg bei und hatten Probleme, sich an nuancierte Unterschiede zwischen Profilen anzupassen. Diese Studie deckt zwar nicht jede Schreibkritik oder Usability-Aufgabe direkt ab, stützt aber eine praktische Grenze: Ein plausibel klingender simulierter Leser ist keine Validierung dafür, wie ein echtes Publikum reagieren wird. Yu et al., „An Analysis of Large Language Models for Simulating User Responses in Surveys“

Abschnitt 3

Was ein kleiner Test mit echten Lesern aufdecken kann

Ein kleiner qualitativer Test kann zeigen, wo echte Teilnehmer zögern, was sie übersehen, wie sie eine Formulierung interpretieren und ob sie das gewünschte Ziel erreichen. Sie können jeder Person eine realistische Aufgabe stellen, sie den Entwurf oder die Seite nutzen lassen und beobachten, was passiert. Nachfragen können klären, was die Teilnehmer unter einem bestimmten Begriff verstanden haben oder warum sie einen bestimmten Schritt gewählt haben. Das verbindet beobachtbares Verhalten mit den eigenen Erklärungen der Teilnehmenden.

Definieren Sie bei einer Inhaltsaufgabe das Erfolgskriterium vor der Sitzung. Handelt es sich bei dem Text beispielsweise um einen Tagesausflugsführer, könnten Sie einen Teilnehmer bitten, eine Option auszuwählen, die zu einer vorgegebenen Präferenz passt, und zu erklären, welche Informationen diese Wahl beeinflusst haben. Achten Sie darauf, ob die relevanten Details gefunden werden, welche Wörter oder Abschnitte aufhalten und ob die Erklärung der Testperson den Unterscheidungen entspricht, die der Leitfaden vermitteln sollte. Dieses Beispiel ist ein Vorschlag für ein Testdesign, keine Behauptung über einen bestimmten Leitfaden oder ein konkretes Ergebnis.

Staatliche Leitlinien für qualitative Usability-Tests empfehlen, Personen zu rekrutieren, die potenzielle Nutzer sein könnten, ihnen eine Aufgabe zuzuweisen, übermäßige Anweisungen zu vermeiden und die Aufgabenerledigung sowie häufige Fehler im Anschluss auszuwerten. Die Nielsen Norman Group beschreibt Usability-Studien ähnlich als Möglichkeit zu untersuchen, ob Inhalte leicht zu finden und zu verstehen sind oder ob Personen eine Aufgabe abschließen können. Beide Ansätze betonen, das tatsächliche Handeln der Teilnehmer zu beobachten – ein Beleg, den eine simulierte Antwort nicht liefern kann. GOV.UK, „Usability testing: qualitative studies“, Nielsen Norman Group, „Checklist for Planning Usability Studies“

Abschnitt 4

Wie man einen aussagekräftigen kleinen Test durchführt

Beginnen Sie mit einer Entscheidung oder Aufgabe, die der Text unterstützen soll. Rekrutieren Sie Personen, die der Zielgruppe in relevanter Hinsicht ähneln, insbesondere hinsichtlich ihrer Erfahrung mit dem Thema. Formulieren Sie dann ein Szenario, das ihnen einen Anlass gibt, das Material zu nutzen, ohne ihnen zu verraten, wo die Antwort steht oder nach welchen Wörtern sie suchen müssen. Eine Aufgabe, die Begriffe von der Seite wortgleich wiederholt, testet ungewollt das Abgleichen von Wörtern statt der Frage, ob der Inhalt jemandem hilft, sein Ziel zu erreichen; NN/G empfiehlt, konkrete Aufgaben ohne Hinweise zu formulieren, die das Verhalten vorprägen.

Lassen Sie die Teilnehmenden während der Sitzung mit minimaler Anleitung agieren. Halten Sie fest, was sie tun, wo sie innehalten, was sie in ihren eigenen Worten sagen und ob sie die Aufgabe abschließen. Wenn sie um Hilfe bitten, notieren Sie den Punkt, an dem diese nötig war. Bitten Sie sie anschließend zu beschreiben, was sie verstanden haben und was sie als Nächstes tun würden. Die Leitlinien von GOV.UK schlagen fünf bis sechs Teilnehmer für qualitative Usability-Tests vor; NN/G empfiehlt für traditionelle qualitative Studien generell fünf Personen. Dies sind praxisnahe Richtwerte, um Probleme aufzudecken, aber keine Stichprobengrößen, die Ergebnisse repräsentativ für eine gesamte Population machen. Wenn Sie verallgemeinerbare Prozentangaben oder Vergleiche benötigen, brauchen Sie ein quantitatives Design mit einer größeren Stichprobe und kontrollierten Messungen. GOV.UK, „Usability testing: qualitative studies“, NN/G, „Quantitative vs. Qualitative Usability Testing“

Abschnitt 5

Beobachtungen in Überarbeitungen umwandeln, nicht in pauschale Aussagen

Achten Sie nach einigen Sitzungen auf wiederkehrende Hürden und folgenschwere Einzelfehler. Wenn mehrere Teilnehmende dieselbe Formulierung falsch verstehen, ist das ein klarer Kandidat für eine Überarbeitung. Wenn eine einzelne Person eine Aufgabe nicht bewältigen kann, prüfen Sie die Rahmenbedingungen und fragen Sie sich, ob dieses Scheitern für die gesamte Zielgruppe relevant ist; übertragen Sie eine einzelne Sitzung nicht auf die Allgemeinheit. Eine kleine qualitative Studie soll Probleme aufdecken und Anpassungen anleiten, nicht beziffern, wie viele Menschen in einem größeren Publikum diese Probleme haben werden. NN/G weist darauf hin, dass qualitative Erkenntnisse von der Teilnehmerstichprobe und der Interpretation des Forschers abhängen, während numerische Usability-Aussagen eine adäquat dimensionierte quantitative Studie erfordern.

Überarbeiten Sie den Text und testen Sie die überarbeitete Fassung nach Möglichkeit mit neuen Lesern. Ein Modell kann Ihnen dabei helfen, alternative Formulierungen auszuprobieren oder zwischen den Runden neue Unklarheiten aufzudecken. Trennen Sie die Belegarten in Ihren Notizen klar voneinander: „Das Modell hat prognostiziert, dass dies verwirrend sein könnte“ ist ein Anlass für eine Untersuchung; „Zwei Teilnehmende interpretierten diesen Schritt unterschiedlich und einer hat das Ziel nicht erreicht“ ist eine Beobachtung aus einem Test. Weder das eine noch das andere beweist für sich genommen, dass jeder Leser dieselbe Erfahrung machen wird, aber die zweite Beobachtung verrät Ihnen, was bei der tatsächlich beobachteten Aufgabe geschehen ist.

Abschnitt 6

Eine praktische Arbeitsteilung

Nutzen Sie das Modell, um Fragen an den Entwurf zu generieren. Nutzen Sie echte Leser, um Fragen zum tatsächlichen Verständnis und zur Aufgabenbewältigung zu beantworten. Wenn die Aufgabe von einer bestimmten Zielgruppe, einer speziellen Umgebung oder Vorkenntnissen abhängt, rekrutieren Sie gezielt nach diesen Kriterien, anstatt ein Modell zu bitten, sie zu erfinden. Und wenn Sie verlässliche Raten oder Vergleiche benötigen, konzipieren Sie eine quantitative Studie, anstatt eine Handvoll qualitativer Sitzungen zu einer statistischen Aussage aufzublähen.

Diese Arbeitsteilung ermöglicht es, Überarbeitungen durch simulierte Kritik zu beschleunigen, ohne eine plausible Reaktion mit einem Beleg für den Erfolg bei echten Lesern zu verwechseln. Die entscheidende Frage ist nicht, ob das Modell eine überzeugende Leserstimme erzeugen kann; sie lautet, ob die beabsichtigten Leser das Material verstehen und das tun können, wozu der Text ihnen verhelfen soll.

Weitere Artikel

Dieses Thema weiter erkunden