Wie man einen nützlichen kurzen KI-Chat misst, ohne auf die Sitzungsdauer zu optimieren
Ein kurzes KI-Gespräch kann erfolgreich sein, wenn es jemandem hilft, eine kleine kreative Aufgabe zu erledigen: eine Farbpalette auswählen, ein Wochenendprojekt benennen oder ein paar Ideen für eine persönliche Aktivität finden. Um einen solchen Austausch zu bewerten, definieren Sie, was die Person wollte, und prüfen Sie dann, ob die Antwort relevant, nützlich und leicht zu steuern oder zu beenden war. Verbrachte Zeit und wiederkehrende Besuche können die Nutzung beschreiben, aber für sich genommen verraten sie nicht, ob der Austausch geholfen hat.
Beginnen Sie mit der Aufgabe, für die die Person gekommen ist
Bevor Sie eine Metrik auswählen, benennen Sie eine alltägliche Aufgabe in beobachtbaren Begriffen. „Ein paar spielerische Namen für einen Balkon-Kräutergarten finden“ lässt sich leichter beurteilen als „ein ansprechendes Gespräch führen“. Ersteres gibt Prüfenden etwas Konkretes an die Hand, worauf sie achten können: Hat das System Namen angeboten, die zur Anfrage passten, und konnte die Person einen auswählen oder anpassen?
Dies folgt einem breiteren Usability-Prinzip: Beurteilen Sie, ob bestimmte Nutzende bestimmte Ziele in einem bestimmten Kontext effektiv, effizient und zufriedenstellend erreichen. Die ISO-Definition behandelt diese Aspekte als verwandte, aber voneinander abgegrenzte Qualitäten, sodass keine einzelne Kennzahl – einschließlich der Dauer – stellvertretend für alle stehen kann. ISO 9241-11:2018, *Ergonomie der Mensch-System-Interaktion — Teil 11: Gebrauchstauglichkeit: Begriffe und Konzepte*
Definieren Sie den Abschluss bei kreativen Anfragen als nützliches Ergebnis und nicht als eine einzige richtige Antwort. Eine Person verlässt den Chat vielleicht mit einer ausgewählten Idee, einer engeren Auswahl oder einer besseren Richtung für einen weiteren Versuch. Halten Sie im Voraus fest, was für die Aufgabe als ausreichend gilt. Das verhindert, dass Teams den Erfolg stillschweigend als „die Person hat einfach weitergechattet“ umdefinieren.
Bewerten Sie Aufgabenerfüllung und Relevanz getrennt
Eine praktische Überprüfung kann mit zwei Fragen beginnen: Hat der Austausch das gewünschte Ergebnis erreicht, und passten die Antworten der Assistenz zur Anfrage? Trennen Sie die Antworten voneinander. Eine Antwort kann relevant sein, die Person aber dennoch ohne brauchbare Option zurücklassen; ebenso kann jemand eine Aufgabe abschließen, nachdem eine ablenkende oder generische Antwort einfach ignoriert wurde.
Die Aufgabenerfüllung (Task Completion) ist eine gängige, einfache Messgröße, aber sie reduziert Ergebnisse auf ein Ja-oder-Nein-Ergebnis und erklärt nicht, warum jemand gescheitert ist oder wie gut eine erledigte Aufgabe verlaufen ist. Kombinieren Sie sie mit einer kurzen Überprüfung des Gesprächs oder einer direkten Nutzerbewertung. Nielsen Norman Group, „Success Rate: The Simplest Usability Metric“
Die Dialogforschung stützt diese detailliertere Betrachtung. Eine Studie über aufgabenorientierte Dialoge bewertete Relevanz, Interessantheit, Verständnis, Aufgabenerfüllung und Effizienz sowohl auf Beitrags- als auch auf Gesprächsebene; sie stellte fest, dass eine einzelne Gesamtbewertung nützliche Nuancen übersehen kann und dass die Zufriedenheit je nach Annotierenden und Dialogen variierte. Diese Ergebnisse sind keine universelle Bewertungsformel, aber sie bieten eine fundierte Reihe von Dimensionen, die sich auf kreative Aufgaben anpassen lassen. Siro, Aliannejadi und de Rijke, „Understanding User Satisfaction with Task-oriented Dialogue Systems“
Betrachten Sie die Antwortqualität auf der Ebene einzelner Äußerungen
Prüfen Sie, ob jede Antwort auf die letzte Anfrage eingeht und relevante Kontexte aus früheren Dialogschritten nutzt. Sagt die Person beispielsweise „Mach das weniger formell“, sollte eine nützliche nächste Antwort die Vorschläge entsprechend anpassen. Zählen Sie vermeidbare Wiederholungen, übersehene Vorgaben oder Klärungsfragen, die die Aufgabe nicht voranbringen.
Eine Studie über intelligente Assistenten ergab, dass die Zufriedenheit je nach Szenario variierte: Bei manchen Aufgaben war die Aufgabenerfüllung entscheidend, bei anderen der betriebene Aufwand. Zudem wurde berichtet, dass die Beibehaltung des Gesprächskontexts wichtig war und dass die Gesamtzufriedenheit mit der Aufgabe nicht einfach auf die Zufriedenheit mit einzelnen Anfragen reduziert werden konnte. Die praktische Konsequenz ist, sowohl die einzelnen Antworten als auch den gesamten Austausch zu untersuchen und beides im Kontext der Aufgabe zu interpretieren. Microsoft Research, „Understanding User Satisfaction with Intelligent Assistants“
Bei einem kreativen Austausch könnte ein kurzes menschliches Review die Antworten als relevant, teilweise relevant oder am Thema vorbei kennzeichnen und festhalten, ob die Assistenz Korrekturen befolgt hat. Diese Kennzeichnungen sind eine vorgeschlagene Prüfmethode, kein validierter Benchmark. Wenn ein automatisierter Klassifikator diese liefert, überprüfen Sie Stichproben manuell: Ein scheinbar makelloser Wert kann dennoch einen Vorschlag übersehen, der formal zwar zum Prompt passt, der Person aber nichts Brauchbares liefert.
Prüfen Sie, ob die Person den Austausch steuern konnte
Nutzerkontrolle zeigt sich in kleinen Momenten: Die Person kann die Anfrage präzisieren, einen anderen Stil verlangen, ein Missverständnis korrigieren oder aufhören, sobald sie genug hat. Prüfen Sie Transkripte daraufhin, ob das System auf Vorgaben reagiert hat, anstatt beharrlich seine eigene Gesprächslinie zu verfolgen. Wenn die Benutzeroberfläche Steuerelemente zum Stoppen, Bearbeiten, Neugenerieren oder Löschen einer Antwort bietet, testen Sie, ob diese Aktionen den Erwartungen der Menschen entsprechen.
Die Forschung zu dialogorientierten Agenten hat Autonomie mit Begriffen beschrieben, die unter anderem die Kontrolle über das Gespräch, die Fragen und die Antworten umfassen. Dies bestärkt den Ansatz, Kontrolle als zu überprüfendes Qualitätsmerkmal zu behandeln, auch wenn sich daraus keine universelle Produktmetrik ableiten lässt. Yang und Aurisicchio, „Designing Conversational Agents: A Self-Determination Theory Approach“
Eine unkomplizierte Nutzerfrage kann Kontrolle messbar machen: „Konnten Sie das Gespräch zu dem von Ihnen gewünschten Ergebnis führen?“ Stellen Sie diese Frage nach dem Austausch, zusammen mit einer Frage zur Aufgabenerfüllung. Halten Sie die Antwortoptionen über alle Sitzungen hinweg einheitlich und ermöglichen Sie eine kurze Begründung. Ein niedriger Wert ist ein Signal zur näheren Untersuchung des Gesprächs, kein Beweis für eine bestimmte Ursache.
Erkennen Sie ein klares Ende als valides Ergebnis an
Ein guter Endpunkt ist erreicht, wenn die Person hat, was sie braucht, und den Chat ohne eine weitere Aufforderung des Systems verlassen kann. Beim Beispiel des Kräutergartens könnte dies der Moment sein, in dem sie sich für einen Namen entscheidet. Ein Gespräch, das dort endet, ist möglicherweise nützlicher als eines, das durch generische Nachfragen künstlich in die Länge gezogen wird. Dies ist ein aus der Aufgabe abgeleitetes Messprinzip: Wenn das Ziel erreicht ist, stiften zusätzliche Dialogschritte nicht automatisch einen Mehrwert.
Erfassen Sie, ob die Aufgabe abgeschlossen wirkt und ob die Person sich entschieden hat fortzufahren, aber interpretieren Sie diese Ereignisse im Kontext. Ein weiterer Dialogschritt kann Neugier, eine notwendige Korrektur oder eine unvollständige Antwort widerspiegeln. Ein wortloser Ausstieg kann bedeuten, dass die Person zufrieden, abgelenkt oder enttäuscht ist. Die Gesprächslänge allein kann diese Erklärungen nicht voneinander unterscheiden; nutzen Sie stichprobenartige Transkriptprüfungen oder kurzes Nutzerfeedback für genauere Einblicke.
Nutzen Sie die Dauer als Kontext, nicht als Urteil
Die Dauer kann helfen, operative Fragen zu beantworten, beispielsweise ob ein bestimmter Ablauf routinemäßig viele Dialogschritte erfordert. Dennoch bleibt sie ein Maß für die verstrichene Aktivitätszeit und ist kein direkter Beleg dafür, dass eine Antwort nützlich war. Google Analytics definiert beispielsweise die Interaktionsdauer (Engagement Time) als die Dauer des Nutzerengagements im Zusammenhang mit Ereignissen; der Entwicklerleitfaden warnt zudem davor, dass ein künstliches Verlängern von Sitzungen die Verhaltensdaten verzerrt. Dies sind analytische Definitionen und Implementierungshinweise, kein Qualitätsmaßstab für kreative Chats. Google Analytics, „Measurement Protocol reference“ und Google Analytics, „Measure sessions and user engagement“
Vergleichen Sie die Zeit nur zwischen ähnlichen Aufgaben und stets im Zusammenspiel mit Aufgabenerfüllung, Relevanz, Nutzerkontrolle und einem klaren Endpunkt. Eine kürzere mittlere Dauer kann eine direktere Antwort widerspiegeln, aber auch darauf hindeuten, dass Nutzende aufgegeben haben. Eine längere Dauer kann produktives Iterieren bedeuten – oder unnötige Reibungsverluste. Die aussagekräftigen Belege müssen aus dem Aufgabenergebnis und der Erfahrung der Menschen stammen, nicht von der Uhr allein.
Ein kompaktes Evaluierungsverfahren
Geben Sie den Teilnehmenden für eine kleine Studie eine klar formulierte kreative Aufgabe, lassen Sie sie den Chat ganz natürlich nutzen und erfassen Sie, ob sie das von ihnen definierte Ergebnis erreicht haben. Überprüfen Sie eine Stichprobe von Unterhaltungen auf Relevanz, Berücksichtigung des Kontexts sowie Möglichkeiten zur Steuerung oder Beendigung. Fragen Sie nach jeder Aufgabe, ob sie ein nützliches Ergebnis erhalten haben und das Gefühl hatten, das Gespräch lenken zu können. Erfassen Sie die Dauer als Kontext und untersuchen Sie Fälle, in denen Dauer und berichtete Nützlichkeit voneinander abweichen.
Weisen Sie die Messwerte separat aus, anstatt sie in einem einzigen „Engagement“-Wert zusammenzufassen. Geben Sie die Aufgabe an, wie der Abschluss beurteilt wurde, wer die Antworten geprüft hat und wie das Nutzerfeedback eingeholt wurde. Wenn die Stichprobe klein oder die Aufgabendefinition subjektiv ist, beschreiben Sie die Ergebnisse eher als richtungsweisend, anstatt sie auf alle Nutzenden oder kreativen Anfragen zu verallgemeinern.
Ein kurzer Austausch ist dann wertvoll, wenn er die Person von einer konkreten Anfrage zu einem für sie brauchbaren Ergebnis führt und ihr dabei die Kontrolle über den Weg und den Endpunkt überlässt. Messen Sie diese Ergebnisse direkt. Lassen Sie die Sitzungslänge dabei helfen, das Nutzungserlebnis zu erklären, aber machen Sie sie nicht zum Maßstab für den Erfolg.
