Blog Metlivi

Comment évaluer une courte conversation IA utile sans optimiser pour la durée de session

Une courte conversation avec une IA peut être une réussite lorsqu'elle aide quelqu'un à accomplir une petite tâche créative : choisir une palette de couleurs, trouver un nom pour un projet de week-end ou dénicher quelques idées pour une activité personnelle. Pour évaluer cet échange, définissez ce que la personne souhaitait, puis vérifiez si la réponse était pertinente, utile et facile à orienter ou à interrompre. Le temps passé et les visites récurrentes peuvent décrire l'utilisation, mais ils ne permettent pas à eux seuls d'indiquer si l'échange a été utile.

30 septembre 20266 min de lectureLecture, arts et culturePar Metlivi Editorial Team
Section 1

Commencer par la tâche que la personne est venue accomplir

Avant de choisir une métrique, décrivez une tâche ordinaire en termes observables. « Obtenir quelques noms amusants pour un jardin d'herbes aromatiques de balcon » est plus facile à évaluer que « avoir une conversation stimulante ». La première option fournit aux évaluateurs un élément concret à observer : le système a-t-il proposé des noms correspondant à la demande, et la personne a-t-elle pu en choisir ou en adapter un ?

Cela répond à un principe d'utilisabilité plus général : évaluer si des utilisateurs spécifiés atteignent des objectifs spécifiés avec efficacité, efficience et satisfaction dans un contexte particulier. La définition de l'ISO considère qu'il s'agit de qualités liées mais distinctes, de sorte qu'aucune mesure unique — y compris la durée — ne peut se substituer à l'ensemble d'entre elles. ISO 9241-11:2018, *Ergonomie de l'interaction homme-système — Partie 11: Utilisabilité : Définitions et concepts*

Pour les demandes créatives, définissez l'accomplissement comme un résultat utile plutôt que comme une réponse unique et correcte. Une personne peut repartir avec une idée précise, une présélection ou une meilleure orientation pour une nouvelle tentative. Établissez par écrit et à l'avance ce qui constitue un résultat suffisant pour la tâche. Cela évite que les équipes ne redéfinissent discrètement le succès par « l'utilisateur a continué à discuter ».

Section 2

Évaluer l'accomplissement et la pertinence séparément

Une analyse pratique peut commencer par deux questions : l'échange a-t-il permis d'atteindre le résultat visé, et les réponses de l'assistant correspondaient-elles à la demande ? Conservez ces réponses distinctes. Une réponse peut être pertinente tout en laissant la personne sans option exploitable ; une personne peut également mener une tâche à bien après avoir ignoré une réponse distrayante ou générique.

Le taux d'accomplissement de la tâche est une mesure courante et simple, mais elle réduit les résultats à un constat binaire (oui ou non) sans expliquer pourquoi une personne a échoué ni dans quelle mesure une tâche accomplie s'est bien déroulée. Associez-la à un examen rapide de la conversation ou à une évaluation directe par l'utilisateur. Nielsen Norman Group, « Success Rate: The Simplest Usability Metric »

La recherche sur le dialogue conforte cette approche plus détaillée. Une étude sur le dialogue orienté vers les tâches a annoté la pertinence, l'intérêt, la compréhension, l'accomplissement de la tâche et l'efficience, tant au niveau des tours de parole qu'à celui de la conversation dans son ensemble ; elle a révélé qu'une note globale unique peut passer à côté de distinctions utiles, et que la satisfaction variait selon les annotateurs et les dialogues. Ces conclusions ne constituent pas une formule universelle de notation, mais elles offrent un ensemble pertinent de dimensions à adapter à une tâche créative. Siro, Aliannejadi, et de Rijke, « Understanding User Satisfaction with Task-oriented Dialogue Systems »

Section 3

Considérer la qualité des réponses à l'échelle de chaque tour

Vérifiez si chaque réponse répond à la dernière demande formulée et utilise le contexte pertinent des tours précédents. Si la personne dit par exemple « rends cela moins formel », une réponse suivante utile doit modifier les suggestions en conséquence. Comptabilisez les répétitions évitables, les contraintes omises ou les demandes de clarification qui n'aident pas à faire progresser la tâche.

Une étude sur les assistants intelligents a montré que la satisfaction différait selon les scénarios : l'accomplissement de la tâche importait fortement dans certaines situations, tandis que l'effort requis primait dans d'autres. Elle indiquait également que la préservation du contexte conversationnel était essentielle et que la satisfaction globale liée à la tâche ne pouvait être réduite à la satisfaction envers des requêtes individuelles. L'implication pratique consiste à inspecter à la fois les réponses spécifiques et l'ensemble de l'échange, tout en interprétant chacune par rapport à son objectif. Microsoft Research, « Understanding User Satisfaction with Intelligent Assistants »

Pour un échange créatif, un court examen humain peut classifier les réponses en tant que pertinentes, partiellement pertinentes ou hors sujet, et noter si l'assistant a pris en compte les corrections. Ces étiquettes constituent une méthode d'évaluation suggérée, et non une référence validée. Si un classificateur automatique les attribue, vérifiez manuellement des échantillons : un score impeccable peut tout de même masquer une suggestion qui correspond techniquement à la consigne mais n'apporte rien d'exploitable à l'utilisateur.

Section 4

Vérifier que la personne pouvait orienter l'échange

Le contrôle exercé par l'utilisateur se manifeste à travers de petits moments : la personne peut préciser la demande, solliciter un autre style, corriger un malentendu ou s'arrêter une fois qu'elle en a assez obtenu. Analysez les transcriptions pour vérifier si le système a suivi les directives données au lieu de poursuivre obstinément sa propre ligne de conversation. Si l'interface propose des commandes pour interrompre, modifier, régénérer ou effacer une réponse, vérifiez que ces actions fonctionnent conformément aux attentes des utilisateurs.

La recherche sur les agents conversationnels a défini l'autonomie à travers des termes englobant le contrôle sur la conversation, les questions et les réponses. Cela confirme l'intérêt d'examiner le contrôle comme une qualité en soi, même si cela ne fonde pas une métrique produit universelle. Yang et Aurisicchio, « Designing Conversational Agents: A Self-Determination Theory Approach »

Une question simple adressée à l'utilisateur peut rendre ce contrôle mesurable : « Avez-vous réussi à mener la conversation vers le type de résultat souhaité ? » Posez-la après l'échange, en parallèle d'une question sur l'accomplissement de la tâche. Gardez les options de réponse cohérentes d'une session à l'autre et prévoyez un espace pour une brève explication. Un score faible est un signal invitant à inspecter la conversation, et non la preuve d'une cause spécifique.

Section 5

Reconnaître une fin claire comme une issue valable

Un bon point d'arrêt intervient lorsque la personne dispose de ce dont elle a besoin et peut quitter l'échange sans nouvelle relance de la part du système. Pour l'exemple du jardin d'herbes aromatiques, cela peut correspondre au moment où elle choisit un nom. Une conversation qui prend fin à ce stade peut être plus utile qu'une discussion prolongée par des questions de relance génériques. Il s'agit d'un principe de mesure déduit de la tâche : si l'objectif est atteint, des échanges supplémentaires n'apportent pas automatiquement de la valeur.

Suivez si la tâche semble accomplie et si la personne a choisi de continuer, mais interprétez ces événements en contexte. Un tour supplémentaire peut traduire de la curiosité, une correction nécessaire ou une réponse incomplète. Un départ silencieux peut signifier que la personne est satisfaite, distraite ou déçue. La durée de la conversation ne peut à elle seule faire la distinction entre ces explications ; appuyez-vous sur des examens d'échantillons de transcriptions ou de brefs retours d'utilisateurs pour approfondir l'analyse.

Section 6

Utiliser la durée comme contexte et non comme verdict

La durée peut aider à répondre à des questions opérationnelles, par exemple pour savoir si un parcours particulier nécessite systématiquement de nombreux tours. Elle reste néanmoins une mesure de l'activité écoulée, et non une preuve directe de l'utilité d'une réponse. Google Analytics, par exemple, définit le temps d'engagement comme la durée de l'engagement de l'utilisateur associée aux événements ; sa documentation pour les développeurs rappelle également que prolonger artificiellement les sessions fausse les données de comportement. Il s'agit là de définitions analytiques et de mises en garde relatives à la mise en œuvre, non d'une mesure de qualité pour une discussion créative. Google Analytics, « Référence du protocole de mesure » et Google Analytics, « Mesurer les sessions et l'engagement des utilisateurs »

Ne comparez le temps passé qu'entre des tâches similaires et en tenant compte de l'accomplissement de la tâche, de la pertinence, du contrôle utilisateur et d'un point d'arrêt clair. Une durée médiane plus courte peut témoigner d'une réponse plus directe, mais elle peut aussi refléter un abandon de l'utilisateur. Une durée plus longue peut être le signe d'une itération productive — ou d'une friction inutile. Les preuves à l'appui doivent provenir du résultat de la tâche et de l'expérience vécue par les utilisateurs, et non de la seule horloge.

Section 7

Une méthode d'évaluation synthétique

Pour une étude à petite échelle, confiez aux participants une tâche créative clairement formulée, laissez-les interagir naturellement avec le chat et notez s'ils sont parvenus au résultat qu'ils avaient défini. Analysez un échantillon d'échanges pour vérifier la pertinence, la continuité du contexte et les opportunités d'orienter ou d'interrompre la conversation. Après chaque tâche, demandez-leur s'ils ont obtenu un résultat utile et s'ils ont eu le sentiment de pouvoir guider l'échange. Consignez la durée comme élément de contexte, puis examinez les cas où la durée et l'utilité rapportée ne concordent pas.

Présentez les différentes mesures séparément au lieu de les fusionner en un unique score d'« engagement ». Précisez la tâche, la méthode d'évaluation de son accomplissement, les personnes chargées de l'examen des réponses et la manière dont les retours des utilisateurs ont été recueillis. Si l'échantillon est restreint ou si la définition de la tâche est subjective, qualifiez les observations d'indicatives plutôt que de les généraliser à l'ensemble des utilisateurs ou des demandes créatives.

Un échange court est concluant lorsqu'il guide la personne d'une requête spécifique vers un résultat qu'elle peut exploiter, tout en lui laissant la maîtrise de l'orientation et du moment où s'arrêter. Mesurez directement ces résultats. Laissez la durée de session éclairer l'expérience, mais ne la laissez pas définir le succès.

À lire aussi

Continuer sur ce thème