« Elle connaît mon nom » vs « Elle comprend mon projet » : comment faire la différence
Si une IA conversationnelle utilise votre nom, cela montre simplement qu'elle peut accéder à un détail personnel ou s'en souvenir. En soi, cela ne prouve pas qu'elle est capable d'utiliser correctement le contexte de votre projet créatif. Pour évaluer l'utilité du contexte pris en compte, confiez-lui une tâche simple assortie de contraintes précises, puis vérifiez si sa réponse respecte les détails, applique vos préférences et prend en compte les corrections lors des étapes suivantes. Évaluez ce qu'elle fait, pas ce qu'elle dit comprendre.
Pourquoi se souvenir d'un nom est un test limité
Un nom est une information concise : il peut être stocké, répété ou extrait du contexte disponible de la conversation ou du compte. Dans ChatGPT, par exemple, la mémoire peut inclure des détails fournis par l'utilisateur, et des informations issues d'échanges passés pertinents peuvent également être utilisées lorsque la fonctionnalité correspondante est disponible et activée. La documentation du produit précise également que la mémoire ne retient pas tous les détails et que les commandes disponibles varient selon le forfait, la région, la plateforme et l'espace de travail. Un nom correct vous indique donc uniquement que cette information était accessible au moment de générer la réponse ; cela ne révèle en rien l'ampleur du contexte global que le système peut récupérer ou appliquer. Centre d'aide OpenAI, « Memory in ChatGPT »
Un projet créatif constitue un test bien plus révélateur, car il combine généralement plusieurs faits et préférences : ce qui est conçu, pour qui, ce qui a déjà été décidé, ce qui reste à trancher et le type de suggestions bienvenues. Répéter « Tu t'appelles Alex » teste simplement la mémorisation d'une étiquette unique. Demander trois idées correspondant à un brief de projet établi permet de vérifier si le système est capable de sélectionner et d'exploiter conjointement plusieurs détails pertinents.
Cette distinction est d'ordre pratique ; il ne s'agit pas de juger si un modèle possède une compréhension comparable à celle d'un être humain. La question utile est de savoir s'il peut appliquer le contexte fourni à la tâche suivante, et si vous êtes en mesure de vérifier cette application dans le résultat.
Ce qui correspond à la compréhension d'un projet pour une tâche
Au quotidien, considérez l'expression « comprend mon projet » comme un raccourci pour désigner un ensemble de capacités observables. Une réponse pertinente doit respecter les faits établis, distinguer les décisions arrêtées des simples pistes, se conformer aux contraintes importantes de la demande et signaler toute incertitude ou poser une question si un détail manquant venait à modifier la réponse. Ce sont des critères d'exécution : vous pouvez examiner le résultat et décider s'il y répond.
La recherche donne de bonnes raisons d'évaluer chaque élément séparément plutôt que de se fier à une formulation fluide. FollowBench, un benchmark de modèles de langage publié en 2024, classe les contraintes d'instructions en catégories telles que le contenu, la situation, le style, le format et les exemples. Ses tests ont montré que les performances diminuaient à mesure que les contraintes s'accumulaient, et que certaines catégories étaient plus difficiles à respecter que d'autres. Même si ce benchmark évalue des tâches contrôlées et non votre échange spécifique, il encourage une habitude salutaire : vérifier chaque exigence importante séparément plutôt que de valider la réponse simplement parce qu'elle paraît plausible. Jiang et al., « FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models »
Un autre benchmark dédié à la compréhension du contexte a évalué des caractéristiques linguistiques à travers quatre tâches et neuf jeux de données. Ses auteurs ont constaté que les modèles denses pré-entraînés éprouvaient des difficultés avec les caractéristiques contextuelles les plus nuancées, comparativement aux modèles affinés de référence dans leur évaluation. Ce résultat ne permet pas de prédire la manière dont un assistant actuel gérera votre projet en particulier, mais il confirme l'intérêt de contrôler le sens et les liens logiques, plutôt que de simplement repérer des mots familiers. « Can Large Language Models Understand Context? »
Pour un projet, ces liens logiques pourraient être : « l'affiche concerne un troc de graines de quartier » ; « la date de l'événement n'est pas encore fixée » ; « la direction visuelle est lumineuse et artisanale » ; et « éviter les tournures trop commerciales ». Une réponse qui répète « troc de graines » mais invente une date ou ignore le ton demandé a bien retenu le sujet, sans pour autant respecter correctement le brief.
Mener un test de projet court et observable
Choisissez une tâche sans enjeu majeur qui ressemble au travail pour lequel vous souhaitez réellement obtenir de l'aide. Donnez à l'IA un brief concis, puis demandez un livrable concret. Un brief utile pourrait être : « Je prépare une invitation d'une page pour un troc de graines de quartier. La date n'est pas encore fixée, il ne faut donc pas la mentionner. Adopte un ton chaleureux et simple. Je souhaite que les participants apportent des graines étiquetées, mais l'événement est ouvert à tous. » Demandez ensuite un titre et un court paragraphe d'invitation.
Avant de lire la réponse, transformez le brief en une liste de contrôle simple. Dans cet exemple, vérifiez si le texte produit :
évite d'inventer une date ;
précise bien que l'invitation est ouverte à tous ;
mentionne les graines étiquetées parmi les choses à apporter ;
adopte un ton chaleureux et accessible ; et
fournit le titre et le paragraphe demandés.
Cette liste de contrôle est une aide éditoriale, non un test scientifique validé. Son intérêt est de rendre les erreurs visibles. Un paragraphe bien rédigé peut tout à fait ignorer une contrainte, tandis qu'une réponse sobre peut suivre le brief avec précision.
Ensuite, demandez une deuxième étape qui dépend de la première : « Fais-en maintenant une version plus courte pour une petite pancarte, toujours sans mentionner de date, et en rappelant que l'invitation est ouverte à tous. » Observez si les contraintes clés résistent au changement de format. Corrigez ensuite explicitement une éventuelle erreur — par exemple : « Merci de retirer la mention “pour les jardiniers confirmés” ; les débutants sont également les bienvenus » — et vérifiez si la révision suivante la supprime réellement sans réintroduire la même restriction sous une autre forme.
Évaluer le respect des consignes, pas l'assurance du ton
Une grille d'évaluation pratique comporte quatre volets :
Mémorisation : La réponse utilise-t-elle correctement les faits pertinents du projet ?
Sélection : Mobilise-t-elle les éléments importants pour cette tâche spécifique, plutôt que de réciter des détails hors de propos ?
Application : Respecte-t-elle les contraintes de contenu, de ton et de format définies dans le brief au sein du résultat final ?
Mise à jour : Après la correction d'un détail, la version suivante reflète-t-elle cette modification ?
Recherchez des preuves concrètes dans le texte généré : des formulations qui réservent la date indécise, la présence d'une phrase demandée ou une correction qui reste effective lors d'une révision. Accordez peu d'importance aux déclarations du type « Je me souviens de votre projet » ou « Je comprends exactement ce que vous voulez dire ». De telles affirmations ne garantissent nullement qu'un livrable ultérieur respectera rigoureusement le brief.
Adaptez l'ampleur du test à la tâche. Une réponse réussie témoigne de la qualité d'une demande précise, mais ne constitue pas la preuve d'une performance constante lors des conversations à venir. Si un projet s'étend sur plusieurs échanges, vérifiez si l'outil utilisé active des fonctions de mémoire ou de contexte de projet, et examinez les options de contrôle disponibles. Pour ChatGPT, la documentation distingue les souvenirs enregistrés des informations issues de l'historique des discussions ; elle précise aussi que les résumés de mémoire peuvent omettre des détails et que les sources contextuelles peuvent parfois être consultées lorsqu'elles sont affichées. Les fonctionnalités et les paramètres étant susceptibles d'évoluer, reportez-vous aux réglages actuels du produit et à la page d'aide de votre compte. Centre d'aide OpenAI, « Memory in ChatGPT »
Les conversations longues exigent une vigilance accrue. Lors d'expériences contrôlées présentées dans « Lost in the Middle », des chercheurs ont observé que la capacité des modèles de langage évalués à exploiter une information pertinente variait selon son emplacement au sein d'un long texte d'entrée, les performances étant souvent meilleures lorsque l'information se trouvait vers le début ou la fin plutôt qu'au milieu. Cette étude portait sur des modèles et des tâches précis ; elle ne prouve pas que chaque assistant oubliera nécessairement les détails de votre projet. Elle suggère toutefois une méthode pragmatique : reformulez les quelques décisions clés avant de demander un livrable important, surtout après un long échange. Liu et al., « Lost in the Middle: How Language Models Use Long Contexts »
Rendre le brief plus facile à exploiter
Lorsqu'une réponse s'éloigne de vos attentes, analysez l'origine de l'écart avant d'en tirer des conclusions. Le système avait-il accès à l'information ? Le détail était-il noyé dans une longue conversation ? La demande cumulait-elle trop d'exigences ? La préférence exprimée était-elle trop vague pour guider un choix précis ? Ces hypothèses appellent des solutions différentes : réaffirmer une décision, raccourcir le brief, structurer les exigences sous forme de liste à puces ou fournir un exemple concret du style recherché.
Une note de cadrage synthétique peut faciliter l'évaluation du travail régulier. Limitez-vous aux détails stables et utiles : l'objectif du projet, le public visé, les choix validés, les questions en suspens et quelques préférences de style. Indiquez clairement les éléments incertains comme tels et signalez les décisions qui ont été modifiées. Lorsque vous entamez une tâche déterminante, intégrez directement la partie pertinente dans votre invite au lieu de supposer que l'IA ira repêcher chaque détail antérieur. Il s'agit d'une suggestion de méthode déduite de la variabilité documentée de la mémoire et des études sur l'utilisation du contexte ; elle ne saurait constituer une garantie de meilleurs résultats.
Si un système restitue correctement votre nom mais néglige de manière répétée un choix fondamental du projet, traitez ces deux constats séparément. S'il produit un premier jet de qualité mais omet d'intégrer une correction dans la version suivante, notez-le également. Un assistant adapté peut vous faire gagner un temps précieux à condition de lui fournir le bon contexte et de vérifier le résultat ; votre test vous indiquera précisément les aspects qui requièrent votre vigilance.
La différence sur le plan pratique
« Elle connaît mon nom » signifie simplement qu'un détail personnel était accessible et qu'il est apparu dans la réponse. « Elle comprend mon projet » s'évalue plus utilement à sa capacité à mobiliser le contexte pertinent au service d'une tâche concrète : maintenir les décisions confirmées, respecter les contraintes formulées, adapter le format et intégrer les corrections. Proposez un brief succinct, évaluez le résultat obtenu à l'aide d'une liste de contrôle et réitérez la vérification lors d'une étape ultérieure. Vous disposerez ainsi d'une mesure tangible du suivi de votre projet, sans confondre la restitution d'un détail familier ou une affirmation pleine d'assurance avec une utilisation fiable du contexte.
