Blog de Metlivi

Cómo medir un chat breve y útil con IA sin optimizar la duración de la sesión

Una conversación breve con IA puede ser exitosa cuando ayuda a alguien a terminar una pequeña tarea creativa: elegir una paleta de colores, nombrar un proyecto de fin de semana o encontrar algunas ideas para una actividad personal. Para evaluar ese intercambio, defina qué quería la persona y luego verifique si la respuesta fue relevante, útil y fácil de guiar o terminar. El tiempo invertido y las visitas recurrentes pueden describir el uso, pero por sí solos no pueden decirle si el intercambio fue de ayuda.

30 de septiembre de 20266 min de lecturaLectura, arte y culturaPor Metlivi Editorial Team
Sección 1

Comience con la tarea que la persona vino a hacer

Antes de elegir una métrica, describa una tarea ordinaria en términos observables. «Obtener algunos nombres divertidos para un huerto de hierbas en el balcón» es más fácil de evaluar que «tener una conversación interesante». Lo primero brinda a los evaluadores algo concreto que buscar: ¿ofreció el sistema nombres que se ajustaran a la solicitud y pudo la persona seleccionar o adaptar uno?

Esto sigue un principio de usabilidad más amplio: juzgar si usuarios específicos logran objetivos específicos de manera eficaz, eficiente y con satisfacción en un contexto particular. La definición de la ISO trata estas como cualidades relacionadas pero distintas, por lo que ninguna medida individual (incluida la duración) puede sustituirlas a todas. ISO 9241-11:2018, *Ergonomics of human-system interaction — Part 11: Usability: Definitions and concepts*

Para solicitudes creativas, defina la finalización como un resultado útil en lugar de una única respuesta correcta. Una persona podría irse con una idea elegida, una lista corta o una mejor dirección para otro intento. Escriba de antemano qué cuenta como suficiente para la tarea. Eso evita que los equipos redefinan silenciosamente el éxito como «el usuario siguió chateando».

Sección 2

Puntúe la finalización y la relevancia por separado

Una revisión práctica puede comenzar con dos preguntas: ¿alcanzó el intercambio el resultado establecido y se ajustaron las respuestas del asistente a la solicitud? Mantenga las respuestas por separado. Una respuesta puede ser relevante pero dejar a la persona sin una opción utilizable; una persona también puede completar una tarea después de ignorar una respuesta distractora o genérica.

La finalización de la tarea es una medida común y sencilla, pero comprime los resultados en un resultado de sí o no y no explica por qué alguien falló o qué tan bien se desarrolló una tarea completada. Combínela con una breve revisión de la conversación o una calificación directa del usuario. Nielsen Norman Group, “Success Rate: The Simplest Usability Metric”

La investigación sobre diálogos respalda esta visión más detallada. Un estudio sobre diálogos orientados a tareas anotó la relevancia, el interés, la comprensión, la finalización de la tarea y la eficiencia tanto a nivel de turno como de conversación; descubrió que una sola calificación general puede pasar por alto distinciones útiles y que la satisfacción variaba entre anotadores y diálogos. Esos hallazgos no son una fórmula de puntuación universal, pero ofrecen un conjunto fundamentado de dimensiones para adaptar a una tarea creativa. Siro, Aliannejadi, and de Rijke, “Understanding User Satisfaction with Task-oriented Dialogue Systems”

Sección 3

Trate la calidad de la respuesta como una cuestión a nivel de turno

Revise si cada respuesta atiende a la última solicitud y utiliza el contexto relevante de turnos anteriores. Si la persona dice «hazlos menos formales», por ejemplo, una respuesta posterior útil debería cambiar las sugerencias en consecuencia. Cuente las repeticiones evitables, las restricciones ignoradas o las solicitudes de aclaración que no ayuden a avanzar en la tarea.

Un estudio sobre asistentes inteligentes descubrió que la satisfacción difería según el escenario: la finalización de la tarea importaba mucho en algunas tareas, mientras que el esfuerzo importaba en otras. También informó que preservar el contexto conversacional era importante y que la satisfacción general de la tarea no podía reducirse a la satisfacción con consultas individuales. La implicación práctica es inspeccionar tanto las respuestas particulares como el intercambio completo, interpretando cada uno en función de su tarea. Microsoft Research, “Understanding User Satisfaction with Intelligent Assistants”

Para un intercambio creativo, una breve revisión humana podría etiquetar las respuestas como relevantes, parcialmente relevantes o fuera de tema, y señalar si el asistente siguió las correcciones. Estas etiquetas son una propuesta de método de revisión, no un estándar validado. Si un clasificador automatizado las proporciona, verifique muestras manualmente: una puntuación impecable aún puede pasar por alto una sugerencia que técnicamente coincide con la instrucción pero no le da a la persona nada que pueda usar.

Sección 4

Compruebe que la persona haya podido guiar el intercambio

El control del usuario es visible en pequeños momentos: la persona puede acotar la solicitud, pedir otro estilo, corregir un malentendido o detenerse tras obtener lo suficiente. Revise las transcripciones para ver si el sistema respondió a la dirección en lugar de seguir repetidamente su propia línea de conversación. Si la interfaz proporciona controles para detener, editar, regenerar o borrar una respuesta, compruebe que esas acciones se comporten como la gente espera.

La investigación sobre agentes conversacionales ha descrito la autonomía en términos que incluyen el control sobre la conversación, las preguntas y las respuestas. Esto respalda tratar el control como una cualidad a inspeccionar, aunque no establece una métrica de producto universal para ello. Yang and Aurisicchio, “Designing Conversational Agents: A Self-Determination Theory Approach”

Una pregunta ligera para el usuario puede hacer que el control sea medible: «¿Pudo llevar la conversación hacia el tipo de resultado que deseaba?». Hágala después del intercambio, junto con una pregunta sobre la finalización de la tarea. Mantenga las opciones de respuesta consistentes en todas las sesiones y permita una breve explicación. Una puntuación baja es una señal para inspeccionar la conversación, no la prueba de una causa particular.

Sección 5

Reconozca un final claro como un resultado válido

Un buen punto final ocurre cuando la persona tiene lo que necesita y puede irse sin otra indicación del sistema. Para el ejemplo del huerto de hierbas, ese podría ser el momento en que elige un nombre. Una conversación que termina ahí puede ser más útil que una extendida por preguntas de seguimiento genéricas. Este es un principio de medición inferido de la tarea: si el objetivo está completo, los turnos adicionales no añaden valor automáticamente.

Haga un seguimiento de si la tarea parece completada y si la persona decidió continuar, pero interprete esos eventos en contexto. Un turno de seguimiento podría reflejar curiosidad, una corrección necesaria o una respuesta incompleta. Una salida silenciosa podría significar que la persona está satisfecha, distraída o decepcionada. La duración de la conversación por sí sola no puede distinguir estas explicaciones; utilice revisiones de muestras de transcripciones o comentarios breves de los usuarios para investigar.

Sección 6

Utilice la duración como contexto, no como veredicto

La duración puede ayudar a responder preguntas operativas, como si un flujo en particular requiere rutinariamente muchos turnos. Sigue siendo una medida de la actividad transcurrida, no una evidencia directa de que una respuesta fuera útil. Google Analytics, por ejemplo, define el tiempo de interacción como la duración de la interacción del usuario asociada con eventos; su guía para desarrolladores también advierte que extender artificialmente las sesiones distorsiona los datos de comportamiento. Estas son definiciones analíticas y precauciones de implementación, no una medida de calidad para un chat creativo. Google Analytics, “Measurement Protocol reference” y Google Analytics, “Measure sessions and user engagement”

Compare el tiempo solo entre tareas similares y junto con la finalización de la tarea, la relevancia, el control del usuario y un punto final claro. Una duración mediana más corta podría reflejar una respuesta más directa, pero también podría reflejar que los usuarios se rinden. Una duración más larga podría significar una iteración productiva o una fricción innecesaria. La evidencia de respaldo tiene que provenir del resultado de la tarea y de lo que experimentaron las personas, no solo del reloj.

Sección 7

Una rutina de evaluación compacta

Para un estudio pequeño, asigne a los participantes una tarea creativa claramente redactada, permítales usar el chat de forma natural y registre si alcanzaron el resultado que definieron. Revise una muestra de intercambios en cuanto a relevancia, seguimiento del contexto y oportunidades para guiar o detener. Después de cada tarea, pregunte si obtuvieron un resultado útil y si se sintieron capaces de dirigir la conversación. Registre la duración como contexto y luego inspeccione los casos en los que la duración y la utilidad reportada discrepen.

Reporte las medidas por separado en lugar de condensarlas en una sola puntuación de «interacción». Especifique la tarea, cómo se juzgó la finalización, quién revisó las respuestas y cómo se recopilaron los comentarios de los usuarios. Si la muestra es pequeña o la definición de la tarea es subjetiva, describa los hallazgos como orientativos en lugar de generalizarlos a cada usuario o solicitud creativa.

Un intercambio breve tiene valor cuando lleva a la persona desde una solicitud específica hasta un resultado que pueda usar, dejándola al mismo tiempo en control del camino y del punto de detención. Mida esos resultados directamente. Deje que la duración de la sesión ayude a explicar la experiencia, pero no permita que defina el éxito.

Lecturas relacionadas

Sigue explorando este tema