Blog de Metlivi

Más allá de sonar humano: cuatro mejores objetivos para el diseño de chats con IA

Para los diseñadores que definen una interacción de chat con IA, «hacer que parezca real» es demasiado impreciso para guiar decisiones útiles. Un objetivo más acertado es ayudar al usuario a obtener una respuesta clara, explorar una idea, comprender qué ha hecho el sistema y elegir el siguiente paso. Las investigaciones sobre señales antropomórficas sugieren que los rasgos de apariencia humana pueden alterar la percepción de qué tan precisa es la información que proporciona una IA. Esto convierte la claridad, el juego creativo, el estado fiable de las tareas y el control por parte del usuario en objetivos de diseño más útiles que la imitación de una identidad humana.

30 de septiembre de 20267 min de lecturaLectura, arte y culturaPor Metlivi Editorial Team
Sección 1

¿Por qué el chat con IA debería aspirar a más que a la semejanza humana?

Una conversación puede sonar fluida sin ofrecer al usuario una imagen fidedigna del sistema. En un experimento con 2165 participantes, los investigadores variaron si un modelo de seudolenguaje utilizaba solo texto o voz combinada con texto, y si se refería a sí mismo como «yo» o como «el sistema». La voz combinada con texto aumentó las valoraciones de antropomorfismo y precisión de la información por parte de los participantes; el uso de la primera persona incrementó las valoraciones de precisión y redujo el riesgo percibido en un contexto determinado. Aunque estos hallazgos son específicos de las condiciones del estudio, demuestran que una señal que hace que un sistema parezca más humano también puede influir en los juicios sobre su información. Google Research, «Believing Anthropomorphism: Examining the Role of Anthropomorphic Cues on User Trust in Large Language Models»

Por esa razón, las señales antropomórficas y la calidad de la interacción merecen auditorías independientes. Una auditoría de señales antropomórficas indaga qué sugiere la interfaz sobre la identidad o las cualidades humanas de la IA. Una auditoría de riesgo de juicio evalúa si una señal podría inducir a los usuarios a sobrestimar la precisión o fiabilidad de sus resultados. Los objetivos de diseño que figuran a continuación abordan una cuestión distinta: ¿qué debería ser capaz de entender, hacer y decidir una persona durante el intercambio? Un tono cercano y cálido puede coexistir con estos objetivos, siempre que no oculte las capacidades del sistema ni el estado de la tarea.

El Human-AI eXperience Toolkit de Microsoft organiza sus directrices en torno al comportamiento de un sistema de IA en el primer uso, durante la interacción, cuando comete un error y a lo largo del tiempo. Dicha estructura resulta útil para el diseño de chats porque desplaza el foco de atención desde la personalidad de un personaje hacia las necesidades cambiantes de la persona que utiliza el sistema. Microsoft, «Guidelines for Human-AI Interaction»

Sección 2

Hacer de la claridad una característica visible de la conversación

La claridad comienza con la tarea del usuario, no con una voz perfectamente conversacional. Quien pide tres ideas de actividades de fin de semana necesita opciones que pueda comparar; quien solicita una reescritura necesita un borrador que pueda revisar. La interfaz debe facilitar la distinción entre la acción solicitada y el resultado ofrecido. Si la IA sugiere, resume o transforma contenido, identifique esa aportación de forma directa y conserve el contexto suficiente para que el usuario pueda evaluarla.

Una interacción eficaz también puede mostrar lo que la IA puede y no puede hacer en el momento exacto en que esa información es relevante. Por ejemplo, si un asistente de chat puede proponer un plan pero no puede hacer una reserva, la respuesta no debe dejar la acción en la ambigüedad. Especifique qué está listo, qué requiere aún la intervención del usuario y qué detalles siguen siendo inciertos. Esta es una recomendación de diseño derivada del énfasis de HAX en mantener un comportamiento adecuado durante toda la interacción, y no la afirmación de que un mismo patrón de redacción funcione en todos los productos.

Una comprobación sencilla de claridad consiste en preguntar a alguien tras un breve intercambio: ¿Qué le pediste que hiciera al sistema? ¿Qué hizo realmente? ¿Qué necesitarías comprobar o decidir antes de utilizar el resultado? Si las respuestas no coinciden con la intención de la interfaz, revise la redacción, la estructura o las indicaciones del siguiente paso antes de añadir más personalidad.

Sección 3

Aprovechar el juego para fomentar la exploración

El carácter lúdico brinda a las personas una vía para explorar una herramienta y sus posibilidades. En un estudio de 372 publicaciones generadas por usuarios sobre ChatGPT, los investigadores identificaron intercambios lúdicos que incluían bromas, desafíos al sistema y pruebas de sus límites. Los autores describen estas interacciones como una forma en que las personas exploran las capacidades y la agencia de la IA, señalando al mismo tiempo que la muestra refleja publicaciones de un período inicial de uso de ChatGPT. Nikghalb y Cheng, «Interrogating AI: Characterizing Emergent Playful Interactions with ChatGPT»

Para los diseñadores, la implicación práctica no es transformar a cada asistente en un comediante. Se trata de facilitar la experimentación sin consecuencias: ofrecer opciones para probar un enfoque distinto, comparar alternativas o modificar un borrador sin perder la versión previa. Una indicación creativa breve como «Dame tres temas inesperados» puede invitar a la exploración manteniendo visible el objetivo del usuario. El juego debe ser una modalidad accesible, no una actuación que el usuario deba tolerar a la fuerza.

La investigación sobre herramientas lúdicas de creación conjunta entre humanos e IA distingue el carácter lúdico de la creatividad, al tiempo que describe el juego como un posible facilitador de respuestas creativas. Analiza la interfaz, el comportamiento de la IA y el diálogo como oportunidades de diseño, considerando la faceta lúdica como una experiencia que se debe respaldar y no como un resultado garantizado. Liapis et al., «Designing for Playfulness in Human-AI Authoring Tools»

Sección 4

Mantener legible el estado de la tarea a lo largo de los turnos

Una interfaz de chat puede parecer natural y, aun así, perder el hilo del trabajo. El estado de la tarea comprende el objetivo actual del usuario, las decisiones ya tomadas, las opciones aún abiertas y el siguiente paso. Cuando el intercambio consta de varios pasos, un resumen compacto puede reflejar la comprensión actual del sistema: «Le quedan dos opciones; prefiere una caminata corta; aún no he seleccionado una ubicación». Esto brinda al usuario la oportunidad de corregir la información antes de continuar la conversación.

El patrón de interacción debe ajustarse a la complejidad de la tarea. El artículo de Ding y Chan sobre la cocreación de texto entre humanos e IA distingue entre la curaduría de alcance definido, las tareas creativas independientes y las tareas creativas complejas e interdependientes. Asocia estas modalidades con distintos patrones de interacción, desde la intervención puntual hasta la colaboración iterativa. La deducción útil para el diseño es que una respuesta en un único turno puede ser adecuada para un resumen acotado, mientras que una tarea creativa en desarrollo se beneficia de turnos que muestren opciones y permitan a la persona dar forma al resultado. Ding y Chan, «Mapping the Design Space of Interactions in Human-AI Text Co-creation Tasks»

Para una verificación práctica del estado, rastree una tarea representativa a lo largo de la conversación. En cada turno, pregúntese si la persona puede identificar qué se ha completado, qué queda pendiente y cómo corregir una suposición errónea. Si la respuesta depende de recordar varios turnos anteriores, agregue un resumen conciso o una lista visible de decisiones. Si el sistema no puede conservar un detalle con fiabilidad, evidencie esa limitación en lugar de dar a entender una continuidad inexistente.

Sección 5

Otorgar un control significativo a los usuarios

El control consiste en dotar a la persona de una vía práctica para orientar o modificar la interacción. En un chat, esto puede ser tan simple como permitir elegir entre varias opciones, editar un borrador generado, modificar una restricción o pedir al sistema que se detenga y resuma. Estos controles resultan más valiosos cuando inciden en una decisión relevante para el usuario; un menú de ajustes que no altera nada significativo añade complejidad sin aportar control real.

Un experimento con un agente conversacional en debates grupales comparó distintas formas de definir las expectativas sobre su capacidad para detectar a los participantes con baja aportación. Se evaluaron la provisión de datos sobre su precisión, la explicación del enfoque y los datos de detección, y un control de ajuste. En ese estudio concreto, la explicación ayudó a los usuarios a entender el algoritmo y resultó la más eficaz en general; proporcionar únicamente un control de ajuste dio lugar a una percepción más negativa de la experiencia del debate. Este hallazgo advierte contra la idea de dar por útil un control por el mero hecho de existir: explique qué cambia y asegúrese de que la consecuencia sea comprensible. Do et al., «Inform, Explain, or Control: Techniques to Adjust End-User Performance Expectations for a Conversational Agent Facilitating Group Chat Discussions»

Una secuencia práctica de diseño es: mostrar la interpretación actual, ofrecer un número reducido de acciones siguientes relevantes y simplificar la corrección. Por ejemplo, tras generar un plan de excursión, el sistema podría preguntar si se desea acortar la ruta, cambiar una actividad o conservar el borrador. Cada opción describe una modificación concreta. El ejemplo es ilustrativo: describe un patrón general de interacción y no la función de un producto específico.

Sección 6

Convertir los objetivos en una lista de comprobación de revisión

Al evaluar el diseño de un chat, analice una tarea habitual de principio a fin. Compruebe si el primer intercambio deja claro el rol del sistema; si el usuario puede distinguir entre una sugerencia y una acción completada; si un turno de exploración invita a la experimentación sin imponer un personaje cómico; y si la conversación refleja con precisión las decisiones tomadas y los pasos pendientes. A continuación, revise si la persona puede corregir al sistema y comprender el efecto de cada control disponible.

Por último, revise el lenguaje y la presentación para detectar señales que puedan sugerir una identidad humana o una fiabilidad excepcional. Evalúe si las afirmaciones en primera persona, la voz, el tono emocional o un avatar de apariencia humana podrían condicionar el juicio del usuario sobre una respuesta. Esta revisión complementa, en lugar de sustituir, la comprobación de si la interacción es comprensible y útil. El criterio definitivo de un buen diseño de chat es si la persona puede llevar a cabo su propia tarea con una visión clara de la contribución de la IA y del siguiente paso a dar, y no si el diálogo parece una conversación con un ser humano.

Lecturas relacionadas

Sigue explorando este tema