Blog de Metlivi

Lo que los lectores simulados por IA pueden —y no pueden— decirte sobre tu redacción

Si estás revisando una página, guía o conjunto de instrucciones, un modelo de lenguaje puede ayudarte a detectar términos que podrían confundir al lector. Puede señalar una frase poco clara, describir una posible mala interpretación o comprobar si un borrador parece responder a una pregunta formulada. Sin embargo, una reacción simulada no puede demostrar que tus lectores objetivo hayan entendido el texto, hayan aportado el contexto adecuado o hayan completado la tarea que este describe. Para eso, observa a unas cuantas personas reales de tu audiencia intentar realizar la tarea y explicar qué comprendieron.

30 de septiembre de 20266 min de lecturaLectura, arte y culturaPor Metlivi Editorial Team
Sección 1

Qué puede criticar de forma útil un modelo en un borrador

Un modelo puede examinar las palabras y la estructura que le proporciones. Pídele que identifique términos que puedan resultar desconocidos, pasos que parezcan faltar, instrucciones con más de un significado plausible o preguntas que el borrador deje sin responder. También puedes pedirle que indique qué evidencia en el texto le llevó a cada observación. Esto resulta útil como una primera revisión editorial: genera posibles aspectos que investigar, no conclusiones sobre lectores reales.

Mantén la tarea concreta. Por ejemplo, con una página que explica cómo elegir una excursión de un día, pide al modelo que señale qué detalles necesitaría un lector para comparar opciones y en qué lugar aparecen esos detalles. Solicita pasajes específicos y un posible malentendido, y luego contrasta cada sugerencia con tu propósito y con el texto. Una respuesta fluida no es prueba de que ninguna persona real vaya a leer el pasaje de esa manera.

Los prompts de tipo 'persona' pueden aportar cierta estructura útil, pero una descripción como “un visitante primerizo ocupado” no convierte al modelo en ese visitante. Las investigaciones sobre el 'persona prompting' descubrieron que sus beneficios dependían de si las variables del perfil coincidían con patrones en las anotaciones humanas; en muchos conjuntos de datos subjetivos, esas variables explicaban muy poco de la variación. Trata las reacciones basadas en perfiles ficticios como hipótesis, no como una muestra representativa de la opinión de la audiencia. Hu y Collier, “Quantifying the Persona Effect in LLM Simulations”

Sección 2

Lo que las reacciones simuladas no pueden determinar

La respuesta de un modelo no puede determinar qué notó, dedujo, recordó o hizo un lector en particular. Recibe un texto y una instrucción, y luego genera una respuesta. Un lector real se enfrenta al material con sus propios conocimientos, objetivos, distracciones, expectativas y situación personal. Esos factores determinan si una frase tiene sentido y si la persona puede actuar en consecuencia.

Esta diferencia es fundamental cuando la pregunta es de comportamiento: ¿Puede alguien encontrar la información correcta? ¿Interpreta una indicación tal como se pretendía? ¿Puede completar la tarea sin ayuda? Un modelo puede razonar sobre estas preguntas, pero su relato de lo que haría sigue siendo texto generado. No ha navegado de forma independiente por la página ni ha demostrado que una persona de tu audiencia pueda utilizarla.

La investigación sobre simulaciones con modelos también advierte contra interpretar respuestas vívidas o diversas como evidencia de fidelidad. Un estudio de 2025 sobre la simulación de respuestas a encuestas reveló que los enfoques analizados tenían dificultades para reproducir con precisión las respuestas de los usuarios; los modelos podían mantener puntos de vista a pesar de los cambios demográficos y les costaba adaptarse a diferencias matizadas entre perfiles. Ese estudio no evalúa directamente cada crítica de redacción o prueba de usabilidad, pero respalda un límite práctico: un lector simulado que suena verosímil no valida la forma en que responderá una audiencia real. Yu et al., “An Analysis of Large Language Models for Simulating User Responses in Surveys”

Sección 3

Lo que puede revelar una prueba reducida con lectores reales

Una pequeña prueba cualitativa puede mostrar dónde dudan los participantes reales, qué pasan por alto, cómo interpretan una frase y si llegan al objetivo previsto. Puedes asignar a cada persona una tarea realista, dejar que use el borrador o la página y observar qué sucede. Las preguntas de seguimiento pueden aclarar qué creían que significaba una palabra o por qué eligieron un paso determinado. Esto combina el comportamiento observable con las propias explicaciones del participante.

Para una tarea centrada en el contenido, define el éxito antes de la sesión. Si el texto es una guía para excursiones de un día, por ejemplo, podrías pedir a un participante que elija una opción que se ajuste a una preferencia declarada y que explique qué información influyó en esa elección. Toma nota de si encuentra los detalles pertinentes, qué palabras o secciones le hacen dudar y si su explicación coincide con las diferencias que la guía pretendía transmitir. Este ejemplo es una propuesta de diseño de prueba, no una afirmación sobre ninguna guía o resultado concreto.

Las directrices gubernamentales sobre pruebas cualitativas de usabilidad recomiendan reclutar a personas que podrían ser usuarios, asignarles una tarea, evitar instrucciones excesivas y revisar posteriormente la finalización de la tarea y los errores comunes. De manera similar, Nielsen Norman Group describe los estudios de usabilidad como una forma de investigar si el contenido es fácil de encontrar y entender, o si las personas pueden completar una tarea. Ambos enfoques hacen hincapié en observar lo que hacen los participantes; esa es una evidencia que una respuesta simulada no puede aportar. GOV.UK, “Usability testing: qualitative studies”, Nielsen Norman Group, “Checklist for Planning Usability Studies”

Sección 4

Cómo llevar a cabo una prueba pequeña y útil

Comienza con una decisión o tarea que el texto deba respaldar. Recluta a personas que se parezcan a la audiencia prevista en aspectos relevantes, especialmente en su experiencia con el tema. Luego, redacta un escenario que les dé una razón para usar el material sin decirles dónde está la respuesta ni qué palabras deben buscar. Una tarea que repita textualmente una etiqueta de la página puede, sin querer, evaluar la coincidencia de palabras en lugar de comprobar si el contenido ayuda a cumplir un objetivo; NN/G recomienda redactar tareas concretas sin pistas que condicionen el comportamiento.

Durante la sesión, deja que los participantes avancen con una orientación mínima. Registra lo que hacen, dónde se detienen, qué dicen con sus propias palabras y si completan la tarea. Si piden ayuda, anota en qué momento la necesitaron. Después, pídeles que describan lo que entendieron y qué harían a continuación. La guía de GOV.UK sugiere de cinco a seis participantes para pruebas cualitativas de usabilidad; NN/G recomienda generalmente cinco para estudios cualitativos tradicionales. Estos son puntos de partida prácticos para detectar problemas, no tamaños de muestra diseñados para que los hallazgos sean representativos de toda una población. Si necesitas porcentajes o comparaciones generalizables, requieres un diseño cuantitativo con una muestra mayor y variables controladas. GOV.UK, “Usability testing: qualitative studies”, NN/G, “Quantitative vs. Qualitative Usability Testing”

Sección 5

Convierte las observaciones en revisiones, no en conclusiones generales

Tras unas cuantas sesiones, busca obstáculos recurrentes y fallos aislados pero de gran impacto. Si varios participantes interpretan mal la misma frase, es un motivo claro para revisarla. Si una persona no logra completar una tarea, analiza las condiciones y pregúntate si ese fallo es relevante para el público al que te diriges; no tomes una sola sesión como una tasa aplicable a toda la población. Un estudio cualitativo pequeño está pensado para visibilizar problemas y orientar cambios, no para estimar cuántas personas de una audiencia más amplia los tendrán. NN/G señala que los resultados cualitativos dependen de la muestra de participantes y de la interpretación del investigador, mientras que las afirmaciones numéricas de usabilidad requieren un estudio cuantitativo con el tamaño adecuado.

Corrige el texto y luego prueba la versión revisada con nuevos lectores siempre que sea posible. Un modelo puede ayudarte a explorar redacciones alternativas o a señalar nuevas ambigüedades entre una ronda y otra. Mantén bien diferenciados los tipos de evidencia en tus notas: “el modelo predijo que esto podría ser confuso” es un punto de partida para investigar; “dos participantes interpretaron este paso de forma diferente y uno no llegó al final” es una observación directa de una prueba. Ninguna de las dos cosas demuestra por sí sola que todos los lectores tendrán la misma experiencia, pero la segunda te dice exactamente qué ocurrió en la tarea observada.

Sección 6

Una división práctica del trabajo

Utiliza el modelo para generar preguntas sobre el borrador. Recurre a lectores reales para responder a las dudas sobre la comprensión real y la realización de las tareas. Cuando la tarea dependa de una audiencia específica, un entorno concreto o una experiencia previa, busca participantes que cumplan esas condiciones en lugar de pedirle a un modelo que se las invente. Y cuando necesites una tasa o una comparación fiable, diseña un estudio cuantitativo en lugar de forzar un puñado de sesiones cualitativas para formular una afirmación estadística.

Esta división permite que la crítica simulada agilice las revisiones sin confundir una reacción verosímil con pruebas fehacientes del éxito del lector. La cuestión decisiva no es si el modelo puede producir la voz convincente de un lector; es si el lector real al que te diriges puede entender el material y hacer lo que el texto está pensado para ayudarle a conseguir.

Lecturas relacionadas

Sigue explorando este tema