Prueba recorridos completos, no respuestas aisladas
Una prueba útil no reúne solamente algunas respuestas correctas: recorre experiencias completas. Incluye primera sesión, cuenta antigua con historial, cambio de idioma y formato, dispositivo compartido, conexión interrumpida, bloqueo y denuncia, compra, exportación, borrado y conducta después de actualizar. Cada recorrido comienza con un límite esperado y termina comprobando la recuperación. El programa ARIA del NIST separa pruebas del modelo, equipo adversarial y prueba de campo; una respuesta es solo una capa del producto. Utiliza contenido ficticio neutro, cuentas dedicadas y controles normales. No introduzcas datos ajenos ni busques resultados peligrosos. Anota lo ocurrido, lo que sigue sin saberse y si la persona puede volver a un estado comprensible.
Prepara una ficha de siete campos
Escribe contexto, estado de cuenta, variación de entrada, límite esperado, resultado observable, ruta de recuperación y evidencia guardada. El contexto incluye dispositivo, versión, idioma, red y plan. El estado distingue usuario nuevo, regreso con historial, restricción, cierre de sesión o borrado pendiente. Cambia longitud, tono, ortografía, idioma y medio conservando la tarea. La expectativa describe una conducta concreta, no «funciona bien». Registra mensajes, visibilidad de datos, acciones externas y cambios de estado. Comprueba deshacer, repetir, bloquear, denunciar, cancelar, salir o solicitar ayuda. Elimina contraseñas, tokens y material de terceros de las pruebas. Repetir la ficha después de una versión produce una comparación en lugar de una impresión.
Incluye identidad, memoria y cambios de dispositivo
Prueba registro, recuperación, lista de sesiones, salida y regreso en un segundo dispositivo. Compara una sesión nueva, una cuenta con historial y la misma cuenta después de borrarlo. En un dispositivo compartido observa vistas previas de notificaciones, pantalla de apps recientes, autocompletado, medios descargados y acceso local tras salir. Cambia por separado idioma de interfaz y de entrada; una pantalla traducida no demuestra los mismos límites en controles y respuestas. Interrumpe un borrador, carga, compra o eliminación mediante modo avión, segundo plano, reinicio o sesión caducada. Busca duplicados, pérdidas y estados ambiguos. Estas transiciones exponen fallos que una conversación continua no muestra.
Prueba por separado texto, voz, imagen y contenido externo
Cada superficie tiene permisos, transformaciones, almacenamiento y errores diferentes. Expresa una tarea ficticia inocua de forma breve, larga, con errores, citas, hipótesis e idiomas mezclados. Para voz, observa momento del permiso, indicador de grabación, transcripción, borrado y alternativa tras fallar. Para imagen, utiliza material neutro propio y comprueba carga, vista previa, retirada, tratamiento declarado de metadatos e interrupción. Si la app abre enlaces, archivos, páginas o herramientas, incluye texto externo inocuo que contradiga la petición y comprueba que la intención original mantenga prioridad. Los riesgos de OWASP muestran que manipulación de entradas y exposición de información ocurren en los límites de la aplicación, no solo en las palabras de una respuesta.
Sigue los controles de interacción de principio a fin
Cuando existen mensajes, seguidores, comentarios, regalos o espacios, comprueba valores de visibilidad, público, silencio, bloqueo, denuncia, conservación de pruebas, información para recurrir y estado en ambas cuentas. Bloquear no queda validado si cambia una pantalla pero deja notificaciones, enlaces antiguos, grupos u otro canal. Usa dos cuentas de prueba claramente nombradas y no involucres a nadie sin aviso. Para una denuncia, emplea contenido inocuo y detente antes de enviar si cargaría una cola real sin ruta de prueba. Separa el formulario que funciona de la resolución confirmada. El plazo y el resultado pueden permanecer desconocidos y deben registrarse así.
Añade dinero, salida y regresión tras actualizaciones
Comprueba nivel gratuito, final de prueba, aviso de renovación, autenticación, pago rechazado, cancelación, fin del acceso y diferencia entre borrar la cuenta y detener la facturación de la tienda. Usa medios de prueba seguros y evita compras innecesarias. Examina exportación, borrado individual, solicitud de eliminación, confirmaciones anunciadas y visibilidad durante la espera. Tras cambios de app, modelo, política, permisos o pagos, repite recorridos importantes. Google aconseja datos propios del producto y entradas variadas porque las referencias generales no representan cada configuración. Mantén una regresión corta con dispositivo compartido, carga interrumpida, usuario bloqueado, suscripción cancelada e historial eliminado.
Evalúa cobertura mediante la recuperación
Una respuesta elegante no compensa una solicitud de borrado perdida, visibilidad inesperada, cobro incierto, carga detenida o control irreversible. Clasifica las fichas en confirmado, condicionado, contradicho y desconocido. Prioriza lo desconocido que combine datos, acción externa, dinero o un estado difícil de invertir. Un fallo debe incluir estado inicial, reproducción mínima, resultado visible, intento de recuperación y versión; «falló la AI» es demasiado amplio. Un éxito también declara su alcance. La regla práctica es que, cuando se rompe el recorrido ideal, una persona corriente pueda ver el estado, entender lo sucedido y alcanzar un siguiente paso documentado. De lo contrario, la prueba sigue abierta.
Preguntas frecuentes
¿Cuántas entradas hay que probar?
No existe una cifra universal. Cubre recorridos, variaciones, límites y recuperación, y añade casos de cambios y fallos observados.
¿Deben los usuarios intentar ataques?
No. Las pruebas adversariales especializadas requieren un entorno autorizado y controlado.
¿Basta un buen indicador del modelo?
No. La app incluye cuenta, historial, permisos, herramientas, interacción, pagos, almacenamiento y recuperación.
