Cómo crear una voz de IA para el buzón de voz con consentimiento y una divulgación clara
Para crear una voz de IA para el buzón de voz, elija una voz sintética permitida para el uso previsto o clone una voz con el permiso explícito del hablante. Redacte un saludo que identifique el buzón, indique claramente que la voz está generada por IA y explique a las personas que llaman cómo dejar un mensaje o utilizar otro método de contacto. Revise la pronunciación y, a continuación, pruebe el saludo mediante una llamada real. Esta guía está dirigida a personas adultas que van a configurar un saludo de buzón de voz habitual, ya sea personal o para un equipo pequeño. La tarea consiste en producir un mensaje de audio fijo que se reproduzca antes de que las personas que llaman dejen un mensaje de voz. El flujo de trabajo que se presenta a continuación combina principios de consentimiento y divulgación fundamentados en fuentes de referencia con recomendaciones prácticas de grabación.
Elija una voz y verifique cómo admite saludos su buzón
Comience con dos decisiones: qué voz quiere que escuchen quienes llamen y cómo instalará la grabación. Resuelva ambas cuestiones antes de pagar por la generación de voz.
Una voz de catálogo predeterminada es un punto de partida práctico cuando sonar como una persona en particular aporta poco valor. Si desea una clonación, revise los requisitos de registro reales del proveedor. Por ejemplo, la documentación de voz personal de Microsoft (https://learn.microsoft.com/en-us/azure/ai-services/speech-service/personal-voice-overview) exige el consentimiento explícito del usuario y una declaración grabada en la que se reconozca la creación y el uso de la voz. Además, el acceso a su API está restringido a clientes admisibles y casos de uso aprobados; no se trata de una herramienta de buzón de voz de uso libre para consumidores.
A continuación, abra la configuración de saludos de su servicio telefónico. Compruebe si permite subir archivos de audio, si ofrece su propia función de texto a voz (TTS) o si exige grabar a través de un micrófono. Si admite la subida de archivos, anote el formato aceptado, el tamaño de archivo y la duración antes de exportar.
No dé por sentado que todos los servicios cuentan con un botón para subir archivos. Las instrucciones oficiales de Google Voice para saludos (https://support.google.com/voice/answer/115069?hl=en) describen el proceso de grabar, previsualizar, guardar y seleccionar un saludo activo. Si su servicio solo permite grabar a través de un micrófono, reproducir el audio generado frente a dicho micrófono puede arrojar un resultado poco satisfactorio. Pruébelo antes de decidirse; una grabación convencional y clara es una alternativa útil a la que recurrir.
Obtenga un permiso específico antes de clonar a un hablante
Para este flujo de trabajo, pida al hablante que apruebe tanto la creación de la voz sintética como su uso previsto. Una grabación enviada con otro fin no debe considerarse una autorización para construir un modelo de voz reutilizable.
Conserve un breve registro por escrito que responda a estas preguntas:
Un alcance a modo de ejemplo podría ser: «Autorizo el uso de mi voz para generar el saludo que apruebe para el buzón compartido de nuestro estudio. Consúltame antes de generar una redacción modificada o utilizar la voz en cualquier otro lugar». Se trata de una forma práctica de hacer explícitas las expectativas, no de un sustituto del proceso de registro del proveedor.
Consulte las normas del servicio antes de subir la grabación de cualquier persona. Algunos servicios exigen que el propio hablante registre su voz directamente. La guía de divulgación de voz sintética de Microsoft (https://learn.microsoft.com/en-us/azure/foundry/responsible-ai/speech-service/text-to-speech/concepts-disclosure-guidelines), por ejemplo, establece requisitos específicos para las funciones de voz de usuarios externos, entre los que se incluye crear modelos únicamente a partir de la propia voz del usuario y grabar un reconocimiento facilitado.
En un equipo pequeño, designe a una persona responsable de reemplazar el saludo si el hablante retira su permiso o deja de formar parte del acuerdo. Tenga listo un saludo alternativo. Compruebe por separado cómo gestiona el proveedor la eliminación de las grabaciones subidas y de los modelos de voz; quitar un saludo de un buzón no completa esos otros pasos.
Redacte una divulgación que las personas que llamen puedan oír de inmediato
Sitúe la divulgación cerca del inicio, junto a la identificación del buzón. «Este saludo utiliza una voz generada por IA» es una fórmula directa y fácil de entender. Si se utiliza un clon autorizado, «Este saludo utiliza una versión de mi voz generada por IA» resulta más específico.
La divulgación y el consentimiento del hablante responden a cuestiones distintas. El consentimiento establece la conformidad del hablante con respecto al uso. La divulgación informa a quienes llaman sobre lo que están escuchando. La guía de divulgación de voz sintética de Microsoft (https://learn.microsoft.com/en-us/azure/foundry/responsible-ai/speech-service/text-to-speech/concepts-disclosure-guidelines) exige expresamente informar sobre las voces sintéticas para que los usuarios no sean engañados sobre si están interactuando o no con una persona real. Ese es un requisito del proveedor; la redacción que aquí se propone es una recomendación práctica para un saludo convencional.
Evite depender únicamente de una nota en un sitio web: es posible que quien llame no la vea nunca. Mantenga la divulgación hablada con el mismo volumen claro y el mismo ritmo que el resto del mensaje.
Siga este orden al redactar el borrador:
No haga que una grabación fija parezca un asistente interactivo. Expresiones como «Dígame qué necesita y le pondré en contacto» son inadecuadas a menos que el sistema telefónico ejecute realmente esa acción. Del mismo modo, una voz de catálogo predeterminada no debe presentarse con el nombre de un empleado real.
Establezca expectativas útiles y proporcione un contacto alternativo
La persona que llama debe terminar de escuchar el saludo sabiendo qué hacer a continuación. Por lo general, basta con solicitar el nombre, el número de teléfono y el motivo breve de la llamada. Evite pedir detalles que no necesite para devolver la llamada.
Indique un plazo de respuesta solo si puede cumplirlo. Si el equipo revisa los mensajes de lunes a viernes, indíquelo. Si no puede comprometerse con certeza a devolver la llamada al día siguiente, omita esa promesa. Si recibe llamadas desde distintas ubicaciones geográficas, incluya la zona horaria al indicar el horario de atención.
Elija una vía alternativa que esté supervisada de forma activa. Para un número personal, podría ser el envío de un SMS a ese mismo número, si es que admite mensajes de texto. Para un equipo pequeño, podría ser una dirección de correo electrónico compartida. Compruebe que alguien pueda acceder a ella y que siga siendo útil cuando la persona que suele revisar el buzón de voz esté ausente.
Dicte las direcciones de correo electrónico y los números con la lentitud suficiente para que se puedan anotar. Si una dirección es larga o difícil de entender al escucharla, elija una vía de contacto alternativa más sencilla que ya esté disponible. Nunca invente una dirección de contacto solo para rellenar el guion.
Dos guiones ilustrativos para saludos. Los nombres que aparecen a continuación son ficticios. Adapte la redacción a su identidad real, a los métodos de contacto de los que disponga y a su rutina habitual de revisión de mensajes.
Buzón personal:
Ha llamado al buzón de voz de Alex Morgan. Este saludo utiliza una versión de mi voz generada por IA. Por favor, deje su nombre, número de teléfono y un breve mensaje después de la señal. También puede enviar un mensaje de texto a este número. Responderé a su mensaje en cuanto esté disponible. Gracias.
Utilice esa versión solo si la voz es un clon autorizado por usted y el número recibe mensajes de texto. Si utiliza una voz de catálogo predeterminada, cambie la divulgación por: «Este saludo utiliza una voz generada por IA».
Buzón de un equipo pequeño:
Ha llamado al buzón de voz del equipo de Cedar Workshop. Este saludo utiliza una voz generada por IA. Revisamos los mensajes de lunes a viernes. Por favor, deje su nombre, número de teléfono y un breve mensaje después de la señal. También puede enviar un mensaje de texto a este número, y nuestro equipo revisará su mensaje en esos días. Gracias.
El ejemplo de equipo asume que ese mismo número admite mensajes que el equipo supervisa en la práctica. Si no es así, sustituya esa frase por un método de contacto verificado antes de generar el audio.
Genere el audio y revise la pronunciación
Una vez definidos el guion y los permisos de la voz, cree una breve prueba que contenga en primer lugar las palabras más difíciles. Incluya el nombre de la persona, el nombre del equipo y los datos de contacto. Esto le permitirá corregir problemas de pronunciación antes de generar el saludo completo.
En el caso de una voz clonada, siga las instrucciones de grabación y los pasos de verificación del proveedor elegido. Utilice un espacio silencioso y una grabación que contenga únicamente al hablante que ha dado su consentimiento. No dé por hecho que la duración de una muestra o el formato de grabación de otro servicio servirán.
Tanto para una voz de catálogo como para una clonada, opte por una locución clara y pausada. Empiece sin música de fondo para poder evaluar el mensaje hablado. Preste atención a cada uno de estos puntos:
Si una palabra no suena bien, utilice el control de pronunciación si el servicio lo ofrece, o pruebe a escribirla de forma fonética en el texto de generación. Guarde el guion escrito correctamente por separado para poder revisarlo. Vuelva a generar y escuche la frase completa tras cada cambio; juzgue el audio resultante, no solo el texto en el editor.
Pida a otro adulto que lo escuche una vez sin leer el guion. Pídale que repita la identidad del buzón, el contacto alternativo y el siguiente paso a seguir. Considere cualquier discrepancia como un motivo para corregir el texto. En el caso de una voz clonada, pida también al hablante que apruebe el audio exacto que se utilizará.
Instale el saludo y compruebe la experiencia de quien llama
Exporte utilizando la configuración compatible con su servicio telefónico o siga su proceso de grabación. Guarde el guion y el audio aprobados con un nombre de versión que pueda identificar fácilmente. Conserve el saludo funcional anterior hasta que el nuevo haya superado una llamada de prueba.
Confirme que el nuevo saludo esté activo. Guardar y activar pueden ser pasos independientes: las instrucciones de Google Voice (https://support.google.com/voice/answer/115069?hl=en) detallan de forma explícita la opción de seleccionar «Establecer como activo» para un saludo guardado.
Llame desde otro teléfono y deje que la llamada pase al buzón de voz. Escuche hasta oír la señal, deje un mensaje de prueba y confirme que llegue al lugar previsto. Compruebe si el inicio se corta, si el volumen es cómodo, si la divulgación se sigue entendiendo con claridad y si el contacto alternativo se comprende sin necesidad de tener el guion delante.
Si el resultado es difícil de seguir, simplifique la redacción o reduzca la velocidad de locución antes de volver a intentarlo. Si la reproducción sigue siendo deficiente, utilice el saludo predeterminado del servicio o una grabación convencional mientras resuelve el problema de instalación.
Lista de verificación para la grabación
Antes de activar el saludo, confirme lo siguiente:
Revise el saludo cuando cambien los datos de contacto, el horario, las responsabilidades del equipo o el permiso del hablante. Repita la comprobación auditiva y la llamada de prueba tras realizar modificaciones, sobre todo si un cambio afecta a nombres, números o a las indicaciones para quien llama.
