Texto a Voz
Convierte cualquier texto escrito en audio hablado natural — con docenas de voces y control total.
Ajustes de Voz
0 voces disponibles
Las voces provienen de tu dispositivo y sistema operativo — la selección varía según el navegador y la plataforma.
La síntesis de voz ha cruzado la línea de novedad robótica a tecnología genuinamente usable, y los navegadores modernos la traen incorporada: sin cuenta, sin clave de API, sin subir nada. Esta herramienta usa la Web Speech API, que dirige tu texto a través de las voces instaladas en tu dispositivo: en Windows las voces naturales de Microsoft, en macOS las de Apple, en Android las de Google. Esa arquitectura importa para la privacidad —con voces del dispositivo, el texto nunca sale de tu máquina— y explica las rarezas: qué voces ves depende de tu sistema operativo, y la calidad varía desde claramente sintética hasta casi indistinguible de una grabación.
Cómo funciona la herramienta
Escribe o pega texto, elige una voz de la lista que ofrece tu dispositivo, ajusta velocidad y tono si quieres, y pulsa hablar. El motor de voz del navegador sintetiza el audio en tiempo real: puedes pausar, reanudar o detener a mitad de locución. La lista de voces difiere según el dispositivo y los paquetes de idioma instalados: un equipo Windows con soporte de árabe instalado ofrecerá voces árabes, y añadir voces se hace en los ajustes de tu sistema operativo, no en el navegador.
Los controles
Velocidad 0,1 – 10 (1 = normal; 0,8–1,2 es el rango útil)
Tono 0 – 2 (1 = tono normal de la voz)
Volumen 0 – 1
Lista de voces = speechSynthesis.getVoices()
→ voces del dispositivo (sin conexión, privadas)
→ algunos navegadores añaden voces en la nube (online)
Velocidad de corrección: ~0,9 · Lectura rápida: 1,5–2,0La velocidad es el control que merece aprenderse. Bajar a 0,9 para corregir da a tu oído tiempo de atrapar errores sobre los que tu ojo resbala; subir a 1,5–2,0 funciona para consumir material conocido con rapidez, y los oyentes habituales se adaptan a velocidades sorprendentemente altas. Los valores extremos en cualquier dirección rompen el modelo de prosodia: por debajo de 0,5 o por encima de 3, la mayoría de las voces dejan de sonar a idioma. Los cambios de tono son cosméticos y sirven sobre todo para distinguir varios lectores.
Lo que conviene saber sobre la síntesis de voz
- 1Escuchar es un canal de corrección genuinamente distinto. Tus ojos se saltan palabras y autocorrigen erratas porque leer es predictivo; tus oídos no. Oír tu propio texto leído en voz alta destapa palabras que faltan, palabras dobladas y frases torpes que sobrevivieron varias pasadas visuales. Los escritores que lo adoptan rara vez lo abandonan.
- 2La calidad de la voz es una propiedad del dispositivo, no de la web. El mismo texto suena distinto en Windows, macOS y Android porque cada uno aporta su propio motor de síntesis. Si las voces que ves son pobres, instala mejores en los ajustes del sistema: las voces naturales de Windows y las premium de macOS son descargas gratuitas que superan dramáticamente a las predeterminadas.
- 3La puntuación es la API de la prosodia. Los motores pausan en las comas, bajan el tono en los puntos y lo suben en las interrogaciones: un texto con puntuación descuidada suena mal incluso con una voz perfecta. A la inversa, escuchar tu texto es una prueba afilada de si tu puntuación coincide de verdad con el ritmo que pretendías.
- 4Los números, abreviaturas y símbolos se adivinan. «Dr.» puede volverse doctor o drive; «2/3» puede ser fracción o fecha; «IV» puede ser cuatro o una vía intravenosa. Los motores adivinan por contexto y a veces fallan: para material de escucha crítico, escribe con todas las letras cualquier cosa ambigua.
- 5Para sesiones largas, algo lento y monótono gana a lo expresivo. Las voces muy expresivas enganchan durante minutos y fatigan durante horas; los narradores de audiolibros se entrenan hacia la uniformidad por la misma razón. Si usas la síntesis para consumir artículos, una voz plana a 1,1–1,3 es el ajuste sostenible.
Preguntas frecuentes
¿Se envía mi texto a un servidor?
Con voces del dispositivo —lo predeterminado en la mayoría de sistemas—, no: la síntesis ocurre enteramente en tu máquina y el texto nunca la abandona. Algunos navegadores también listan voces en la nube (a menudo marcadas como online o premium), que sí envían el texto a los servidores del proveedor. Si la privacidad importa para tu texto, elige una voz del dispositivo; si la herramienta funciona con la red desconectada, la voz es local.
¿Por qué las voces disponibles difieren entre mis dispositivos?
Porque el navegador expone los motores de voz que proporciona el sistema operativo. Windows, macOS, iOS y Android traen voces distintas, y los paquetes de idioma instalados amplían la lista. Por eso los nombres de las voces parecen específicos de cada plataforma. Para conseguir más o mejores voces, añádelas en los ajustes de idioma y voz de tu sistema: la lista del navegador se actualiza sola.
¿Puedo descargar la voz como archivo de audio?
No directamente: la Web Speech API reproduce el audio deliberadamente sin exponer el flujo, así que no hay botón de guardar incorporado. Existen rodeos: la grabación de audio del sistema captura cualquier cosa reproducida, y los servicios dedicados de síntesis generan archivos descargables. Para escucha personal, la reproducción en vivo cubre casi todo; para producir recursos de audio, un servicio que genere archivos es la herramienta correcta.
¿Por qué la voz pronuncia mal algunas palabras?
Los motores de síntesis convierten texto en sonido usando diccionarios de pronunciación más reglas letra-a-sonido, y ambos fallan con nombres propios, jerga técnica, préstamos lingüísticos y abreviaturas ambiguas. No hay arreglo accesible al usuario en la API del navegador, pero la falta de ortografía deliberada funciona como truco práctico: escribir un nombre fonéticamente produce el sonido correcto aunque el texto sea técnicamente incorrecto.
¿Funciona la síntesis en idiomas distintos del inglés?
Sí, en cualquier idioma con una voz instalada: la jerarquía de calidad sigue en general el tamaño del mercado, con los idiomas mayores recibiendo voces casi humanas y los menores un trato más mecánico. La voz debe coincidir con el idioma del texto: una voz inglesa leyendo texto árabe lo deletrea de forma inservible. Si tu idioma falta en la lista, instala su paquete de idioma a nivel del sistema y las voces aparecerán.