Gemini 3.8 Flash TTS: voces nuevas y clonado con permiso

Google saca en la API de Gemini los modelos TTS 3.8 Flash y Flash-Lite (22 sep 2026): voces a medida, clonado con consentimiento y 150+ voces.

El 22 de septiembre de 2026 Google soltó sus modelos de voz de nueva generación. Dos de golpe: Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, los dos en disponibilidad general (GA) dentro de la API de Gemini.

Y no viene solo el modelo. Viene con diseño de voces a partir de un texto, replicación de voz con verificación de consentimiento, una biblioteca de más de 150 voces y un endpoint nuevo para consultarlas.

O sea, que Google se ha metido de lleno en el terreno donde llevan años ElevenLabs y compañía. A ver, el anuncio dice poquito. Pero lo que dice es interesante, así que vamos con eso y solo con eso.

¿Qué son exactamente los dos modelos nuevos?

Son modelos de texto a voz. Le das un texto, te devuelven audio. Lo que cambia entre ellos es para qué están pensados.

ModeloIDPara qué dice Google que es
Gemini 3.8 Flash TTSgemini-3.8-flash-ttsEl creativo. Fidelidad de voz de estudio, interpretación con matices, dialectos regionales y estabilidad en piezas largas de varios turnos
Gemini 3.8 Flash-Lite TTSgemini-3.8-flash-lite-ttsEl rápido y barato. Pensado para producción de mucho volumen y para cascadas de agentes de voz en tiempo real

El segundo tiene una función concreta: Google dice que está construido para sustituir a gemini-3.1-flash-tts-preview, el modelo TTS que hasta ahora estaba en preview. Ojo con esto, porque el anuncio no dice que el antiguo se apague ni pone fecha de apagado. Dice que el nuevo viene a reemplazarlo. No es lo mismo, y me da que a más de uno le va a tocar mirar la página de deprecaciones dentro de unos meses.

Lo de "dialectos regionales" en el modelo grande es la parte que me interesa a mí. El anuncio no concreta qué dialectos, así que no te voy a decir que el español de España suena perfecto, porque no lo sé. Lo que sí sé es que Google lo pone por escrito en la ficha del modelo grande, al lado de la fidelidad de estudio, la interpretación con matices y la estabilidad en piezas largas.

Voice design, Voice replication y 150 voces

Aquí está la carne. Junto a los modelos, Google lanzó tres cosas que antes no existían en la API:

Voice design. Creas personas vocales propias y persistentes a partir de un prompt de texto. O sea, describes la voz que quieres y te la fabrica, y se queda guardada para volver a usarla.

Voice replication. Replicas voces con verificación de consentimiento. Esa segunda parte es la clave y me alegra bastante verla ahí: no es "sube un audio y a correr", hay un paso de verificación. El anuncio no explica cómo funciona esa verificación, así que tampoco te lo voy a inventar.

Extended Voice Library. Una biblioteca desde la que puedes consultar más de 150 voces, entre prefabricadas y propias. Y para eso está el endpoint nuevo, /v1beta/voices, que es literalmente el sitio donde preguntas "¿qué voces tengo disponibles?".

Para las tres, el anuncio remite a una sola guía: la de Text-to-speech. Si quieres empezar por algún sitio, la web oficial de Gemini es la puerta de entrada, y de ahí a esa guía de la API.

¿Esto es para mí si no programo?

Aquí viene el matiz importante, y prefiero decirlo pronto que dejarte con la ilusión.

Esto está anunciado en el changelog de la API de Gemini. Es decir, está pensado para que alguien lo conecte a algo: una app, un flujo automatizado, un agente de voz. El anuncio no dice nada de que estas voces lleguen a la aplicación de Gemini que usas en el móvil o en el navegador. Igual llegan. Igual no. No está en el anuncio, así que es una duda, no un dato.

Lo mismo con el dinero, y esto es lo que más me chirría: el anuncio no da ni un precio. No dice cuánto cuesta el modelo grande, no dice cuánto el Lite, no dice si hay cupo gratis para probarlo, no dice si el clonado se factura aparte. Nada. Lo único que dice sobre coste es que el Flash-Lite TTS es "rentable" y de bajo coste, que es exactamente el tipo de frase que no te sirve para hacer un cálculo.

Así que si estás pensando "¿me sale más barato que lo que pago ahora?", la respuesta honesta de hoy es: no se puede saber con lo publicado.

¿Y si ya pagas ElevenLabs o Murf?

No corras a cancelar nada. De verdad.

Lo que hay encima de la mesa es un anuncio de capacidades sin precios, sin idiomas concretos y sin nada que puedas comparar en una tabla al lado de lo que ya usas. Y lo que ya usas, si lo tienes montado, funciona hoy.

Si vienes de cero y estás decidiendo, tengo el terreno bastante pisado por aquí. Te dejo el tutorial de cómo clonar tu voz con ElevenLabs para que veas el flujo completo de una herramienta madura, y las alternativas a ElevenLabs para clonar voz por menos dinero si lo que te frena es la factura. Cuando Google publique precios, este post se actualiza y ahí sí se podrá comparar.

Donde sí veo movimiento pronto es en los agentes de voz. Google dice explícitamente que el Flash-Lite TTS está hecho para "cascadas de agentes de voz en tiempo real", y eso apunta a las herramientas que montan agentes telefónicos por debajo. Si te interesa ese mundo, tengo probados los mejores agentes de voz con IA de 2026 llamándome a mí mismo como un desgraciado. Ninguno de ellos ha anunciado que vaya a usar esto, que quede claro. Pero es el sitio natural donde acaba un modelo TTS rápido y barato.

El patrón de Google estas semanas

Esto no llega solo. Google lleva un mes soltando modelos a un ritmo que da vértigo: Gemini 3.8 Flash el 2 de septiembre, Lyria 3.5 el día 3, los dos modelos Live el 15, y estos dos de voz el 22.

Y en medio, el 18 de septiembre, limitó el acceso a los modelos 2.5 a quien ya los usaba. O sea, mientras abre por arriba, cierra por abajo. Grábatelo a fuego si tienes algo montado sobre un modelo de Gemini: la puerta de atrás se estrecha al mismo tiempo que la de delante se ensancha.

Yo con esto voy a esperar. No porque no me flipe, que me flipa. Sino porque montar un flujo de voz sobre un modelo del que no sabes el precio es la forma más tonta de llevarte un susto a final de mes. Cuando aparezca la cifra en la página de precios, lo pruebo y te cuento qué tal suena en español de España, que es lo único que me importa de verdad.

Antes de meterte a montar agentes de voz y clonar cosas, igual te viene bien saber por dónde andas. Tengo un test de dos minutos que te dice tu nivel real con la IA y qué toca aprender después: ¿cuál es tu nivel de IA?

Relacionado

Sigue leyendo