Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blogblog+1Google Alphabet Inc. presentó el miércoles Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos modelos de texto a voz que la compañía describe como sus herramientas de generación de audio más expresivas hasta el momento. Ambos modelos comenzaron a implementarse de inmediato en la API de Gemini y en Google AI Studio.blog
El anuncio, redactado por el gerente de producto del grupo, Leland Rechis, y el director de investigación científica, Alan Cowen, en nombre del equipo de audio de Gemini, posiciona a los dos modelos como herramientas complementarias: Flash TTS para dirección creativa profunda y Flash-Lite TTS para aplicaciones de alto volumen y eficiencia de costos.unite+1
Gemini 3.8 Flash TTS permite a los usuarios crear voces originales desde cero mediante instrucciones en lenguaje natural, especificando el rol, el acento y las características vocales en más de 100 idiomas y dialectos. El lanzamiento amplía la biblioteca de voces de Google de 30 voces originales a más de 2,000 opciones listas para producción, cubriendo variedades regionales como el español mexicano, el francés de Quebec y el inglés escocés.ndtvprofit+2
Una función de replicación de voz puede recrear un perfil vocal a partir de una muestra de audio de 30 segundos, siempre que el usuario tenga los derechos sobre la voz. Google señaló que el sistema requiere una grabación de consentimiento verbal del propietario de la voz, y todo el audio generado lleva la marca de agua SynthID y credenciales C2PA. La replicación de voz a través de AI Studio no está disponible en Illinois, Texas, el Espacio Económico Europeo, el Reino Unido, Suiza e India.unite+1
Ambos modelos admiten dirección de rendimiento línea por línea, generación de formato largo durante horas de audio y puesta en escena nativa para dos hablantes en podcasts y narraciones dramáticas. Se pueden incluir señales no verbales como risas, suspiros e interjecciones de escucha activa en el diálogo.blog
Google informó que Gemini 3.8 Flash TTS obtuvo la primera posición en el Voice Design Benchmark de Hume AI con una puntuación de 71.4 y lideró el modelado de acentos con 60.8. Los dos modelos ocupan el primer y segundo lugar en el Índice de Calidad General de Hume AI. En evaluaciones ciegas de preferencia humana en Voice Arena, los modelos se clasificaron en la cima en idiomas como japonés, portugués brasileño, vietnamita e hindi.ndtvprofit+1
Las plataformas de desarrollo Agora, LiveKit, Pipecat y Vercel admiten los modelos a través de la API de Gemini, mientras que empresas como Figma, HeyGen, Linguana, Wondercraft, 99.co y Ollang están integrando los modelos TTS para doblaje, localización de medios y aplicaciones de agentes de voz. El acceso empresarial a través de Gemini Enterprise estará disponible próximamente.unite+2