Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blogblog+1Google Alphabet Inc. a introduit mercredi Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles de synthèse vocale qu'il qualifie d'outils de génération audio les plus expressifs à ce jour. Les deux modèles ont commencé à être déployés immédiatement via l'API Gemini et Google AI Studio.blog
L'annonce, rédigée par le chef de produit du groupe Leland Rechis et le directeur de la recherche scientifique Alan Cowen au nom de l'équipe Gemini Audio, positionne ces deux modèles comme des outils complémentaires : Flash TTS pour une direction créative approfondie et Flash-Lite TTS pour des applications à haut volume et rentables.unite+1
Gemini 3.8 Flash TTS permet aux utilisateurs de créer des voix originales à partir de zéro via des instructions en langage naturel, en spécifiant le rôle, l'accent et les caractéristiques vocales dans plus de 100 langues et dialectes. Ce lancement élargit la bibliothèque vocale de Google, passant de 30 voix originales à plus de 2 000 options prêtes pour la production, couvrant des variétés régionales telles que l'espagnol mexicain, le français québécois et l'anglais écossais.ndtvprofit+2
Une fonction de réplication vocale permet de recréer un profil vocal à partir d'un échantillon audio de 30 secondes, à condition que l'utilisateur dispose des droits sur la voix. Google a précisé que le système exige un enregistrement de consentement verbal du propriétaire de la voix, et que tout audio généré porte le filigrane SynthID ainsi que les accréditations C2PA. La réplication vocale via AI Studio n'est pas disponible dans l'Illinois, au Texas, dans l'Espace économique européen, au Royaume-Uni, en Suisse et en Inde.unite+1
Les deux modèles prennent en charge la direction de performance ligne par ligne, la génération longue durée sur plusieurs heures d'audio et la mise en scène native pour deux locuteurs dans les podcasts et la narration dramatique. Des indices non verbaux tels que les rires, les soupirs et les interjections d'écoute active peuvent être intégrés dans les dialogues.blog
Google a rapporté que Gemini 3.8 Flash TTS a pris la première place du Voice Design Benchmark de Hume AI avec un score de 71,4 et a dominé la modélisation des accents avec 60,8. Les deux modèles occupent les première et deuxième places de l'indice de qualité globale de Hume AI. Lors d'évaluations à l'aveugle sur Voice Arena, les modèles se sont classés en tête dans des langues telles que le japonais, le portugais brésilien, le vietnamien et l'hindi.ndtvprofit+1
Les plateformes de développement Agora, LiveKit, Pipecat et Vercel prennent en charge les modèles via l'API Gemini, tandis que des entreprises comme Figma, HeyGen, Linguana, Wondercraft, 99.co et Ollang intègrent ces modèles TTS pour le doublage, la localisation de médias et les applications d'agents vocaux. L'accès entreprise via Gemini Enterprise est annoncé comme prochainement disponible.unite+2