Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blogblog+1Google Alphabet Inc. introduserte på onsdag Gemini 3.8 Flash TTS og Gemini 3.8 Flash-Lite TTS, to tekst-til-tale-modeller som selskapet beskriver som sine mest uttrykksfulle lydgenereringsverktøy hittil. Begge modellene ble umiddelbart tilgjengelige i Gemini API og Google AI Studio.blog
Kunngjøringen, skrevet av produktsjef Leland Rechis og forskningsdirektør Alan Cowen på vegne av Gemini Audio Team, posisjonerer de to modellene som komplementære verktøy: Flash TTS for dyp kreativ kontroll og Flash-Lite TTS for kostnadseffektive applikasjoner med høyt volum.unite+1
Gemini 3.8 Flash TTS lar brukere skape originale stemmer fra bunnen av ved hjelp av naturlige språkinstrukser, der man spesifiserer rolle, aksent og vokale egenskaper på over 100 språk og dialekter. Lanseringen utvider Googles stemmebibliotek fra 30 originale stemmer til over 2000 produksjonsklare alternativer, inkludert regionale varianter som meksikansk spansk, quebec-fransk og skotsk engelsk.ndtvprofit+2
En funksjon for stemmereplikasjon kan gjenskape en vokalprofil fra et 30-sekunders lydopptak, forutsatt at brukeren har rettighetene til stemmen. Google opplyser at systemet krever et muntlig samtykkeopptak fra stemmehaveren, og all generert lyd er utstyrt med SynthID-vannmerking og C2PA-sertifisering. Stemmereplikasjon via AI Studio er ikke tilgjengelig i Illinois, Texas, EØS, Storbritannia, Sveits og India.unite+1
Begge modellene støtter linje-for-linje-instruksjoner, generering av lange lydfiler over flere timer, og innebygd støtte for scener med to talere for podcaster og dramatisk historiefortelling. Ikke-verbale signaler som latter, sukk og aktive lytteinnskudd kan skrives inn i dialogen.blog
Google rapporterte at Gemini 3.8 Flash TTS tok førsteplassen på Hume AIs Voice Design Benchmark med en skåre på 71,4 og ledet aksentmodellering med 60,8. De to modellene innehar første- og andreplassen på Hume AIs samlede kvalitetsindeks. I blindtester utført av mennesker på Voice Arena, rangerte modellene øverst på språk som japansk, brasiliansk portugisisk, vietnamesisk og hindi.ndtvprofit+1
Utviklerplattformene Agora, LiveKit, Pipecat og Vercel støtter modellene via Gemini API, mens selskaper som Figma, HeyGen, Linguana, Wondercraft, 99.co og Ollang integrerer TTS-modellene for dubbing, medielokalisering og stemmeagent-applikasjoner. Bedriftstilgang via Gemini Enterprise er oppført som kommende.unite+2