Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blogblog+1Google Alphabet Inc. introducerade på onsdagen Gemini 3.8 Flash TTS och Gemini 3.8 Flash-Lite TTS, två text-till-tal-modeller som företaget beskriver som sina mest uttrycksfulla ljudgenereringsverktyg hittills. Båda modellerna började rullas ut omedelbart i Gemini API och Google AI Studio.blog
Tillkännagivandet, skrivet av produktchefen Leland Rechis och forskningschefen Alan Cowen på uppdrag av Gemini Audio Team, positionerar de två modellerna som komplementära verktyg: Flash TTS för djup kreativ kontroll och Flash-Lite TTS för kostnadseffektiva applikationer med hög volym.unite+1
Gemini 3.8 Flash TTS låter användare skapa originella röster från grunden genom naturliga språkinstruktioner, där man specificerar roll, accent och vokala egenskaper på över 100 språk och dialekter. Lanseringen utökar Googles röstbibliotek från 30 ursprungliga röster till över 2 000 produktionsklara alternativ, inklusive regionala varianter som mexikansk spanska, quebec-franska och skotsk engelska.ndtvprofit+2
En funktion för röstreplikering kan återskapa en vokalprofil från ett 30-sekunders ljudklipp, förutsatt att användaren har rättigheterna till rösten. Google uppger att systemet kräver en inspelning av muntligt samtycke från röstägaren, och allt genererat ljud är försett med SynthID-vattenmärkning och C2PA-certifiering. Röstreplikering via AI Studio är inte tillgänglig i Illinois, Texas, EES, Storbritannien, Schweiz och Indien.unite+1
Båda modellerna stöder instruktioner rad för rad, generering av långa ljudfiler på flera timmar och inbyggt stöd för scener med två talare för podcaster och dramatisk berättarkonst. Icke-verbala signaler som skratt, suckar och aktiva lyssningsinlägg kan skrivas in i dialogen.blog
Google rapporterade att Gemini 3.8 Flash TTS tog förstaplatsen på Hume AI:s Voice Design Benchmark med 71,4 poäng och ledde accentmodellering med 60,8. De två modellerna innehar första- och andraplatsen på Hume AI:s samlade kvalitetsindex. I blindtester utförda av människor på Voice Arena rankades modellerna högst på språk som japanska, brasiliansk portugisiska, vietnamesiska och hindi.ndtvprofit+1
Utvecklarplattformarna Agora, LiveKit, Pipecat och Vercel stöder modellerna via Gemini API, medan företag som Figma, HeyGen, Linguana, Wondercraft, 99.co och Ollang integrerar TTS-modellerna för dubbning, medielokalisering och röstagentapplikationer. Företagsåtkomst via Gemini Enterprise anges som kommande.unite+2