Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blogblog+1Google Alphabet Inc. esitteli keskiviikkona Gemini 3.8 Flash TTS- ja Gemini 3.8 Flash-Lite TTS -mallit, jotka ovat yhtiön mukaan sen tähän asti ilmaisukykyisimmät puhesynteesityökalut. Molemmat mallit tulivat välittömästi saataville Gemini API:n ja Google AI Studion kautta.blog
Gemini Audio -tiimin puolesta kirjoitetussa tiedotteessa tuotepäällikkö Leland Rechis ja tutkimusjohtaja Alan Cowen kuvailevat malleja toisiaan täydentäviksi työkaluiksi: Flash TTS on tarkoitettu syvälliseen luovaan ohjaukseen ja Flash-Lite TTS suuren volyymin ja kustannustehokkaisiin sovelluksiin.unite+1
Gemini 3.8 Flash TTS mahdollistaa alkuperäisten äänten luomisen tyhjästä luonnollisen kielen kehotteilla, joilla määritellään rooli, korostus ja ääniominaisuudet yli 100 kielellä ja murteella. Julkaisu laajentaa Googlen äänikirjastoa 30 alkuperäisestä äänestä yli 2 000 tuotantovalmiiseen vaihtoehtoon, kattaen alueellisia muunnelmia kuten meksikolaisen espanjan, quebeciläisen ranskan ja skotlantilaisen englannin.ndtvprofit+2
Äänen kopiointiominaisuus voi luoda ääniprofiilin 30 sekunnin ääninäytteestä, mikäli käyttäjällä on oikeudet ääneen. Google kertoi, että järjestelmä vaatii äänen omistajan suullisen suostumuksen, ja kaikessa generoidussa äänessä on SynthID-vesileima sekä C2PA-tunnisteet. Äänen kopiointi AI Studion kautta ei ole saatavilla Illinoisissa, Texasissa, Euroopan talousalueella, Isossa-Britanniassa, Sveitsissä eikä Intiassa.unite+1
Molemmat mallit tukevat rivikohtaista suoritusohjausta, pitkäkestoista generointia tuntien ajaksi sekä natiivia kahden puhujan lavastusta podcasteja ja dramaattista kerrontaa varten. Dialogiin voidaan käsikirjoittaa ei-kielellisiä vihjeitä, kuten naurua, huokauksia ja aktiivisen kuuntelun välihuomautuksia.blog
Google raportoi, että Gemini 3.8 Flash TTS saavutti kärkisijan Hume AI:n Voice Design Benchmark -vertailussa 71,4 pisteellä ja johti korostusmallinnusta 60,8 pisteellä. Molemmat mallit pitävät hallussaan ensimmäistä ja toista sijaa Hume AI:n Overall Quality Index -indeksissä. Voice Arenan sokkoutetuissa ihmisarvioinneissa mallit sijoittuivat kärkeen muun muassa japanin, brasilianportugalin, vietnamin ja hindin kielissä.ndtvprofit+1
Kehittäjäalustat Agora, LiveKit, Pipecat ja Vercel tukevat malleja Gemini API:n kautta, ja yritykset kuten Figma, HeyGen, Linguana, Wondercraft, 99.co ja Ollang integroivat TTS-malleja dubbaukseen, median lokalisointiin ja puheagenttisovelluksiin. Yrityskäyttöoikeuden Gemini Enterprisen kautta kerrotaan tulevan saataville pian.unite+2