Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blogblog+1Trečiadienį „Google Alphabet Inc.“ pristatė „Gemini 3.8 Flash TTS“ ir „Gemini 3.8 Flash-Lite TTS“ – du teksto į kalbą modelius, kuriuos įmonė įvardijo kaip savo iki šiol raiškiausius garso generavimo įrankius. Abu modeliai pradėti diegti „Gemini API“ ir „Google AI Studio“ platformose.blog
Pranešime, kurį „Gemini Audio“ komandos vardu parengė produktų grupės vadovas Lelandas Rechis ir tyrimų direktorius Alanas Cowenas, šie du modeliai pristatomi kaip papildantys vienas kitą: „Flash TTS“ skirtas kūrybiniams tikslams, o „Flash-Lite TTS“ – didelės apimties ir ekonomiškai efektyvioms užduotims.unite+1
„Gemini 3.8 Flash TTS“ leidžia vartotojams kurti originalius balsus nuo nulio naudojant natūralios kalbos užklausas, nurodant vaidmenį, akcentą ir balso charakteristikas daugiau nei 100 kalbų bei tarmių. Šis leidimas išplečia „Google“ balso biblioteką nuo 30 originalių balsų iki daugiau nei 2 000 paruoštų naudoti variantų, įskaitant regioninius akcentus, tokius kaip Meksikos ispanų, Kvebeko prancūzų ar Škotijos anglų kalbos.ndtvprofit+2
Balso kopijavimo funkcija gali atkurti vokalinį profilį iš 30 sekundžių garso įrašo, jei vartotojas turi teises į tą balsą. „Google“ teigimu, sistemai reikalingas žodinis balso savininko sutikimas, o visas sugeneruotas garsas žymimas „SynthID“ vandens ženklu ir C2PA sertifikatais. Balso kopijavimas per „AI Studio“ nėra prieinamas Ilinojaus ir Teksaso valstijose, Europos ekonominėje erdvėje, Jungtinėje Karalystėje, Šveicarijoje bei Indijoje.unite+1
Abu modeliai palaiko scenarijų valdymą eilutė po eilutės, ilgų garso įrašų generavimą ir dviejų kalbėtojų scenų kūrimą tinklalaidėms bei draminiams pasakojimams. Nežodiniai garsai, tokie kaip juokas, atodūsiai ar įsiterpimai, gali būti įtraukti į dialogus.blog
„Google“ pranešė, kad „Gemini 3.8 Flash TTS“ užėmė pirmąją vietą „Hume AI“ balso dizaino vertinimo sistemoje (Voice Design Benchmark) su 71,4 balo įvertinimu ir pirmavo akcentų modeliavimo kategorijoje su 60,8 balo. Abu modeliai užima pirmąją ir antrąją vietas „Hume AI“ bendros kokybės indekse. Aklųjų vertinimų metu „Voice Arena“ platformoje šie modeliai užėmė aukščiausias pozicijas japonų, brazilų portugalų, vietnamiečių ir hindi kalbomis.ndtvprofit+1
Kūrėjų platformos „Agora“, „LiveKit“, „Pipecat“ ir „Vercel“ palaiko šiuos modelius per „Gemini API“, o tokios įmonės kaip „Figma“, „HeyGen“, „Linguana“, „Wondercraft“, „99.co“ ir „Ollang“ integruoja šiuos TTS modelius dubliavimui, medijos lokalizavimui ir balso agentų programoms. Prieiga verslo klientams per „Gemini Enterprise“ bus prieinama netrukus.unite+2