Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blogblog+1Společnost Google Alphabet Inc. ve středu představila Gemini 3.8 Flash TTS a Gemini 3.8 Flash-Lite TTS, dva modely pro převod textu na řeč, které označila za své dosud nejexpresivnější nástroje pro generování zvuku. Oba modely se začaly okamžitě zavádět do rozhraní Gemini API a Google AI Studio.blog
Oznámení, které jménem týmu Gemini Audio sepsali produktový manažer Leland Rechis a ředitel výzkumu Alan Cowen, prezentuje oba modely jako doplňkové nástroje: Flash TTS pro hlubokou kreativní práci a Flash-Lite TTS pro velkoobjemové a nákladově efektivní aplikace.unite+1
Gemini 3.8 Flash TTS umožňuje uživatelům vytvářet originální hlasy od základu pomocí přirozených jazykových pokynů, přičemž lze specifikovat roli, přízvuk a vokální charakteristiky ve více než 100 jazycích a dialektech. Tato verze rozšiřuje knihovnu hlasů Google z 30 původních hlasů na více než 2 000 variant připravených k produkci, včetně regionálních variací, jako je mexická španělština, quebecká francouzština nebo skotská angličtina.ndtvprofit+2
Funkce replikace hlasu dokáže vytvořit vokální profil z 30sekundové zvukové ukázky, pokud má uživatel k danému hlasu práva. Google uvedl, že systém vyžaduje záznam ústního souhlasu majitele hlasu a veškerý vygenerovaný zvuk nese vodoznak SynthID a certifikaci C2PA. Replikace hlasu prostřednictvím AI Studio není dostupná v Illinois, Texasu, Evropském hospodářském prostoru, Spojeném království, Švýcarsku a Indii.unite+1
Oba modely podporují režii výkonu po jednotlivých řádcích, generování dlouhých zvukových stop a nativní inscenaci scény pro dva mluvčí v podcastech a dramatickém vyprávění. Do dialogů lze skriptovat neverbální projevy, jako je smích, povzdechy a interjekce aktivního naslouchání.blog
Google uvedl, že Gemini 3.8 Flash TTS obsadil první místo v benchmarku Voice Design Benchmark společnosti Hume AI se skóre 71,4 a vedl v modelování přízvuku s 60,8 body. Oba modely drží první a druhé místo v indexu celkové kvality Hume AI. V rámci slepých testů preferencí uživatelů v Voice Arena se modely umístily na vrcholu v jazycích, jako je japonština, brazilská portugalština, vietnamština a hindština.ndtvprofit+1
Vývojářské platformy Agora, LiveKit, Pipecat a Vercel modely podporují prostřednictvím Gemini API, zatímco společnosti jako Figma, HeyGen, Linguana, Wondercraft, 99.co a Ollang integrují tyto TTS modely pro dabing, lokalizaci médií a aplikace hlasových agentů. Podnikový přístup prostřednictvím Gemini Enterprise bude k dispozici brzy.unite+2