Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blogblog+1Google Alphabet Inc.-ը չորեքշաբթի օրը ներկայացրեց Gemini 3.8 Flash TTS և Gemini 3.8 Flash-Lite TTS մոդելները՝ տեքստից խոսքի վերածման երկու գործիք, որոնք ընկերության ամենաարտահայտիչ աուդիո գեներացման մոդելներն են։ Երկու մոդելներն էլ անմիջապես հասանելի դարձան Gemini API-ում և Google AI Studio-ում:blog
Gemini Audio Team-ի անունից արտադրանքի գծով մենեջեր Լելանդ Ռեչիսի և հետազոտական գիտության տնօրեն Ալան Քոուենի կողմից հրապարակված հայտարարության մեջ այս երկու մոդելները ներկայացվում են որպես լրացուցիչ գործիքներ. Flash TTS-ը՝ խորը ստեղծագործական աշխատանքի համար, իսկ Flash-Lite TTS-ը՝ մեծ ծավալի և ծախսարդյունավետ կիրառությունների համար:unite+1
Gemini 3.8 Flash TTS-ը օգտատերերին հնարավորություն է տալիս ստեղծել օրիգինալ ձայներ զրոյից՝ բնական լեզվի հրահանգների միջոցով՝ նշելով դերը, շեշտադրումը և վոկալ բնութագրերը ավելի քան 100 լեզուներով և բարբառներով։ Այս թողարկումը ընդլայնում է Google-ի ձայնային գրադարանը 30 օրիգինալ ձայնից մինչև 2000-ից ավելի պատրաստի տարբերակներ, ներառյալ տարածաշրջանային բազմազանությունը, ինչպիսիք են մեքսիկական իսպաներենը, քվեբեկյան ֆրանսերենը և շոտլանդական անգլերենը:ndtvprofit+2
Ձայնի կրկնօրինակման գործառույթը կարող է վերականգնել վոկալ պրոֆիլը 30-վայրկյանանոց աուդիո նմուշից, եթե օգտատերը ունի ձայնի իրավունքները։ Google-ը նշել է, որ համակարգը պահանջում է ձայնի սեփականատիրոջ բանավոր համաձայնության ձայնագրությունը, և բոլոր գեներացված աուդիոները պարունակում են SynthID ջրային նշան և C2PA հավաստագրեր։ AI Studio-ի միջոցով ձայնի կրկնօրինակումը հասանելի չէ Իլինոյսում, Տեխասում, Եվրոպական տնտեսական տարածքում, Մեծ Բրիտանիայում, Շվեյցարիայում և Հնդկաստանում:unite+1
Երկու մոդելներն էլ աջակցում են տող առ տող կատարողական ուղղորդմանը, երկարատև աուդիոյի գեներացմանը և երկու խոսնակով տեսարանների բեմադրմանը պոդկաստների և դրամատիկ պատմվածքների համար։ Ոչ վերբալ ազդանշանները, ինչպիսիք են ծիծաղը, հառաչանքը և ակտիվ լսելու արձագանքները, կարող են ներառվել երկխոսության մեջ:blog
Google-ը հայտնել է, որ Gemini 3.8 Flash TTS-ը զբաղեցրել է առաջին տեղը Hume AI-ի Voice Design Benchmark-ում՝ 71.4 միավորով, և առաջատար է շեշտադրման մոդելավորման մեջ՝ 60.8 միավորով։ Երկու մոդելները զբաղեցնում են առաջին և երկրորդ տեղերը Hume AI-ի ընդհանուր որակի ինդեքսում։ Voice Arena-ում կույր փորձարկումների ժամանակ մոդելները լավագույնն են ճանաչվել ճապոներեն, բրազիլական պորտուգալերեն, վիետնամերեն և հինդի լեզուներով:ndtvprofit+1
Agora, LiveKit, Pipecat և Vercel մշակողների հարթակները աջակցում են մոդելներին Gemini API-ի միջոցով, մինչդեռ Figma, HeyGen, Linguana, Wondercraft, 99.co և Ollang ընկերությունները ինտեգրում են TTS մոդելները կրկնօրինակման, մեդիա տեղայնացման և ձայնային գործակալների հավելվածների համար։ Gemini Enterprise-ի միջոցով կորպորատիվ հասանելիությունը շուտով կլինի:unite+2