Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blogblog+1Google Alphabet Inc. , Çarşamba günü şimdiye kadarki en etkileyici ses üretim araçları olarak adlandırdığı iki metinden sese dönüştürme modeli olan Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS'i tanıttı. Her iki model de Gemini API ve Google AI Studio'da kullanıma sunuldu.blog
Gemini Ses Ekibi adına Grup Ürün Müdürü Leland Rechis ve Araştırma Bilimi Direktörü Alan Cowen tarafından kaleme alınan duyuru, iki modeli birbirini tamamlayan araçlar olarak konumlandırıyor: Derin yaratıcı yönlendirme için Flash TTS ve yüksek hacimli, maliyet etkin uygulamalar için Flash-Lite TTS.unite+1
Gemini 3.8 Flash TTS, kullanıcıların doğal dil komutları aracılığıyla sıfırdan orijinal sesler oluşturmasına olanak tanıyor; bu sayede 100'den fazla dil ve lehçede rol, aksan ve vokal özellikleri belirlenebiliyor. Bu sürüm, Google'ın ses kütüphanesini 30 orijinal sesten 2.000'den fazla üretime hazır seçeneğe çıkarıyor ve Meksika İspanyolcası, Quebec Fransızcası ve İskoç İngilizcesi gibi bölgesel çeşitlilikleri kapsıyor.ndtvprofit+2
Ses kopyalama özelliği, kullanıcının ses haklarına sahip olması koşuluyla 30 saniyelik bir ses örneğinden vokal profili yeniden oluşturabiliyor. Google, sistemin ses sahibinden sözlü onay kaydı gerektirdiğini ve üretilen tüm seslerin SynthID filigranı ve C2PA kimlik bilgileri taşıdığını belirtti. AI Studio aracılığıyla ses kopyalama özelliği Illinois, Teksas, Avrupa Ekonomik Alanı, Birleşik Krallık, İsviçre ve Hindistan'da kullanılamıyor.unite+1
Her iki model de satır satır performans yönlendirmesini, saatlerce süren uzun metinli ses üretimini ve podcast'ler ile dramatik hikaye anlatımı için yerel iki hoparlörlü sahne kurgusunu destekliyor. Gülme, iç çekme ve aktif dinleme tepkileri gibi sözsüz ipuçları diyaloğa eklenebiliyor.blog
Google, Gemini 3.8 Flash TTS'in Hume AI'nın Ses Tasarımı Kıyaslaması'nda 71.4 puanla birinci sıraya yerleştiğini ve 60.8 puanla aksan modellemede lider olduğunu bildirdi. İki model, Hume AI'nın Genel Kalite Endeksi'nde birinci ve ikinci sırada yer alıyor. Voice Arena'daki kör insan tercihi değerlendirmelerinde modeller; Japonca, Brezilya Portekizcesi, Vietnamca ve Hintçe gibi dillerde en üst sıralarda yer aldı.ndtvprofit+1
Agora, LiveKit, Pipecat ve Vercel geliştirici platformları, Gemini API aracılığıyla modellere destek veriyor; Figma, HeyGen, Linguana, Wondercraft, 99.co ve Ollang gibi şirketler ise TTS modellerini seslendirme, medya yerelleştirme ve sesli asistan uygulamaları için entegre ediyor. Gemini Enterprise aracılığıyla kurumsal erişimin yakında geleceği belirtiliyor.unite+2