Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blogblog+1Google Alphabet Inc. stellte am Mittwoch Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS vor, zwei Text-zu-Sprache-Modelle, die das Unternehmen als seine bisher ausdrucksstärksten Audiogenerierungswerkzeuge bezeichnet. Beide Modelle wurden umgehend in der Gemini API und in Google AI Studio bereitgestellt.blog
Die Ankündigung, verfasst von Group Product Manager Leland Rechis und Director of Research Science Alan Cowen im Namen des Gemini Audio Teams, positioniert die beiden Modelle als komplementäre Werkzeuge: Flash TTS für tiefgreifende kreative Gestaltung und Flash-Lite TTS für kosteneffiziente Anwendungen mit hohem Volumen.unite+1
Gemini 3.8 Flash TTS ermöglicht es Nutzern, durch natürliche Sprachbefehle originelle Stimmen von Grund auf zu erstellen, wobei Rolle, Akzent und stimmliche Merkmale in über 100 Sprachen und Dialekten festgelegt werden können. Die Veröffentlichung erweitert Googles Stimmbibliothek von 30 ursprünglichen Stimmen auf über 2.000 produktionsreife Optionen, einschließlich regionaler Varianten wie mexikanischem Spanisch, Quebec-Französisch und schottischem Englisch.ndtvprofit+2
Eine Funktion zur Stimmenreplikation kann ein Stimmprofil aus einer 30-sekündigen Audioaufnahme nachbilden, sofern der Nutzer die Rechte an der Stimme besitzt. Google erklärte, dass das System eine Aufnahme der mündlichen Zustimmung des Stimminhabers erfordert und alle generierten Audiodaten mit SynthID-Wasserzeichen und C2PA-Zertifikaten versehen sind. Die Stimmenreplikation über AI Studio ist in Illinois, Texas, dem Europäischen Wirtschaftsraum, dem Vereinigten Königreich, der Schweiz und Indien nicht verfügbar.unite+1
Beide Modelle unterstützen zeilenweise Regieanweisungen, die Generierung von stundenlangen Audioinhalten sowie die native Szenengestaltung für zwei Sprecher bei Podcasts und dramatischem Storytelling. Nicht-verbale Signale wie Lachen, Seufzen und aktive Zuhör-Einwürfe können in den Dialog eingebaut werden.blog
Google berichtete, dass Gemini 3.8 Flash TTS mit einer Punktzahl von 71,4 den ersten Platz im Voice Design Benchmark von Hume AI belegte und bei der Akzentmodellierung mit 60,8 führte. Die beiden Modelle belegen die ersten beiden Plätze im Overall Quality Index von Hume AI. In blinden menschlichen Präferenzbewertungen auf Voice Arena rangierten die Modelle in Sprachen wie Japanisch, brasilianischem Portugiesisch, Vietnamesisch und Hindi an der Spitze.ndtvprofit+1
Die Entwicklerplattformen Agora, LiveKit, Pipecat und Vercel unterstützen die Modelle über die Gemini API, während Unternehmen wie Figma, HeyGen, Linguana, Wondercraft, 99.co und Ollang die TTS-Modelle für Synchronisation, Medienlokalisierung und Sprachagent-Anwendungen integrieren. Der Unternehmenszugang über Gemini Enterprise ist als bald verfügbar gelistet.unite+2