Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blog+1the-decoderGoogle Alphabet Inc. hat am Dienstag Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking veröffentlicht, ein Paar sprachbasierter KI-Modelle, die für Echtzeit-Konversationen, visuelles Verständnis und die Ausführung von Hintergrundaufgaben entwickelt wurden. Das Unternehmen bezeichnet sie als seine bisher fortschrittlichsten Live-Dialogmodelle.blog+1
Die Einführung positioniert Google so, dass es direkt mit OpenAIs GPT-Live-1 auf dem aufstrebenden Markt für Sprachagenten konkurrieren kann, und das zu einem Bruchteil des Preises. Laut The Decoder kostet Gemini 3.8 Live Extended Thinking etwa 1,38 US-Dollar pro Stunde Sprachkonversation und unterbietet damit das Angebot von OpenAI um etwa das 13-fache. Im Speech to Speech Quality Index von Artificial Analysis erzielte Extended Thinking 82,6 Punkte und sicherte sich damit den ersten Platz, verglichen mit 79,4 Punkten bei GPT-Live-1.autointerviewai+1
Gemini 3.8 Live ist auf Skalierbarkeit und Kosteneffizienz ausgelegt, verarbeitet visuelle Eingaben in nahezu Echtzeit und wechselt mitten im Gespräch automatisch zwischen 97 Sprachen. Es kann Tool-Aufrufe und API-Anfragen im Hintergrund ausführen, während es weiter spricht, indem es die Anfrage eines Benutzers verbal bestätigt und das Gespräch fortsetzt, sobald die Aufgabe abgeschlossen ist.unite+1
Extended Thinking fügt dieser Konversationsebene ein tieferes logisches Denken hinzu. Google gibt an, dass das Modell gleichzeitig denkt und spricht, wobei es verbale Hinweise wie "Lass mich das kurz prüfen…" verwendet, um einen natürlichen Fluss aufrechtzuerhalten, während es mehrstufige Probleme löst. Es erzielte 68,6 % beim τ-Voice Agentic Task Benchmark und 97,7 % bei Big Bench Audio.blog+1
Demonstrationsvideos zeigen, wie die Modelle Mitarbeiter bei der Einarbeitung mit Live-visuellem Kontext unterstützen, handgezeichnete Skizzen per Sprachfeedback in funktionale React-Komponenten umwandeln und mehrstufige Restaurantbuchungen durch asynchrone Funktionsaufrufe koordinieren.unite
Beide Modelle wurden am Dienstag eingeführt. Entwickler können über die Gemini API und Google AI Studio darauf zugreifen. Unternehmen erhalten eine private Vorschau in Gemini Enterprise, wobei Kundensupport zu einem späteren Zeitpunkt folgt. Für Verbraucher treibt Gemini 3.8 Live die Google Search Live an, während Extended Thinking in der Gemini Live-App, in Docs für Google AI Pro- und Ultra-Abonnenten sowie in Gmail und Keep für alle Google AI-Abonnenten verfügbar ist.sqmagazine+1
Google nannte Agora, LiveKit, Pipecat, Vercel und Salesforce als frühe Plattform- und Unternehmenspartner, die auf den Tool-Aufruf-Fähigkeiten der Modelle mit geringer Latenz aufbauen. Alle Audioausgaben sind mit Googles SynthID-System wasserzeichenversehen, um KI-generierte Sprache zu kennzeichnen.blog+1
Die Veröffentlichung verschärft den Wettbewerb bei Sprach-KI. OpenAIs GPT-Live-1 behält einen architektonischen Vorteil – echte Vollduplex-Konversation, bei der das Modell zuhört, während es spricht –, aber Google setzt darauf, dass überlegene Benchmarks und eine aggressive Preisgestaltung Entwickler überzeugen werden, die Sprachagenten in großem Maßstab erstellen. Auf dem EVA-Bench von ServiceNow gibt Google an, dass seine Modelle die Grenze zwischen Genauigkeit und Konversationsqualität für komplexe Sprach-Workflows verschieben.orcarouter+3