Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blog+1the-decoderGoogle Alphabet Inc. lanzó el martes Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, un par de modelos de IA centrados en la voz diseñados para conversaciones en tiempo real, comprensión visual y ejecución de tareas en segundo plano. La compañía los califica como sus modelos de diálogo en vivo más avanzados hasta la fecha.blog+1
Este lanzamiento posiciona a Google para competir directamente con GPT-Live-1 de OpenAI en el emergente mercado de agentes de voz, a una fracción del precio. Según The Decoder, Gemini 3.8 Live Extended Thinking cuesta aproximadamente 1.38 dólares por hora de conversación de voz, superando la oferta de OpenAI por aproximadamente 13 veces. En el Índice de Calidad de Voz a Voz de Artificial Analysis, Extended Thinking obtuvo una puntuación de 82.6, alcanzando el primer puesto frente al 79.4 de GPT-Live-1.autointerviewai+1
Gemini 3.8 Live está diseñado para la escala y la eficiencia de costos, procesando entradas visuales casi en tiempo real y cambiando automáticamente entre 97 idiomas durante la conversación. Puede ejecutar llamadas a herramientas y solicitudes de API en segundo plano mientras continúa hablando, reconociendo verbalmente la solicitud del usuario y retomando la conversación una vez que se completa la tarea.unite+1
Extended Thinking añade un razonamiento más profundo sobre esa capa conversacional. Google afirma que el modelo razona y habla simultáneamente, utilizando señales verbales como "Déjame comprobar eso…" para mantener un flujo natural mientras resuelve problemas de varios pasos. Obtuvo un 68.6% en el punto de referencia de tareas agénticas τ-Voice y un 97.7% en Big Bench Audio.blog+1
Los videos de demostración muestran a los modelos guiando la incorporación de empleados con contexto visual en vivo, convirtiendo bocetos dibujados a mano en componentes React funcionales mediante retroalimentación de voz y coordinando reservas de restaurantes de varios pasos mediante llamadas a funciones asíncronas.unite
Ambos modelos comenzaron a implementarse el martes. Los desarrolladores pueden acceder a ellos a través de la API de Gemini y Google AI Studio. Las empresas obtienen una vista previa privada en Gemini Enterprise, y el soporte de experiencia del cliente llegará más adelante. Para los consumidores, Gemini 3.8 Live impulsa Google Search Live, mientras que Extended Thinking está disponible en la aplicación Gemini Live, en Docs para suscriptores de Google AI Pro y Ultra, y en Gmail y Keep para todos los suscriptores de Google AI.sqmagazine+1
Google nombró a Agora, LiveKit, Pipecat, Vercel y Salesforce entre los primeros socios de plataforma y empresariales que aprovechan las capacidades de llamada a herramientas de baja latencia de los modelos. Toda la salida de audio está marcada con el sistema SynthID de Google para identificar el habla generada por IA.blog+1
El lanzamiento intensifica la rivalidad en la IA de voz. GPT-Live-1 de OpenAI conserva una ventaja arquitectónica, una verdadera conversación full-duplex que escucha mientras habla, pero Google apuesta a que los puntos de referencia superiores y los precios agresivos atraerán a los desarrolladores que crean agentes de voz de producción a gran escala. En el EVA-Bench de ServiceNow , Google afirma que sus modelos amplían la frontera de precisión frente a calidad conversacional para flujos de trabajo de voz complejos.orcarouter+3