Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blog+1the-decoderGoogle Alphabet Inc. lanserte tirsdag Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking, to stemmebaserte AI-modeller designet for sanntidssamtaler, visuell forståelse og utførelse av bakgrunnsoppgaver. Selskapet omtaler dem som sine mest avanserte modeller for live-dialog til dags dato.blog+1
Lanseringen posisjonerer Google til å konkurrere direkte med OpenAIs GPT-Live-1 i det fremvoksende markedet for stemmeagenter, til en brøkdel av prisen. Ifølge The Decoder koster Gemini 3.8 Live Extended Thinking omtrent 1,38 dollar per time med stemmesamtale, noe som er rundt 13 ganger billigere enn OpenAIs tilbud. På Artificial Analysis sin Speech to Speech Quality Index oppnådde Extended Thinking en score på 82,6, som sikret førsteplassen, sammenlignet med GPT-Live-1 sin score på 79,4.autointerviewai+1
Gemini 3.8 Live er bygget for skalering og kostnadseffektivitet, behandler visuelle inndata i nær sanntid og bytter automatisk mellom 97 språk midt i en samtale. Den kan utføre verktøykall og API-forespørsler i bakgrunnen mens den fortsetter å snakke, ved å bekrefte brukerens forespørsel verbalt og gjenoppta samtalen når oppgaven er fullført.unite+1
Extended Thinking legger til dypere resonnering på toppen av det samtalemessige laget. Google sier at modellen resonnerer og snakker samtidig, ved å bruke verbale hint som "La meg sjekke det…" for å opprettholde en naturlig flyt mens den løser problemer i flere trinn. Den scoret 68,6 % på τ-Voice agentic task-benchmarken og 97,7 % på Big Bench Audio.blog+1
Demonstrasjonsvideoer viser hvordan modellene veileder ansatte gjennom onboarding med live visuell kontekst, konverterer håndtegnede skisser til funksjonelle React-komponenter via stemmetilbakemelding, og koordinerer restaurantbestillinger i flere trinn gjennom asynkrone funksjonskall.unite
Begge modellene begynte utrullingen på tirsdag. Utviklere kan få tilgang via Gemini API og Google AI Studio. Bedrifter får en privat forhåndsvisning i Gemini Enterprise, med kundestøtte som kommer senere. For forbrukere driver Gemini 3.8 Live Google Search Live, mens Extended Thinking er tilgjengelig i Gemini Live-appen, i Docs for Google AI Pro- og Ultra-abonnenter, samt i Gmail og Keep for alle Google AI-abonnenter.sqmagazine+1
Google nevnte Agora, LiveKit, Pipecat, Vercel og Salesforce blant de tidlige plattform- og bedriftspartnerne som bygger på modellens verktøykall-kapasitet med lav forsinkelse. All lydutgang er vannmerket med Googles SynthID-system for å markere AI-generert tale.blog+1
Utgivelsen skjerper rivaliseringen innen stemme-AI. OpenAIs GPT-Live-1 beholder en arkitektonisk fordel, ekte full-dupleks samtale der den lytter mens den snakker, men Google satser på at overlegne benchmarks og aggressiv prising vil vinne over utviklere som bygger stemmeagenter i stor skala. På ServiceNows EVA-Bench sier Google at modellene deres flytter grensen for nøyaktighet kontra samtalekvalitet for komplekse stemmearbeidsflyter.orcarouter+3