Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blog+1blog+1Google Alphabet Inc. lanserte tirsdag Gemini 3.5 Live Translate, en AI-drevet lydmodell som oversetter tale i nær sanntid på over 70 språk, noe som markerer en av selskapets mest ambisiøse utrullinger av oversettelsesteknologi direkte på enheten. Samme dag introduserte Google DeepMind DiffusionGemma, en eksperimentell åpen modell som genererer tekst opptil fire ganger raskere enn standard autoregressive modeller ved å bruke diffusjonsteknikker på Gemma 4-arkitekturen.
Gemini 3.5 Live Translate skiller seg fra konvensjonelle oversettelsessystemer som venter til en taler er ferdig før de produserer utdata. I stedet behandler og oversetter modellen tale kontinuerlig, og ligger bare noen få sekunder bak taleren samtidig som den bevarer intonasjon, tempo og tonehøyde.blog+1
Modellen rulles ut på tre flater: globalt i Google Oversetter-appen for Android og iOS, i offentlig forhåndsvisning for utviklere via Gemini Live API og Google AI Studio, og i privat forhåndsvisning for utvalgte Google Workspace-bedriftskunder på Google Meet fra og med denne måneden. Meet-integrasjonen utvider taletranslasjon fra fem tidligere støttede språk til over 70, noe som muliggjør over 2000 språkkombinasjoner i ett enkelt møte.9to5google+1
En ny «lyttemodus» på Android lar brukere høre oversettelser gjennom telefonens ørehøyttaler uten hodetelefoner – bare ved å holde enheten til øret som en vanlig samtale. All generert lyd er vannmerket med SynthID for å hjelpe til med å identifisere AI-generert innhold.India Today+2
Separat lanserte Google DeepMind DiffusionGemma, en «mixture-of-experts»-modell med 26 milliarder parametere som genererer tekst på samme måte som bildediffusjonsmodeller skaper bilder – ved å starte fra støy og forfine hele blokker på opptil 256 tokens parallelt i stedet for å forutsi ett ord av gangen.blogs.nvidia+1
Bygget på Gemma 4-arkitekturen og med aktivering av bare 3,8 milliarder parametere under inferens, oppnår DiffusionGemma over 1000 tokens per sekund på en enkelt Nvidia H100 GPU og omtrent 700 tokens per sekund på en forbruker-GeForce RTX 5090. Modellvektene er tilgjengelige på Hugging Face under Apache 2.0 åpen kildekode-lisens.blog+2
Googles administrerende direktør Sundar Pichai fremhevet DiffusionGemma på sosiale medier, og kalte den «en veddeløpshest som oppnår opptil 4x raskere inferens» som bringer selskapets tekst-diffusjonsforskning til Gemma 4-familien.x
Google advarte om at DiffusionGemma er eksperimentell og ligger bak standard Gemma 4 på ytelseskvalitetsmålinger, og anbefaler den primært for hastighetskritiske lokale arbeidsflyter som innebygd redigering, rask iterasjon og agentiske løkker fremfor produksjonsdistribusjoner som krever maksimal kvalitet. Nvidia har optimalisert modellen på tvers av sin maskinvarelinje, fra forbruker-GPUer til DGX Spark-systemer, med støtte fra første dag i vLLM, Hugging Face Transformers og Unsloth.thenewstack+2