Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blog+1blog+1Google Alphabet Inc. släppte på tisdagen Gemini 3.5 Live Translate, en AI-driven ljudmodell som översätter tal i nära realtid på över 70 språk, vilket markerar en av företagets mest ambitiösa utrullningar av översättningsteknik direkt på enheten. Samma dag introducerade Google DeepMind DiffusionGemma, en experimentell öppen modell som genererar text upp till fyra gånger snabbare än standard autoregressiva modeller genom att applicera diffusionstekniker på Gemma 4-arkitekturen.
Gemini 3.5 Live Translate avviker från konventionella översättningssystem som väntar på att talaren ska prata klart innan de producerar utdata. Istället bearbetar och översätter modellen tal kontinuerligt, och ligger bara några sekunder efter talaren samtidigt som den bevarar intonation, tempo och tonhöjd.blog+1
Modellen rullas ut på tre ytor: globalt i Google Översätt-appen för Android och iOS, i offentlig förhandsversion för utvecklare via Gemini Live API och Google AI Studio, samt i privat förhandsversion för utvalda Google Workspace-företagskunder på Google Meet från och med denna månad. Meet-integreringen utökar talöversättning från fem tidigare stödda språk till över 70, vilket möjliggör över 2 000 språkkombinationer i ett enda möte.9to5google+1
Ett nytt "lyssningsläge" på Android tillåter användare att höra översättningar genom telefonens hörsnäcka utan hörlurar – helt enkelt genom att hålla enheten mot örat som vid ett vanligt samtal. Allt genererat ljud är vattenmärkt med SynthID för att hjälpa till att identifiera AI-genererat innehåll.India Today+2
Separat släppte Google DeepMind DiffusionGemma, en "mixture-of-experts"-modell med 26 miljarder parametrar som genererar text på samma sätt som bilddiffusionsmodeller skapar bilder – genom att börja från brus och förfina hela block på upp till 256 tokens parallellt istället för att förutsäga ett ord i taget.blogs.nvidia+1
Byggd på Gemma 4-arkitekturen och med aktivering av endast 3,8 miljarder parametrar under inferens, uppnår DiffusionGemma över 1 000 tokens per sekund på en enskild Nvidia H100 GPU och ungefär 700 tokens per sekund på ett konsument-GeForce RTX 5090. Modellvikterna finns tillgängliga på Hugging Face under Apache 2.0-licensen för öppen källkod.blog+2
Googles VD Sundar Pichai lyfte fram DiffusionGemma på sociala medier och kallade den "en kapplöpningshäst som uppnår upp till 4x snabbare inferens" som för företagets forskning inom textdiffusion till Gemma 4-familjen.x
Google varnade för att DiffusionGemma är experimentell och ligger efter standardmodellen Gemma 4 i prestandamått för utdatakvalitet, och rekommenderar den främst för hastighetskritiska lokala arbetsflöden som inline-redigering, snabb iteration och agentiska loopar snarare än produktionsdistributioner som kräver maximal kvalitet. Nvidia har optimerat modellen över hela sin hårdvarulinje, från konsument-GPU:er till DGX Spark-system, med stöd från första dagen i vLLM, Hugging Face Transformers och Unsloth.thenewstack+2