Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blog+1blog+1„Google Alphabet Inc.“ antradienį išleido „Gemini 3.5 Live Translate“ – dirbtinio intelekto pagrindu veikiantį garso modelį, kuris verčia kalbą beveik realiuoju laiku daugiau nei 70 kalbų, o tai yra vienas ambicingiausių bendrovės vertimo technologijų diegimų įrenginiuose. Tą pačią dieną „Google DeepMind“ pristatė „DiffusionGemma“ – eksperimentinį atvirą modelį, kuris generuoja tekstą iki keturių kartų greičiau nei standartiniai autoregresiniai modeliai, taikydamas difuzijos metodus „Gemma 4“ architektūrai.
„Gemini 3.5 Live Translate“ skiriasi nuo įprastų nuoseklių vertimo sistemų, kurios laukia, kol kalbėtojas baigs, prieš pateikdamos rezultatą. Vietoj to modelis apdoroja ir verčia kalbą nepertraukiamai, atsilikdamas nuo kalbėtojo vos kelias sekundes, tačiau išsaugodamas intonaciją, tempą ir aukštį.blog+1
Modelis diegiamas trijose platformose: visame pasaulyje „Google Translate“ programėlėje, skirtoje „Android“ ir „iOS“, viešoje peržiūroje kūrėjams per „Gemini Live API“ ir „Google AI Studio“, bei privačioje peržiūroje pasirinktiems „Google Workspace“ verslo klientams „Google Meet“ nuo šio mėnesio. „Meet“ integracija išplečia kalbos vertimą iš penkių anksčiau palaikytų kalbų į daugiau nei 70, įgalindama daugiau nei 2000 kalbų derinių viename susitikime.9to5google+1
Naujas „klausymosi režimas“ „Android“ įrenginiuose leidžia vartotojams girdėti vertimus per telefono ausinę be ausinių – tiesiog priglaudus įrenginį prie ausies kaip per įprastą skambutį. Visas sugeneruotas garsas yra pažymėtas „SynthID“ vandens ženklu, kad būtų galima atpažinti dirbtinio intelekto sukurtą turinį.India Today+2
Atskirai „Google DeepMind“ išleido „DiffusionGemma“ – 26 milijardų parametrų ekspertų mišinio modelį, kuris generuoja tekstą taip, kaip vaizdų difuzijos modeliai kuria paveikslėlius – pradedant nuo triukšmo ir lygiagrečiai tobulinant ištisus iki 256 žetonų blokus, o ne spėjant po vieną žodį.blogs.nvidia+1
Sukurtas „Gemma 4“ architektūros pagrindu ir išvados metu aktyvuojantis tik 3,8 milijardo parametrų, „DiffusionGemma“ pasiekia daugiau nei 1000 žetonų per sekundę viename „Nvidia“ H100 GPU ir maždaug 700 žetonų per sekundę „GeForce RTX 5090“ vartotojų įrenginyje. Modelio svoriai prieinami „Hugging Face“ platformoje pagal „Apache 2.0“ atvirojo kodo licenciją.blog+2
„Google“ generalinis direktorius Sundaras Pichai socialiniuose tinkluose pabrėžė „DiffusionGemma“, pavadindamas jį „lenktyniniu žirgu, pasiekiančiu iki 4 kartų greitesnę išvadą“, kuris į „Gemma 4“ šeimą atneša bendrovės teksto difuzijos tyrimus.x
„Google“ įspėjo, kad „DiffusionGemma“ yra eksperimentinis ir atsilieka nuo standartinio „Gemma 4“ pagal išvesties kokybės rodiklius, todėl rekomenduoja jį pirmiausia naudoti greičio reikalaujančioms vietinėms darbo eigoms, tokioms kaip tiesioginis redagavimas, greitas iteravimas ir agentinės kilpos, o ne gamybiniam diegimui, kuriam reikalinga maksimali kokybė. „Nvidia“ optimizavo modelį visoje savo aparatinės įrangos linijoje – nuo vartotojų GPU iki „DGX Spark“ sistemų, su pirminiu palaikymu „vLLM“, „Hugging Face Transformers“ ir „Unsloth“.thenewstack+2