Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog.developers.googleblog.developers.googleblog+1.„Google DeepMind“ antradienį, spalio 6 d., išleido „EmbeddingGemma 2“. Šis atvirojo svorio modelis paverčia tekstą, kodą, vaizdus, vaizdo įrašus ir garsą į bendrą 768 matmenų įterpimo erdvę ir yra pakankamai mažas, kad veiktų telefonuose bei nešiojamuosiuose kompiuteriuose. Modelis turi 740 mln. parametrų, yra sukurtas „Gemma 4“ architektūros pagrindu ir išleistas pagal komerciškai leidžiančią „Apache 2.0“ licenciją.developers.googleblog+1
Šis išleidimas perkelia „Google“ įrenginiuose veikiančių įterpimų darbą už teksto ribų. Įterpimai paverčia turinį skaičiais, kurie fiksuoja prasmę, o tai naudoja paieškos įrankiai ir su paieška susietos generavimo (RAG) sistemos, kad rastų aktualią medžiagą. „Google“ teigė, kad kūrėjai gali naudoti modelį norėdami rasti konkretų vaizdo įrašą iš balso atmintinės arba ieškoti valandų valandas trunkančiuose garso įrašuose pagal teksto užklausą. Pirmasis „EmbeddingGemma“, 308 mln. parametrų tik tekstui skirtas modelis, sukurtas „Gemma 3“ pagrindu, pasirodė 2025 m. rugsėjį. „Google“ teigia, kad jis buvo atsisiųstas daugiau nei 20 mln. kartų.blog+1
Kūrėjams nereikia įkelti viso modelio. Pasak „Google“ kūrėjų vadovo, teksto ir kodo branduolys turi 270 mln. parametrų, vaizdo kodavimo įrenginys prideda 170 mln., o garso kodavimo įrenginys – 300 mln. Kiekvienas derinys sukuria vektorius toje pačioje erdvėje, todėl užklausa, įterpta naudojant tik teksto sąranką, gali būti tiesiogiai lyginama su dokumentais, įterptais naudojant visą modelį. Visos įvestys dalijasi 8 192 žetonų konteksto langu, keturis kartus didesniu nei originalaus modelio. Tai pakanka iki 29 vaizdų, 58 vaizdo kadrų arba 5,5 minutės garso įrašo vienoje įvestyje.unite+2
„Investing.com“ pranešė, kad modelis „Massive Text Embedding Benchmark“ kodo teste surinko 78,68 balo, t. y. 9,92 punkto daugiau nei pirmtakas (68,76). „Matryoshka Representation Learning“ technika leidžia kūrėjams sutrumpinti vektorius iki 128 matmenų, o tai sumažina saugyklos poreikį iki šešių kartų. „Google“ kūrėjų vadove teigiama, kad 256 matmenų vektoriai išlaiko apie 95% visos kokybės vaizdų, vaizdo įrašų ir kalbos paieškoje. Esant 128 matmenims, daugiarūšės paieškos kokybė nukrenta iki maždaug 75%.investing+1
Modelio kortelėje nurodyta, kad „EmbeddingGemma 2“ nebuvo atliktas saugos derinimas po mokymo, praneša „Unite.AI“. Tai palieka taikymo lygio apsaugos priemones kūrėjams.unite
„Google“ teigimu, naudojant kvantavimą „Pixel 11 Pro“, tik tekstui skirti svoriai sunaudoja apie 191 megabaitą aktyviosios atminties, o visas daugiarūšis modelis – apie 567 megabaitus. „Seeking Alpha“ pranešė, kad „Google AI Edge Gallery“ programėlė papildys dviem modelio pagrindu sukurtomis demonstracijomis. „Instant Media Search“ leidžia vartotojams ieškoti vietinių nuotraukų ir vaizdo įrašų pagal aprašymą, o „Video Moments Finder“ gali rasti scenas, pavyzdžiui, „šuo gaudo frisbį“, iš anksto netranskribuojant garso. „Google“ taip pat pristatė „Google AI Edge Foresight“ skirta „Mac“ – eksperimentinę programėlę, kuri ieško susitikimų stenogramose, užrašuose, vaizduose ir kompiuteryje saugomuose dokumentuose.tradingview+1
Svoriniai koeficientai dabar pasiekiami „Hugging Face“ ir „Kaggle“ platformose. „Google“ teigia, kad modelis artimiausiomis savaitėmis pasirodys „ML Kit for Android“, su aparatinės įrangos spartinimo palaikymu įrenginiuose, kurie tai turi. „Google“ teigimu, prieinamumas „Gemini Enterprise Agent Platform Model Garden“ taip pat „netrukus bus pasiekiamas“.investing+1