Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog.developers.googleblog.developers.googleblog+1.Google DeepMind lanserte EmbeddingGemma 2 tirsdag 6. oktober. Modellen med åpne vekter konverterer tekst, kode, bilder, video og lyd til et delt 768-dimensjonalt innebyggingsrom, og den er kompakt nok til å kjøre på telefoner og bærbare datamaskiner. Modellen har 740 millioner parametere, er bygget på Gemma 4-arkitekturen og er utgitt under den kommersielt tillatende Apache 2.0-lisensendevelopers.googleblog+1.
Lanseringen tar Googles arbeid med innebygde modeller på enheten utover ren tekst. Innebygginger gjør innhold om til tall som fanger opp mening, noe som brukes av søkeverktøy og RAG-systemer (retrieval-augmented generation) for å finne relevant materiale. Google opplyser at utviklere kan bruke modellen til å finne et spesifikt videoklipp fra et taleopptak, eller søke gjennom timer med lydopptak ved hjelp av et tekstsøk. Den første EmbeddingGemma, en tekstmodell med 308 millioner parametere basert på Gemma 3, kom i september 2025. Google melder at den har blitt lastet ned over 20 millioner gangerblog+1.
Utviklere trenger ikke å laste inn hele modellen. Ifølge Googles utviklerguide har tekst- og kodekjernen 270 millioner parametere, en bildeenkoder legger til 170 millioner, og en lydenkoder legger til 300 millioner. Alle kombinasjoner produserer vektorer i samme rom, slik at et søk utført med tekstoppsettet kan matches direkte mot dokumenter som er innebygd med full modell. Alle inndata deler et kontekstvindu på 8 192 tokens, fire ganger større enn den opprinnelige modellen. Dette er nok til opptil 29 bilder, 58 videobilder eller 5,5 minutter med lyd i én enkelt inndataunite+2.
Investing.com rapporterte at modellen skåret 78,68 på Massive Text Embedding Benchmarks kodetest, en økning på 9,92 poeng fra forgjengerens 68,76. En teknikk kalt Matryoshka Representation Learning lar utviklere forkorte vektorer til så få som 128 dimensjoner, noe som reduserer lagringsplassen med opptil seks ganger. Googles utviklerguide sier at 256-dimensjonale vektorer beholder omtrent 95 % av full kvalitet ved bilde-, video- og talesøk. Ved 128 dimensjoner faller den multimodale søkekvaliteten til rundt 75 %investing+1.
Modellkortet sier at EmbeddingGemma 2 ikke har gjennomgått sikkerhetstilpasning etter trening, ifølge Unite.AI. Det overlater sikkerhetstiltak på applikasjonsnivå til utviklerneunite.
Med kvantisering på en Pixel 11 Pro bruker tekstvektene omtrent 191 megabyte aktivt minne, mens den fulle multimodale modellen bruker omtrent 567 megabyte, ifølge Google. Seeking Alpha rapporterte at appen Google AI Edge Gallery vil legge til to demoer bygget på modellen. Instant Media Search lar brukere søke i lokale bilder og videoer etter beskrivelse, og Video Moments Finder kan finne scener som "hund som fanger en frisbee" uten å transkribere lyden først. Google introduserte også Google AI Edge Foresight for Mac, en eksperimentell app som søker i møtereferater, notater, bilder og dokumenter lagret på en datamaskintradingview+1.
Vektene er tilgjengelige nå på Hugging Face og Kaggle. Google sier at modellen kommer til ML Kit for Android i løpet av de kommende ukene, med støtte for maskinvareakselerasjon på enheter som har dette. Tilgjengelighet i Gemini Enterprise Agent Platform Model Garden er også "snart tilgjengelig", ifølge Googleinvesting+1.