Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog.developers.googleblog.developers.googleblog+1.Google DeepMind släppte EmbeddingGemma 2 tisdagen den 6 oktober. Modellen med öppna vikter omvandlar text, kod, bilder, video och ljud till ett delat 768-dimensionellt inbäddningsutrymme, och den är tillräckligt liten för att köras på telefoner och bärbara datorer. Modellen har 740 miljoner parametrar, är byggd på Gemma 4-arkitekturen och släpps under den kommersiellt tillåtande Apache 2.0-licensendevelopers.googleblog+1.
Lanseringen tar Googles arbete med inbäddade modeller på enheten bortom enbart text. Inbäddningar gör om innehåll till siffror som fångar betydelse, vilket är vad sökverktyg och RAG-system (retrieval-augmented generation) använder för att hitta relevant material. Google uppger att utvecklare kan använda modellen för att hitta ett specifikt videoklipp från ett röstmemo, eller för att söka igenom timmar av ljudinspelningar med en textfråga. Den första EmbeddingGemma, en textmodell med 308 miljoner parametrar baserad på Gemma 3, kom i september 2025. Google meddelar att den har laddats ner över 20 miljoner gångerblog+1.
Utvecklare behöver inte ladda hela modellen. Enligt Googles utvecklarguide har text- och kodkärnan 270 miljoner parametrar, en bildkodare lägger till 170 miljoner och en ljudkodare lägger till 300 miljoner. Alla kombinationer producerar vektorer i samma utrymme, så en sökning gjord med textuppsättningen kan matchas direkt mot dokument som bäddats in med den fullständiga modellen. Alla indata delar ett kontextfönster på 8 192 tokens, fyra gånger större än den ursprungliga modellens. Det räcker för upp till 29 bilder, 58 videorutor eller 5,5 minuter ljud i en enda indataunite+2.
Investing.com rapporterade att modellen fick 78,68 poäng på Massive Text Embedding Benchmarks kodtest, en ökning med 9,92 poäng från föregångarens 68,76. En teknik som kallas Matryoshka Representation Learning låter utvecklare korta ner vektorer till så få som 128 dimensioner, vilket minskar lagringsbehovet med upp till sex gånger. Googles utvecklarguide anger att 256-dimensionella vektorer behåller cirka 95 % av full kvalitet vid bild-, video- och talsökning. Vid 128 dimensioner sjunker den multimodala sökkvaliteten till omkring 75 %investing+1.
Modellkortet anger att EmbeddingGemma 2 inte har genomgått säkerhetsträning efter den initiala träningen, enligt Unite.AI. Det lämnar säkerhetsåtgärder på applikationsnivå till utvecklarnaunite.
Med kvantisering på en Pixel 11 Pro använder textvikterna cirka 191 megabyte aktivt minne och den fullständiga multimodala modellen använder cirka 567 megabyte, uppger Google. Seeking Alpha rapporterade att appen Google AI Edge Gallery kommer att lägga till två demon byggda på modellen. Instant Media Search låter användare söka i lokala foton och videor via beskrivning, och Video Moments Finder kan hitta scener som "hund som fångar en frisbee" utan att först transkribera ljudet. Google introducerade även Google AI Edge Foresight för Mac, en experimentell app som söker i mötesanteckningar, anteckningar, bilder och dokument lagrade på en datortradingview+1.
Vikterna finns tillgängliga nu på Hugging Face och Kaggle. Google uppger att modellen kommer till ML Kit för Android under de kommande veckorna, med stöd för hårdvaruacceleration på enheter som har det. Tillgänglighet i Gemini Enterprise Agent Platform Model Garden är också "snart tillgänglig", enligt Googleinvesting+1.