Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog:developers.googleblog:developers.googleblog+1:Google DeepMind-ը հոկտեմբերի 6-ին՝ երեքշաբթի օրը, թողարկեց EmbeddingGemma 2-ը: Այս բաց կոդով մոդելը տեքստը, կոդը, պատկերները, տեսանյութերը և աուդիոն վերածում է ընդհանուր 768-չափանի ներդրված տարածության և այնքան փոքր է, որ կարող է աշխատել հեռախոսների և նոութբուքերի վրա: Մոդելն ունի 740 միլիոն պարամետր, կառուցված է Gemma 4 ճարտարապետության հիման վրա և թողարկվել է առևտրային առումով թույլատրելի Apache 2.0 լիցենզիայով:developers.googleblog+1
Այս թողարկումը Google-ի սարքային ներդրման աշխատանքները դուրս է բերում տեքստային սահմաններից: Ներդրումները (embeddings) բովանդակությունը վերածում են թվերի, որոնք արտացոլում են իմաստը, ինչն օգտագործվում է որոնման գործիքների և որոնման վրա հիմնված գեներացման (RAG) համակարգերի կողմից՝ համապատասխան նյութեր գտնելու համար: Google-ը նշել է, որ մշակողները կարող են օգտագործել մոդելը՝ ձայնային հաղորդագրությունից կոնկրետ տեսահոլովակ գտնելու կամ տեքստային հարցման միջոցով ժամեր տևողությամբ աուդիո ձայնագրություններ որոնելու համար: Առաջին EmbeddingGemma-ն՝ 308 միլիոն պարամետր ունեցող միայն տեքստային մոդելը, որը կառուցված էր Gemma 3-ի հիման վրա, թողարկվել էր 2025 թվականի սեպտեմբերին: Google-ի տվյալներով՝ այն ներբեռնվել է ավելի քան 20 միլիոն անգամ:blog+1
Մշակողները պարտավոր չեն բեռնել ամբողջ մոդելը: Google-ի ուղեցույցի համաձայն՝ տեքստի և կոդի միջուկն ունի 270 միլիոն պարամետր, տեսողական կոդավորիչը ավելացնում է 170 միլիոն, իսկ աուդիո կոդավորիչը՝ 300 միլիոն: Յուրաքանչյուր համադրություն ստեղծում է վեկտորներ նույն տարածության մեջ, ուստի միայն տեքստային կարգավորումներով ստեղծված հարցումը կարող է ուղղակիորեն համադրվել ամբողջական մոդելով մշակված փաստաթղթերի հետ: Բոլոր մուտքային տվյալները կիսում են 8,192-թոքենանոց համատեքստային պատուհանը, որը չորս անգամ մեծ է օրիգինալ մոդելի պատուհանից: Սա բավարար է մինչև 29 պատկեր, 58 տեսանյութի կադր կամ 5.5 րոպե աուդիո մեկ մուտքագրման մեջ մշակելու համար:unite+2
Investing.com-ը հայտնել է, որ մոդելը Massive Text Embedding Benchmark-ի կոդի թեստում վաստակել է 78.68 միավոր, ինչը 9.92 միավորով ավելի է նախորդի 68.76 միավորից: Matryoshka Representation Learning կոչվող տեխնիկան թույլ է տալիս մշակողներին կրճատել վեկտորները մինչև 128 չափում, ինչը պահեստավորման ծավալը կրճատում է մինչև վեց անգամ: Google-ի ուղեցույցի համաձայն՝ 256-չափանի վեկտորները պահպանում են պատկերի, տեսանյութի և խոսքի որոնման ամբողջական որակի մոտ 95%-ը: 128 չափման դեպքում մուլտիմոդալ որոնման որակը նվազում է մինչև մոտ 75%:investing+1
Unite.AI-ի տվյալներով՝ մոդելի քարտում նշվում է, որ EmbeddingGemma 2-ը չի անցել հետուսուցողական անվտանգության կարգավորումներ: Սա նշանակում է, որ հավելվածի մակարդակի պաշտպանությունը մնում է մշակողների պատասխանատվության տակ:unite
Google-ի տվյալներով՝ Pixel 11 Pro-ի վրա քվանտացման կիրառմամբ, միայն տեքստային կշիռները օգտագործում են մոտ 191 մեգաբայթ ակտիվ հիշողություն, իսկ ամբողջական մուլտիմոդալ մոդելը՝ մոտ 567 մեգաբայթ: Seeking Alpha-ն հայտնել է, որ Google AI Edge Gallery հավելվածը կավելացնի մոդելի վրա հիմնված երկու դեմո տարբերակ: Instant Media Search-ը թույլ է տալիս օգտատերերին որոնել տեղական լուսանկարներ և տեսանյութեր ըստ նկարագրության, իսկ Video Moments Finder-ը կարող է գտնել տեսարաններ, ինչպիսիք են «շունը բռնում է ֆրիսբին», առանց աուդիոն նախապես վերծանելու: Google-ը նաև ներկայացրել է Google AI Edge Foresight-ը Mac-ի համար՝ փորձարարական հավելված, որը որոնում է հանդիպումների վերծանումներ, նշումներ, պատկերներ և համակարգչում պահված փաստաթղթեր:tradingview+1
Կշիռները հասանելի են Hugging Face-ում և Kaggle-ում: Google-ը հայտնում է, որ մոդելը առաջիկա շաբաթներին կհայտնվի Android-ի ML Kit-ում՝ ապահովելով սարքային արագացման աջակցություն այն սարքերում, որոնք ունեն այդ հնարավորությունը: Gemini Enterprise Agent Platform Model Garden-ում հասանելիությունը նույնպես «շուտով կլինի», ըստ Google-ի:investing+1