Վերադառնալ
Google DeepMind-ը թողարկեց EmbeddingGemma 2, մուլտիմոդալ embedding մոդել սարքերի համար
SiTech AI Team2 րոպե ընթերցում

Google DeepMind-ը թողարկեց EmbeddingGemma 2, մուլտիմոդալ embedding մոդել սարքերի համար

Google DeepMind-ը թողարկեց EmbeddingGemma 2, բաց 740 միլիոն պարամետրով մոդել, որը տեքստը, պատկերները, աուդիոն և վիդեոն տեղադրում է մեկ ընդհանուր embedding տարածությունում սարքում որոնման համար:

Միասնական մուլտիմոդալ embedding մոդել

Google DeepMind-ը ներկայացրեց EmbeddingGemma 2, բաց և թեթև embedding մոդել, որը տեքստը, պատկերները, աուդիոն և վիդեոն տեղադրում է մեկ ընդհանուր embedding տարածությունում: Այն կառուցված է Gemma 4-ի ճարտարապետության վրա և տարածվում է Apache 2,0 լիցենզիայով: 740 միլիոն պարամետրով մոդելը նախատեսված է աշխատելու սարքում: այն կարող է ձայնային նշումից կոնկրետ վիդեոկլիպ գտնել կամ մի քանի ժամ տևող աուդիոձանգերտում տեքստային հարցմամբ որոնել լոկալ ռեժիմում, մեկ մոդելով:

EmbeddingGemma 2-ը հաջորդում է առաջին EmbeddingGemma-ին, որը հավաքել է 20 միլիոնից ավելի ներբեռնում և օգտագործվել է սարքում որոնման և գաղտնիության վրա հիմնված RAG-ում: Նոր տարբերակը տեքստից բացի կոդը, պատկերները, վիդեոն և աուդիոն միավորում է մեկ ընդհանուր տարածությունում:

Մոդուլային և հիշողության համար արդյունավետ դիզայն

EmbeddingGemma 2-ը մոդուլային է: Տեքստի համար բավարար է 270 միլիոն պարամետր, իսկ լիարժեք մուլտիմոդալ աջակցության համար ավելանում են վիզուալ (170 միլիոն) և աուդիո (300 միլիոն) կոդավորիչները: Matryoshka Representation Learning-ով մշակողները կարող են կրճատել վեկտորները 768 չափից 512, 256 կամ 128, ինչը լոկալ վեկտորային տվյալների բազաներում պահանջում է 6 անգամ պակաս տեղ:

Google Pixel 11 Pro-ում կվանտիզացման միջոցով տեքստային կշերը զբաղեցնում են մոտավորապես 191MB ակտիվ RAM, իսկ ամբողջական մոդելը՝ մոտավորապես 567MB: 8K թոեկենի կոնտեքստը, EmbeddingGemma 1-ի համեմատ քառապատիկ ավելի մեծ, լոկալ ռեժիմում ապահովում է մինչև 5,5 րոպե աուդիո, 29 պատկեր, 58 վիդեոկադր կամ դրանց կոմբինացիա:

Արդյունավետություն բենչմարկերում

Google DeepMind-ի տվյալներով, EmbeddingGemma 2-ը 1B-ից պակաս պարամետրերով մուլտիմոդալ մոդելների միջև լավագույնն է MTEB Code-ում և MAEB-ում, իսկ տեքստում, տեսողության և աուդիոյի ոլորտներում հաղթում է շատ ավելի մեծ մոդելներին կամ մրցակցում է դրանց հետ: Կոդի ոլորտում արդյունքը MTEB Code-ում բարելավվել է 68,76-ից 78,68, այսինքն 9,92 միավորով, ինչը դրան դարձնում է լոկալ կոդային բազայի ինդեքսավորման, սեմանտիկ որոնման և կոդավորման ագենտների համար համապատասխան լուծում: Պատկերներում, վիդեոյում, փաստաթղթերում և աուդիոյում այն սահմանում է որակի նոր ստանդարտ 1B-ից ցածր մոդելների միջև և հաղթում է որոշ կրկնակի ավելի մեծ մասնագիտացված մոդելներին:

Հասանելիություն և օգտագործում սարքում

Քշերը հասանելի են Hugging Face-ում և Kaggle-ում, իսկ Gemini Enterprise Agent Platform Model Garden-ում շուտով կհայտնվի: Մոդելը աշխատում է transformers-ով, sentence-transformers-ով, MLX-ով, vLLM-ով, llama.cpp-ով, SGLang-ով, Ollama-ով և LMStudio-ով, իսկ վեկտորները կարելի է պահել Qdrant-ով: Մանրամասն հրահանգները Unsloth-ը տալիս է մեզ:

Մշակողները EmbeddingGemma 2-ով կարող են փորձել Google AI Edge Gallery-ի Instant Media Search-ը և Video Moments Finder-ը, կիրառել Gemma 4-ի հետ RAG-ի համար Google AI Edge Foresight-ի հավելվածում կամ ստեղծել իրական ժամանակում աշխատող որոշումների մոտորներ MediaPipe Decision Task API-ով: Սարքում գործարկմանը աջակցում են Google AI Edge MediaPipe-ը, LiteRT-ը, transformers.js-ը և WebGPU-ը:

Նյութերի աղբյուրներ: blog.google

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։