უკან დაბრუნება
Google DeepMind-მა EmbeddingGemma 2 გამოუშვა, მულტიმოდალური ემბედინგ მოდელი მოწყობილობისთვის
SiTech AI Team2 წთ. საკითხავი

Google DeepMind-მა EmbeddingGemma 2 გამოუშვა, მულტიმოდალური ემბედინგ მოდელი მოწყობილობისთვის

Google DeepMind-მა გამოუშვა EmbeddingGemma 2, ღია 740-მილიონიანი პარამეტრის მოდელი, რომელიც ტექსტს, სურათებს, აუდიოსა და ვიდეოს ერთიან ემბედინგ სივრცეში ათავსებს მოწყობილობაზე ძიებისთვის.

ერთიანი მულტიმოდალური ემბედინგ მოდელი

Google DeepMind-მა წარმოადგინა EmbeddingGemma 2, ღია და მსუბუქი ემბედინგ მოდელი, რომელიც ტექსტს, სურათებს, აუდიოსა და ვიდეოს ერთიან ემბედინგ სივრცეში ათავსებს. ის Gemma 4-ის არქიტექტურაზეა აგებული და Apache 2,0-ის ლიცენზიით ვრცელდება. 740 მილიონი პარამეტრის მქონე მოდელი მოწყობილობაზე მუშაობისთვისაა განკუთვნილი: მას შეუძლია ხმოვანი შენიშვნიდან კონკრეტული ვიდეოკლიპის მოძიება ან რამდენიმე საათის აუდიოჩანაწერში ტექსტური მოთხოვნით ძიება ლოკალურად, ერთი მოდელით.

EmbeddingGemma 2 მოჰყვება პირველ EmbeddingGemma-ს, რომელმაც 20 მილიონზე მეტი ჩამოტვირთვა მოაგროვა და გამოიყენებოდა მოწყობილობაზე ძიებასა და კონფიდენციალურობაზე ორიენტირებულ RAG-ში. ახალი ვერსია ტექსტის მიღმა კოდს, სურათებს, ვიდეოსა და აუდიოს ერთ საერთო სივრცეში აერთიანებს.

მოდულური და შენახვისადმი ეფექტური დიზაინი

EmbeddingGemma 2 მოდულურია. ტექსტისთვის საკმარისია 270 მილიონი პარამეტრი, სრული მულტიმოდალური მხარდაჭერისთვის კი ემატება ვიზუალური (170 მილიონი) და აუდიო (300 მილიონი) ენკოდერები. Matryoshka Representation Learning-ით დეველოპერებს შეუძლიათ ვექტორები 768 განზომილებიდან 512-მდე, 256-მდე ან 128-მდე შეამცირონ, რაც ლოკალურ ვექტორულ ბაზებში 6-მდე ჯერ ნაკლებ ადგილს მოითხოვს.

Google Pixel 11 Pro-ზე კვანტიზაციით ტექსტური წონები დაახლოებით 191MB აქტიურ RAM-ს იკავებს, სრული მოდელი კი დაახლოებით 567MB-ს. 8K ტოკენის კონტექსტი, EmbeddingGemma 1-ზე ოთხჯერ დიდი, ლოკალურად უზრუნველყოფს 5,5 წუთამდე აუდიოს, 29 სურათს, 58 ვიდეოკადრს ან მათ კომბინაციას.

ეფექტურობა ბენჩმარკებში

Google DeepMind-ის თქმით, EmbeddingGemma 2 1B-ზე ნაკლები პარამეტრის მულტიმოდალურ ემბედერებს შორის საუკეთესოა MTEB Code-სა და MAEB-ში, ხოლო ტექსტში, ხედვასა და აუდიოში ბევრ უფრო დიდ მოდელს აჯობებს ან უწევს კონკურენციას. კოდზე შედეგი MTEB Code-ში 68,76-დან 78,68-მდე გაუმჯობესდა, ანუ 9,92 პუნქტით, რაც მას ლოკალური კოდბაზის ინდექსირების, სემანტიკური ძიებისა და კოდირების აგენტებისთვის გამოსადეგს ხდის. სურათებში, ვიდეოში, დოკუმენტებსა და აუდიოში ის 1B-ზე ნაკლებ მოდელებს შორის ხარისხის ახალ სტანდარტს ამყარებს და ზოგიერთ ორჯერ დიდ სპეციალიზებულ მოდელსაც აჯობებს.

ხელმისაწვდომობა და გამოყენება მოწყობილობაზე

წონები ხელმისაწვდომია Hugging Face-ზე და Kaggle-ზე, Gemini Enterprise Agent Platform Model Garden-ში კი მალე გამოჩნდება. მოდელი მუშაობს transformers-ით, sentence-transformers-ით, MLX-ით, vLLM-ით, llama.cpp-ით, SGLang-ით, Ollama-თი და LMStudio-ით, ვექტორების შენახვა კი Qdrant-ით შეიძლება. დახვეწის ინსტრუქციას Unsloth-ი გვაძლევს.

დეველოპერებს EmbeddingGemma 2 შეუძლიათ სცადონ Google AI Edge Gallery-ის Instant Media Search-სა და Video Moments Finder-ში, Gemma 4-თან დააწყვილონ RAG-ისთვის Google AI Edge Foresight-ის აპში, ან ააგონ რეალურ დროში მოქმედი გადაწყვეტილების ძრავები MediaPipe Decision Task API-ით. მოწყობილობაზე გაშვებას მხარს უჭერენ Google AI Edge MediaPipe-ის, LiteRT-ის, transformers.js-ის და WebGPU-ის მეშვეობით.

წყაროები: blog.google

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.