Geri qayıt
Apple-ın LensVLM-9B modeli sənədləri sıxılmış şəkillər kimi oxuyur, yalnız lazımi səhifələri açır
SiTech AI Team2 წთ. საკითხავი

Apple-ın LensVLM-9B modeli sənədləri sıxılmış şəkillər kimi oxuyur, yalnız lazımi səhifələri açır

Apple 9 milyard parametrli LensVLM-9B modelini buraxıb: model sənədləri sıxılmış səhifə şəkilləri kimi skan edir və yalnız lazım olan səhifələri öyrədilmiş alətlər vasitəsilə tam formasına qaytarır.

Apple LensVLM-9B-ni buraxıb: sənədləri sıxılmış səhifə şəkilləri kimi oxuyan və yalnız lazım olan səhifələri tam formasına qaytaran 9 milyard parametrli vizual-dil modeli. Model kartı Hugging Face-də kod repozitoriyası və 7 may 2026-cı ildə arXiv-də dərc olunan məqalə ilə birgə yerləşdirilib.

Necə işləyir

Vizual-dil modelləri mətni uzun token ardıcıllıqlarına bölmək əvəzinə şəkil kimi emal edə bilir: kodlayıcı sabit ölçülü şəkli sabit sayda vizual tokene çevirdiyi üçün render ölçüsü çevik sıxma düyməsi rolunu oynayır. Problem burasıdır ki, sıxma artdıqca dəqiqlik sürətlə düşür — simvollar kodlayıcının effektiv ölçüsündən kiçik olur və model onları ayırd edə bilmir.

LensVLM bu həddən yan keçmək üçün hazırlanmış təlim-sonrası resept və inference çərçivəsidir. Model sıxılmış formada render edilmiş sənədi skan edir (5x, 10x və 15x rejimləri), sonra read_page kimi öyrədilmiş alətlərlə yalnız uyğun səhifələri addım-addım sıxılmamış formasına qaytarır. Apple modeli üç mərhələdə öyrədib: çətin nümunələrin süzülməsi, SFT üçün sintetik alət izləri və gücləndirməli öyrənmə (RL). LensVLM-9B Qwen3.5-9B-Base üzərində qurulub.

LensVLM metodunun sxemi

Rəqəmlər nə göstərir

Məqaləyə görə, 4,3x effektiv sıxmada LensVLM tam mətnin yuxarı həddinə yaxın dəqiqliyi saxlayır və yeddi mətn QA benchmarkında axtarışa əsaslanan, mətn və vizual sıxma metodlarını 10,1x-ə qədər üstələyir. Model həmçinin multimodal sənəd və kod anlama tapşırıqlarına keçir, sıxma artdıqca üstünlük də böyüyür.

Təhlil səbəbini göstərir: təlim vizual sıxmanı render seçimlərinə davamlı edir, yüksək sıxma nisbətlərində isə model kiçilən pikselləri oxumaq əvəzinə açılmış məzmuna daha çox arxalanır. Müəlliflər praktiki məsləhət də verir: render edilmiş mətn üçün mətnin açılması üstünlük təşkil edir, düzümü tapşırıq üçün vacib məlumat daşıyan sənədlər üçün isə yüksək ölçülü şəkil açılışı uyğundur.

10x sıxmada render edilmiş mətn səhifəsi

Demo və buraxılış

Demo qısadır: model 15 sıxılmış səhifə şəklini skan edir, 10-cu səhifəni uyğun kimi müəyyənləşdirir, onu read_page aləti ilə oxuyur və Shirley Temple, Corliss Archer və Chief of Protocol arasında iki addımda əlaqə qurur. Repozitoriya həmçinin HotpotQA, NQ və Musique üçün verilən hazırlığını və qiymətləndirmə kodunu ehtiva edir.

Çəkilər Apple Machine Learning Research Model License, kod isə Apple Sample Code License ilə buraxılıb. Hugging Face qeydində 9B parametr BF16 formatında, son ayda 233 endirmə və artıq mövcud iki kvantizasiya göstərilir.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.