
Apple'ın LensVLM-9B modeli belgeleri sıkıştırılmış görüntü olarak okuyor, yalnız ilgili sayfaları açıyor
Apple, belgeleri sıkıştırılmış sayfa görüntüleri halinde tarayan ve yalnızca ihtiyaç duyduğu sayfaları öğrenilmiş araçlarla tam haline döndüren 9 milyar parametreli LensVLM-9B'yi yayınladı.
Apple, LensVLM-9B'yi yayınladı: belgeleri sıkıştırılmış sayfa görüntüleri olarak okuyan ve yalnızca ihtiyaç duyduğu sayfaları açan 9 milyar parametreli bir görüntü-dil modeli. Model kartı, kod deposu ve 7 Mayıs 2026'da arXiv'de yayımlanan makaleyle birlikte Hugging Face'te yer alıyor.
Nasıl çalışıyor
Görüntü-dil modelleri metni uzun token dizilerine ayırmak yerine görüntü olarak işleyebilir; kodlayıcı sabit boyutlu bir görüntüyü sabit sayıda görsel tokene dönüştürdüğü için oluşturma çözünürlüğü ince ayarlı bir sıkıştırma düğmesi işlevi görür. Sorun şu: sıkıştırma arttıkça doğruluk hızla düşer — karakterler kodlayıcının etkin çözünürlüğünün altına iner ve model onları ayırt edemez.
LensVLM bu sınırı aşmak için tasarlanmış bir eğitim sonrası tarif ve çıkarım çerçevesi. Model, sıkıştırılmış biçimde oluşturulmuş bir belgeyi tarar (5x, 10x ve 15x ön ayarları), ardından read_page gibi öğrenilmiş araçları çağırarak yalnızca ilgili sayfaları adım adım sıkıştırılmamış haline döndürür. Apple modeli üç aşamada eğitti: zor örneklerin süzülmesi, SFT için sentetik araç kullanımı izleri ve pekiştirmeli öğrenme (RL). LensVLM-9B, Qwen3.5-9B-Base üzerine kurulu.
Rakamlar ne gösteriyor
Makaleye göre LensVLM, 4,3x etkin sıkıştırmada tam metin üst sınırına yakın doğruluk koruyor ve yedi metin QA karşılaştırmasında geri getirmeye dayalı, metin sıkıştırma ve görsel sıkıştırma temellerini 10,1x'e kadar geçiyor. Model ayrıca çok kipli belge ve kod anlama görevlerine de aktarılıyor; sıkıştırma arttıkça temellere karşı fark büyüyor.
Analiz nedenini gösteriyor: eğitim, görsel sıkıştırmayı oluşturma tercihlerine dayanıklı hale getiriyor ve yüksek sıkıştırma oranlarında model küçülen pikselleri okumaya çalışmak yerine açılmış içeriğe daha çok yaslanıyor. Yazarlar pratik bir öneri de ekliyor: oluşturulmuş metin için metnin açılması, düzeni göreve dair bilgi taşıyan belgeler için ise yüksek çözünürlüklü görüntünün açılması daha uygun.
Demo ve sürüm
Demo kısa: model 15 sıkıştırılmış sayfa görüntüsünü tarar, 10. sayfayı ilgili olarak belirler, read_page aracıyla okur ve Shirley Temple, Corliss Archer ile Chief of Protocol arasında iki turda bağlantı kurar. Depo ayrıca HotpotQA, NQ ve Musique için veri hazırlığı ve değerlendirme kodunu içeriyor.
Ağırlıklar Apple Machine Learning Research Model License, kod ise Apple Sample Code License ile yayınlandı. Hugging Face kaydında 9B parametre, BF16 hassasiyeti, son ayda 233 indirme ve iki topluluk nicemlemesi listeleniyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.