
LensVLM-9B של Apple קוראת מסמכים כתמונות דחוסות ומרחיבה רק את העמודים הרלוונטיים
Apple פרסמה את LensVLM-9B, מודל חזותי-לשוני עם 9 מיליארד פרמטרים שסורק מסמכים כתמונות עמודים דחוסות ומשתמש בכלים מאומנים כדי לשחזר רק את העמודים הרלוונטיים, במקום לעבד את כל המסמך כטקסט מלא.
Apple פרסמה את LensVLM-9B, מודל חזותי-לשוני עם 9 מיליארד פרמטרים, שקורא מסמכים כתמונות עמודים דחוסות ומרחיב רק את העמודים שהוא צריך. כרטיס המודל פורסם ב-Hugging Face יחד עם מאגר קוד רשמי ומאמר שפורסם ב-arXiv ב-7 במאי 2026.
איך זה עובד
מודלים חזותיים-לשוניים יכולים לקרוא טקסט שעובד לתמונה במקום לפצל אותו לרצפים ארוכים של טוקנים: המקודד ממיר תמונה בגודל קבוע למספר קבוע של טוקנים חזותיים, ולכן רזולוציית העיבוד משמשת כפתרון כיוונון עדין לדחיסה. הבעיה: ככל שהדחיסה גדלה הדיוק צונח במהירות — התווים נעשים קטנים מרזולוציית המקודד האפקטיבית והמודל כבר לא מבחין בהם.
LensVLM הוא מתכון אימון-מחדש ומסגרת הסקה שנועדו לעקוף את המגבלה הזו. המודל סורק מסמך שעובד בצורה דחוסה (מצבי 5x, 10x ו-15x), ואז משתמש בכלים מאומנים כמו read_page כדי לשחזר סיבוב אחר סיבוב רק את העמודים הרלוונטיים לצורתם הלא-דחוסה. Apple אימנה אותו בשלושה שלבים: סינון דוגמאות קשות, נתיבי שימוש בכלים סינתטיים ל-SFT ולמידת חיזוק (RL). LensVLM-9B מבוסס על Qwen3.5-9B-Base.
מה מראים המספרים
לפי המאמר, בדחיסה אפקטיבית של 4.3x שומר LensVLM על דיוק דומה לגבול העליון של טקסט מלא, ובשבעה מבחני QA טקסטואליים הוא עוקף שיטות מבוססות שחזור, דחיסת טקסט ודחיסה חזותית עד 10.1x. המודל עובר גם למשימות הבנה של מסמכים וקוד מולטימודליות, והפער מול הבסיסים גדל ככל שהדחיסה עולה.
הניתוח מסביר מדוע: האימון הופך את הדחיסה החזותית לעמידה לבחירות העיבוד, וביחסי דחיסה גבוהים המודל נשען יותר על תוכן שהורחב מאשר על ניסיון לקרוא פיקסלים מצומצמים. המחברים מוסיפים המלצה מעשית: הרחבת טקסט מתאימה לטקסט מעובד, בעוד הרחבת תמונה ברזולוציה גבוהה מתאימה למסמכים שפריסתם נושאת מידע רלוונטי למשימה.
דמו והשקה
הדמו קצר: המודל סורק 15 תמונות עמודים דחוסות, מזהה שעמוד 10 הוא הרלוונטי, קורא אותו בכלי read_page ומקשר בין Shirley Temple, Corliss Archer ו-Chief of Protocol בשני סיבובים. המאגר כולל גם הכנת נתונים ל-HotpotQA, NQ ו-Musique וקוד הערכה.
המשקולות משוחררות תחת רישיון Apple Machine Learning Research Model License והקוד תחת Apple Sample Code License. ברשומת Hugging Face מופיעים 9B פרמטרים ב-BF16, 233 הורדות בחודש האחרון ושתי קוונטיזציות קהילתיות.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.