Վերադառնալ
Apple-ը թողարկել է LensVLM-9B-ը՝ փաստաթղթերը սեղմված պատկերների տեսքով կարդացող մոդել
SiTech AI Team2 წთ. საკითხავი

Apple-ը թողարկել է LensVLM-9B-ը՝ փաստաթղթերը սեղմված պատկերների տեսքով կարդացող մոդել

Apple-ը հրապարակել է LensVLM-9B-ը՝ 9 միլիարդ պարամետր ունեցող տեսալեզվական մոդել, որը փաստաթղթերը սկանավորում է սեղմված էջերի պատկերների տեսքով և սովորած գործիքներով բացում է միայն անհրաժեշտ էջերը։

Apple-ը հրապարակել է LensVLM-9B-ը՝ 9 միլիարդ պարամետր ունեցող տեսալեզվական մոդել, որը փաստաթղթերը կարդում է սեղմված էջերի պատկերների տեսքով և բացում է միայն իրեն անհրաժեշտ էջերը։ Մոդելի քարտը հրապարակվել է Hugging Face-ում՝ կոդի պահոցի և 2026 թվականի մայիսի 7-ին arXiv-ում հրապարակված հոդվածի հետ միասին։

Ինչպես է աշխատում

Տեսալեզվական մոդելները կարող են տեքստը կարդալ որպես պատկեր՝ այն երկար թոքենային հաջորդականությունների բաժանելու փոխարեն։ Քանի որ կոդավորիչը ֆիքսված չափի պատկերը վերածում է ֆիքսված թվով վիզուալ թոքենների, արտապատկերման լուծաչափը դառնում է սեղմման նուրբ կարգավորիչ։ Խնդիրն այն է, որ սեղմման աճին զուգահեռ ճշգրտությունը արագ ընկնում է — նշանները փոքրանում են կոդավորիչի արդյունավետ լուծաչափից, և մոդելն այլևս չի տարբերում դրանք։

LensVLM-ը շրջանցում է այս սահմանափակումը։ Մոդելը սկանավորում է սեղմված ձևով արտապատկերված փաստաթուղթը (5x, 10x և 15x ռեժիմներ), ապա սովորած գործիքներով, օրինակ read_page-ով, քայլ առ քայլ վերականգնում է միայն համապատասխան էջերը չսեղմված տեսքով։ Apple-ը մոդելը մարզել է երեք փուլով՝ բարդ օրինակների զտում, SFT-ի համար սինթետիկ գործիքային հետքեր և RL։ LensVLM-9B-ը կառուցված է Qwen3.5-9B-Base-ի վրա։

LensVLM մեթոդի սխեման

Ինչ են ցույց տալիս թվերը

Ըստ հոդվածի՝ 4,3x արդյունավետ սեղմման դեպքում LensVLM-ը պահպանում է ամբողջական տեքստի վերին սահմանի հետ համադրելի ճշգրտություն, իսկ յոթ տեքստային QA բենչմարքներում գերազանցում է որոնման վրա հիմնված, տեքստային և վիզուալ սեղմման բազային լուծումներին՝ մինչև 10,1x։ Մոդելը փոխանցվում է նաև մուլտիմոդալ փաստաթղթերի և կոդի ընկալման առաջադրանքներին, իսկ բազային լուծումների նկատմամբ առավելությունը աճում է սեղմման հետ։

Վերլուծությունը բացատրում է պատճառը՝ մարզումից հետո վիզուալ սեղմումը դիմացկուն է դառնում արտապատկերման ընտրություններին, իսկ բարձր սեղմման դեպքում մոդելն ավելի շատ հենվում է բացված բովանդակության վրա, քան փոքրացած պիքսելները կարդալու փորձի։ Հեղինակները գործնական խորհուրդ էլ են տալիս՝ արտապատկերված տեքստի համար նախընտրելի է տեքստի բացումը, իսկ դասավորությունը կրող փաստաթղթերի համար՝ բարձր լուծաչափով պատկերի բացումը։

10x սեղմումով արտապատկերված էջ

Դեմոն և թողարկումը

Դեմոն կարճ է. մոդելը սկանավորում է 15 սեղմված էջի պատկեր, առանձնացնում է 10-րդ էջը որպես համապատասխան, կարդում է այն read_page գործիքով և երկու քայլով կապում է Shirley Temple-ին, Corliss Archer-ին և Chief of Protocol-ին։ Պահոցը ներառում է նաև HotpotQA-ի, NQ-ի և Musique-ի տվյալների պատրաստումը և գնահատման կոդը։

Կշիռները թողարկվել են Apple Machine Learning Research Model License-ի, իսկ կոդը՝ Apple Sample Code License-ի պայմաններով։ Hugging Face-ի գրառումը նշում է 9B պարամետր BF16 ձևաչափով, վերջին ամսվա 233 ներբեռնում և արդեն հասանելի երկու քվանտացում։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։