
Apple-ը թողարկել է LensVLM-9B-ը՝ փաստաթղթերը սեղմված պատկերների տեսքով կարդացող մոդել
Apple-ը հրապարակել է LensVLM-9B-ը՝ 9 միլիարդ պարամետր ունեցող տեսալեզվական մոդել, որը փաստաթղթերը սկանավորում է սեղմված էջերի պատկերների տեսքով և սովորած գործիքներով բացում է միայն անհրաժեշտ էջերը։
Apple-ը հրապարակել է LensVLM-9B-ը՝ 9 միլիարդ պարամետր ունեցող տեսալեզվական մոդել, որը փաստաթղթերը կարդում է սեղմված էջերի պատկերների տեսքով և բացում է միայն իրեն անհրաժեշտ էջերը։ Մոդելի քարտը հրապարակվել է Hugging Face-ում՝ կոդի պահոցի և 2026 թվականի մայիսի 7-ին arXiv-ում հրապարակված հոդվածի հետ միասին։
Ինչպես է աշխատում
Տեսալեզվական մոդելները կարող են տեքստը կարդալ որպես պատկեր՝ այն երկար թոքենային հաջորդականությունների բաժանելու փոխարեն։ Քանի որ կոդավորիչը ֆիքսված չափի պատկերը վերածում է ֆիքսված թվով վիզուալ թոքենների, արտապատկերման լուծաչափը դառնում է սեղմման նուրբ կարգավորիչ։ Խնդիրն այն է, որ սեղմման աճին զուգահեռ ճշգրտությունը արագ ընկնում է — նշանները փոքրանում են կոդավորիչի արդյունավետ լուծաչափից, և մոդելն այլևս չի տարբերում դրանք։
LensVLM-ը շրջանցում է այս սահմանափակումը։ Մոդելը սկանավորում է սեղմված ձևով արտապատկերված փաստաթուղթը (5x, 10x և 15x ռեժիմներ), ապա սովորած գործիքներով, օրինակ read_page-ով, քայլ առ քայլ վերականգնում է միայն համապատասխան էջերը չսեղմված տեսքով։ Apple-ը մոդելը մարզել է երեք փուլով՝ բարդ օրինակների զտում, SFT-ի համար սինթետիկ գործիքային հետքեր և RL։ LensVLM-9B-ը կառուցված է Qwen3.5-9B-Base-ի վրա։
Ինչ են ցույց տալիս թվերը
Ըստ հոդվածի՝ 4,3x արդյունավետ սեղմման դեպքում LensVLM-ը պահպանում է ամբողջական տեքստի վերին սահմանի հետ համադրելի ճշգրտություն, իսկ յոթ տեքստային QA բենչմարքներում գերազանցում է որոնման վրա հիմնված, տեքստային և վիզուալ սեղմման բազային լուծումներին՝ մինչև 10,1x։ Մոդելը փոխանցվում է նաև մուլտիմոդալ փաստաթղթերի և կոդի ընկալման առաջադրանքներին, իսկ բազային լուծումների նկատմամբ առավելությունը աճում է սեղմման հետ։
Վերլուծությունը բացատրում է պատճառը՝ մարզումից հետո վիզուալ սեղմումը դիմացկուն է դառնում արտապատկերման ընտրություններին, իսկ բարձր սեղմման դեպքում մոդելն ավելի շատ հենվում է բացված բովանդակության վրա, քան փոքրացած պիքսելները կարդալու փորձի։ Հեղինակները գործնական խորհուրդ էլ են տալիս՝ արտապատկերված տեքստի համար նախընտրելի է տեքստի բացումը, իսկ դասավորությունը կրող փաստաթղթերի համար՝ բարձր լուծաչափով պատկերի բացումը։
Դեմոն և թողարկումը
Դեմոն կարճ է. մոդելը սկանավորում է 15 սեղմված էջի պատկեր, առանձնացնում է 10-րդ էջը որպես համապատասխան, կարդում է այն read_page գործիքով և երկու քայլով կապում է Shirley Temple-ին, Corliss Archer-ին և Chief of Protocol-ին։ Պահոցը ներառում է նաև HotpotQA-ի, NQ-ի և Musique-ի տվյալների պատրաստումը և գնահատման կոդը։
Կշիռները թողարկվել են Apple Machine Learning Research Model License-ի, իսկ կոդը՝ Apple Sample Code License-ի պայմաններով։ Hugging Face-ի գրառումը նշում է 9B պարամետր BF16 ձևաչափով, վերջին ամսվա 233 ներբեռնում և արդեն հասանելի երկու քվանտացում։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։