Baidu-ի Unlimited OCR — տասնյակ էջեր մեկ անցումով, հիշողությունը որպես մարդկային մոռացկոտություն
Baidu-ի հետազոտողները ստեղծել են OCR մոդել, որը մեկ անցումով մշակում է տասնյակ էջեր: Փափուկ մոռացման մեխանիզմը KV քեշը պահում է կայուն:
OCR-ի խցանը
Baidu-ի հետազոտողները կառուցել են OCR մոդել, որը մեկ անցումով մշակում է տասնյակ փաստաթղթերի էջեր՝ պահպանելով հիշողության և արագության կայունությունը՝ անկախ տեքստի երկարությունից: Վերանայված ուշադրության մեխանիզմը հնարավորություն է տալիս դա:
Ֆիքսված պատուհանը սահմանափակում է հիշողության օգտագործումը
Լուծումն աշխատում է R-SWA մեխանիզմի միջոցով: Յուրաքանչյուր ստեղծված թոքեն տեսնում է բոլոր հղման թոքենները, բայց ավելի վաղ ստեղծված ելքից նայում է միայն վերջին 128 թոքենին:
Հիմնված DeepSeek OCR-ի վրա
Unlimited OCR-ը հիմնված է DeepSeek OCR մոդելի վրա: Baidu-ի ճարտարապետությունը բաղկացած է DeepEncoder-ից (3 միլիարդ պարամետր) Mixture-of-Experts վերծանիչով: Մոդելը բաց կոդով է:
Ավելի լարդ արդյունքներ՝ չնայած սահմանափակ ուշադրությանը
Unlimited OCR-ը հասնում է 93%-ի OmniDocBench v1.5-ում և 93.92%-ի v1.6-ում: Արագությունը՝ 5,580 թոքեն/վայրկյան:
Դեռևս իսկապես անսահմանափակ չէ
Մոդելը դեռ իսկապես «անսահմանափակ» չէ: Հետազոտողները նախատեսում են ընդլայնել մոդելի կոնտեքստը մինչև 128K թոքեն:
Եզրակացություն
Վրաստանում և ամբողջ աշխարհում Unlimited OCR-ը կարող է նշանակել երկար իրավական և բժշկական փաստաթղթերի ավելի արագ թվայնացում: