Վերադառնալ
SiTech Team⏱️ 1 წთ. საკითხავი

Baidu-ի Unlimited OCR — տասնյակ էջեր մեկ անցումով, հիշողությունը որպես մարդկային մոռացկոտություն

Baidu-ի Unlimited OCR — տասնյակ էջեր մեկ անցումով, հիշողությունը որպես մարդկային մոռացկոտություն

Baidu-ի հետազոտողները ստեղծել են OCR մոդել, որը մեկ անցումով մշակում է տասնյակ էջեր: Փափուկ մոռացման մեխանիզմը KV քեշը պահում է կայուն:

OCR-ի խցանը

Baidu-ի հետազոտողները կառուցել են OCR մոդել, որը մեկ անցումով մշակում է տասնյակ փաստաթղթերի էջեր՝ պահպանելով հիշողության և արագության կայունությունը՝ անկախ տեքստի երկարությունից: Վերանայված ուշադրության մեխանիզմը հնարավորություն է տալիս դա:

Ֆիքսված պատուհանը սահմանափակում է հիշողության օգտագործումը

Լուծումն աշխատում է R-SWA մեխանիզմի միջոցով: Յուրաքանչյուր ստեղծված թոքեն տեսնում է բոլոր հղման թոքենները, բայց ավելի վաղ ստեղծված ելքից նայում է միայն վերջին 128 թոքենին:

Հիմնված DeepSeek OCR-ի վրա

Unlimited OCR-ը հիմնված է DeepSeek OCR մոդելի վրա: Baidu-ի ճարտարապետությունը բաղկացած է DeepEncoder-ից (3 միլիարդ պարամետր) Mixture-of-Experts վերծանիչով: Մոդելը բաց կոդով է:

Ավելի լարդ արդյունքներ՝ չնայած սահմանափակ ուշադրությանը

Unlimited OCR-ը հասնում է 93%-ի OmniDocBench v1.5-ում և 93.92%-ի v1.6-ում: Արագությունը՝ 5,580 թոքեն/վայրկյան:

Դեռևս իսկապես անսահմանափակ չէ

Մոդելը դեռ իսկապես «անսահմանափակ» չէ: Հետազոտողները նախատեսում են ընդլայնել մոդելի կոնտեքստը մինչև 128K թոքեն:

Եզրակացություն

Վրաստանում և ամբողջ աշխարհում Unlimited OCR-ը կարող է նշանակել երկար իրավական և բժշկական փաստաթղթերի ավելի արագ թվայնացում: