← უკან დაბრუნება
SiTech Team⏱️ 2 წთ. საკითხავი

Baidu-ს „Unlimited OCR" — ათობით გვერდი ერთი გავლით, მეხსიერება როგორც ადამიანის დავიწყება

Baidu-ს „Unlimited OCR" — ათობით გვერდი ერთი გავლით, მეხსიერება როგორც ადამიანის დავიწყება

Baidu-ს მკვლევრებმა შექმნეს OCR მოდელი, რომელსაც ერთდროულად ათობით გვერდის დამუშავება შეუძლია. „რბილი დავიწყების" მექანიზმი KV cache-ს მუდმივ დონეზე ინახავს, რაც სიჩქარეს მკვეთრად ზრდის.

OCR-ის გამოწვევა: KV cache-ის პრობლემა

Baidu-ს მკვლევრებმა შექმნეს OCR მოდელი, რომელსაც ერთდროულად ათობით გვერდის დამუშავება შეუძლია, ხოლო მეხსიერების მოხმარება და სიჩქარე მუდმივი რჩება ტექსტის სიგრძის მიუხედავად. ეს შესაძლებელი გახდა სრულიად ახალი ყურადღების მექანიზმის (attention mechanism) დამსახურებით.

არც ერთი არსებული OCR მოდელი არ ამუშავებს ათზე მეტ გვერდს ერთ გავლაში. მთავარი შემაფერხებელია KV cache — ბუფერი, სადაც ენობრივი მოდელი ინახავს ყველა წინასწარ დამუშავებულ ტოკენს. რაც უფრო მეტი ტოქენი მუშავდება, მით უფრო იზრდება ბუფერი, რაც ზრდის მეხსიერების მოხმარებას და ანელებს მუშაობას. ამ პრობლემის გადასაწყვეტად, სისტემები, როგორც წესი, თითო-თითო გვერდს ამუშავებენ.

ადამიანური ანალოგია: „რბილი დავიწყება"

Baidu-ს მკვლევრები პრობლემას ადამიანური ანალოგიით ხსნიან. როცა ადამიანი წიგნს გადაწერს, ის ყოველ ჯერზე თავიდან არ კითხულობს ყველაფერს, რაც უკვე დაწერა. მისი მზერა კონცენტრირებულია წყაროზე, ბოლოს დაწერილ სიმბოლოებზე და შემდეგ სიმბოლოზე, რომელიც უნდა დაწეროს. ძველი მონაკვეთები "ქრება" ერთგვარი რბილი დავიწყების გზით. Baidu-ს Unlimited OCR სწორედ ამ მოდელ� ბაძავს.

R-SWA: ფიქსირებული ფანჯრის მექანიზმი

გადაწყვეტა ემყარება Reference Sliding Window Attention (R-SWA) მექანიზმს. თითოეული გენერირებული ტოკენი ხედავს ყველა საცნობარო ტოკენს (ვიზუალური გამოსახულებები და პრომპტი), მაგრამ რაც შეეხება ადრე გენერირებულ მონაცემებს, ის მხოლოდ ბოლო 128 ტოკენს ამუშავებს. ეს საშუალებას იძლევა, KV cache დარჩეს მუდმივი მთელი პროცესის განმავლობაში.

KV cache მუშაობს რიგის პრინციპით: ყოველი ახალი ტოკენი გამოდევნის უძველეს ტოკენს. სტანდარტული მრავალ-თავიანი (multi-head) ყურადღების მექანიზმით, მეხსიერების მოხმარება უსასრულოდ იზრდება. R-SWA კი მას აფიქსირებს წინასწარი ზომისა და ფანჯრის ზომის ჯამის დონეზე.

DeepSeek OCR-ზე დაფუძნებული არქიტექტურა

Unlimited OCR ეფუძნება DeepSeek OCR მოდელს. Baidu-ს არქიტექტურა შედგება DeepEncoder-ისგან (3 მილიარდი პარამეტრი) Mixture-of-Experts (MoE) დეკოდერით, რომელიც იყენებს 500 მილიონ აქტიურ პარამეტრს თითო ტოკენზე. მოდელი ღია კოდია და ხელმისაწვდომია GitHub-სა და Hugging Face-ზე.

შედეგები: უკეთესი, მიუხედავად შეზღუდვებისა

Unlimited OCR აჩვენებს კონკურენტუნარიან შედეგებს: 93% OmniDocBench v1.5-ზე, 93.92% v1.6-ზე. სიჩქარე: 5,580 ტოკენი წამში — 12.7%-ით უფრო სწრაფი, ვიდრე DeepSeek OCR. kernel latency რჩება მუდმივი (~9 მიკროწამი), მაშინ როცა სტანდარტული მექანიზმით ის 16 მიკროწამს აღემატება.

შეზღუდვები

სახელის მიუხედავად, მოდელი ჯერ კიდევ არ არის "ულიმიტო". მიმდინარე ვერსია დაახლოებით 30-50 გვერდს ამუშავებს, რაც მნიშვნელოვნად აღემატება არსებული მოდელების 10-გვერდიან ზღვარს. Baidu-ს მკვლევრები გეგმავენ მოდელის კონტექსტის 128K ტოკენამდე გაზრდას.

პრაქტიკული მნიშვნელობა

Unlimited OCR-ს შეუძლია მნიშვნელოვნად დააჩქაროს გრძელი იურიდიული და სამედიცინო დოკუმენტების ციფრულიზაცია, ისტორიული დოკუმენტების ეფექტიანი არქივირება. R-SWA ტექნიკას ასევე აქვს ფართო გამოყენების პოტენციალი AI-ს სხვა სფეროებში — ენის თარგმნიდან კოდის გენერაციამდე.

📖 წაიკითხე ორიგინალი The Decoder-ზე