Baidu-nun Limitsiz OCR-i — Bir Keçiddə Çoxsaylı Səhifələr, Yaddaşı İnsan Unutqanlığı Kimi İdarə Edir
Baidu tədqiqatçıları bir keçiddə çoxsaylı sənəd səhifələrini emal edən OCR modeli qurdular. Yumşaq unutma mexanizmi KV keşini sabit saxlayır.
Giriş: OCR-nin dar boğazı
Baidu tədqiqatçıları mətn uzunluğundan asılı olmayaraq yaddaş istifadəsi və sürəti sabit saxlamaqla, bir keçiddə çoxsaylı sənəd səhifələrini emal edən OCR modeli qurdular. Yenidən dizayn edilmiş diqqət mexanizmi bunu mümkün edir.
Heç bir cari OCR modeli bir keçiddə on səhifədən çoxunu idarə edə bilmir. Dar boğaz KV keşidir — bir yaddaş buferi. Baidu tədqiqatçıları problemi insan bənzətməsi ilə izah edirlər.
Giriş: Sabit Pəncərə Yaddaş İstifadəsini Məhdudlaşdırır
Texnika, komandanın Referans Sürüşmə Pəncərə Diqqəti (R-SWA) adlandırdığı mexanizm vasitəsilə işləyir. Hər bir yaradılan token bütün istinad tokenlərini görür. Ancaq əvvəllər yaradılan çıxışa gəldikdə, yalnız son 128 tokenə baxır. Bu, KV keşini bütün proses boyu sabit saxlayır.
DeepSeek OCR üzərində qurulub
Unlimited OCR DeepSeek OCR modelini əsas götürür. Baidu arxitekturası DeepEncoder (3 milyard parametr) və Mixture-of-Experts dekoderindən (hər token üçün 500 milyon aktiv parametr) ibarətdir. Model açıq mənbəlidir.
Daha yaxşı nəticələr
Məhdudiyyətlərinə baxmayaraq, Unlimited OCR rəqabətli nəticələr təqdim edir. OmniDocBench v1.5-də 93%, v1.6-da 93.92% əldə edir. Sürəti: saniyədə 5,580 token — DeepSeek OCR-dən 12.7% daha sürətli.
Hələ tam məhdudiyyətsiz deyil
Adına baxmayaraq, model hələ tam "məhdudiyyətsiz" deyil. Baidu tədqiqatçıları gələcək versiyada model kontekstini 128K tokenə qədər genişləndirməyi planlaşdırır.
Nəticə
Gürcüstan və dünya üzrə istifadəçilər üçün Unlimited OCR uzun sənədlərin daha sürətli rəqəmsallaşdırılması, tarixi sənədlərin daha səmərəli arxivləşdirilməsi demək ola bilər.