Baidu'nun 'Sınırsız OCR'ı — Tek Geçişte Düzinelerce Sayfa, Belleği İnsan Unutkanlığı Gibi Yönetiyor
Baidu araştırmacıları, tek geçişte düzinelerce sayfayı işleyen bir OCR modeli oluşturdu. Yumuşak unutma mekanizması KV önbelleğini sabit tutuyor.
OCR'nin Darboğazı
Baidu araştırmacıları, metin uzunluğundan bağımsız olarak bellek kullanımını ve hızı sabit tutarak tek bir geçişte düzinelerce belge sayfasını işleyen bir OCR modeli oluşturdu. Yeniden tasarlanmış bir dikkat mekanizması bunu mümkün kılıyor.
Hiçbir mevcut OCR modeli tek geçişte on sayfadan fazlasını işleyemez. Darboğaz, KV önbelleğidir. Baidu araştırmacıları sorunu insan benzetmesiyle açıklıyor.
Sabit Pencere Bellek Kullanımını Sınırlıyor
Çözüm, ekibin Referans Kayan Pencere Dikkati (R-SWA) adını verdiği mekanizma aracılığıyla çalışır. Oluşturulan her token tüm referans tokenlerini görür. Ancak daha önce oluşturulan çıktı söz konusu olduğunda, yalnızca son 128 token'a bakar.
Derin Sıfır OCR Üzerine İnşa Edildi
Unlimited OCR, DeepSeek OCR modelini temel alır. Baidu mimarisi, DeepEncoder (3 milyar parametre) ve Mixture-of-Experts kod çözücüden oluşur. Model açık kaynak kodludur.
Daha İyi Puanlar
Unlimited OCR, OmniDocBench v1.5'te %93 ve v1.6'da %93.92 başarı elde ediyor. Hızı: saniyede 5.580 token — DeepSeek OCR'den %12.7 daha hızlı.
Henüz Tam Olarak Sınırsız Değil
Adına rağmen, model henüz tam olarak "sınırsız" değil. Gelecek sürümde model bağlamının 128K token'a çıkarılması planlanıyor.
Sonuç
Gürcistan ve dünya çapındaki kullanıcılar için Unlimited OCR, uzun hukuki ve tıbbi belgelerin daha hızlı dijitalleştirilmesi anlamına gelebilir.