Geri Dön
SiTech Team⏱️ 1 წთ. საკითხავი

Baidu'nun 'Sınırsız OCR'ı — Tek Geçişte Düzinelerce Sayfa, Belleği İnsan Unutkanlığı Gibi Yönetiyor

Baidu'nun 'Sınırsız OCR'ı — Tek Geçişte Düzinelerce Sayfa, Belleği İnsan Unutkanlığı Gibi Yönetiyor

Baidu araştırmacıları, tek geçişte düzinelerce sayfayı işleyen bir OCR modeli oluşturdu. Yumuşak unutma mekanizması KV önbelleğini sabit tutuyor.

OCR'nin Darboğazı

Baidu araştırmacıları, metin uzunluğundan bağımsız olarak bellek kullanımını ve hızı sabit tutarak tek bir geçişte düzinelerce belge sayfasını işleyen bir OCR modeli oluşturdu. Yeniden tasarlanmış bir dikkat mekanizması bunu mümkün kılıyor.

Hiçbir mevcut OCR modeli tek geçişte on sayfadan fazlasını işleyemez. Darboğaz, KV önbelleğidir. Baidu araştırmacıları sorunu insan benzetmesiyle açıklıyor.

Sabit Pencere Bellek Kullanımını Sınırlıyor

Çözüm, ekibin Referans Kayan Pencere Dikkati (R-SWA) adını verdiği mekanizma aracılığıyla çalışır. Oluşturulan her token tüm referans tokenlerini görür. Ancak daha önce oluşturulan çıktı söz konusu olduğunda, yalnızca son 128 token'a bakar.

Derin Sıfır OCR Üzerine İnşa Edildi

Unlimited OCR, DeepSeek OCR modelini temel alır. Baidu mimarisi, DeepEncoder (3 milyar parametre) ve Mixture-of-Experts kod çözücüden oluşur. Model açık kaynak kodludur.

Daha İyi Puanlar

Unlimited OCR, OmniDocBench v1.5'te %93 ve v1.6'da %93.92 başarı elde ediyor. Hızı: saniyede 5.580 token — DeepSeek OCR'den %12.7 daha hızlı.

Henüz Tam Olarak Sınırsız Değil

Adına rağmen, model henüz tam olarak "sınırsız" değil. Gelecek sürümde model bağlamının 128K token'a çıkarılması planlanıyor.

Sonuç

Gürcistan ve dünya çapındaki kullanıcılar için Unlimited OCR, uzun hukuki ve tıbbi belgelerin daha hızlı dijitalleştirilmesi anlamına gelebilir.