Baidu "Unlimited OCR" — عشرات الصفحات في تمريرة واحدة، معاملة الذاكرة مثل النسيان البشري
باحثو Baidu بنوا نموذج OCR يعالج عشرات الصفحات في تمريرة واحدة. آلية النسيان الناعم تحافظ على ذاكرة التخزين المؤقت KV ثابتة، مما يحسن السرعة بشكل كبير وكفاءة الذاكرة.
مقدمة: عنق الزجاجة في OCR
بني باحثو Baidu نموذج OCR يمكنه معالجة عشرات الصفحات في تمريرة واحدة، مع إبقاء استخدام الذاكرة والسرعة ثابتين بغض النظر عن طول النص. آلية انتباه مُعاد تصميمها تجعل هذا ممكنًا.
لا يتعامل أي نموذج OCR حالي مع أكثر من عشر صفحات في تمريرة واحدة، كما يكتب باحثو Baidu في تقريرهم. العنق الزجاجي هو ذاكرة التخزين المؤقت KV، وهي مخزن مؤقت حيث يخزن نموذج اللغة جميع الرموز المميزة التي تمت معالجتها مسبقًا أثناء التوليد.
نافذة ثابتة تحد من استخدام الذاكرة
تعمل التقنية من خلال ما تسميه الفريق "انتباه النافذة المنزلقة المرجعية" (R-SWA). كل رمز مولَّد يرى جميع الرموز المرجعية، الرموز المرئية والصورة والمطالبة. ولكن عندما يتعلق الأمر بالمخرجات المولدة سابقًا، فإنه ينظر فقط إلى آخر 128 رمزًا. هذا يبقي ذاكرة التخزين المؤقت KV ثابتة طوال العملية بأكملها.
مبنية على DeepSeek OCR
تبني Unlimited OCR على نموذج DeepSeek OCR كقاعدة لها. معمارية بايدو تتكون من DeepEncoder (3 مليار معامل) مع Mixture-of-Experts decoder (500 مليون معامل نشط لكل رمز). النموذج مفتوح المصدر ومتوفر على GitHub و Hugging Face.
نتائج أفضل رغم الانتباه المحدود
على الرغم من قيودها، تقدم Unlimited OCR نتائج تنافسية. تحقق 93% على OmniDocBench v1.5 و93.92% على v1.6. سرعتها: 5,580 رمزًا في الثانية — أسرع بنسبة 12.7% من DeepSeek OCR.
ليست غير محدودة حقًا بعد
كما يشير اسمها، النموذج ليس "غير محدود" حقًا بعد. يخطط باحثو Baidu لتمديد سياق النموذج إلى 128K رمز في إصدار مستقبلي وتجميع رموز التحميل المسبق.
الخلاصة: التطبيقات العملية والتأثير
بالنسبة للمستخدمين في جورجيا والعالم، قد يعني Unlimited OCR رقمنة أسرع للوثائق الطويلة، وأرشفة أكثر كفاءة للمستندات التاريخية المنشورة باللغة الجورجية، وتحسين كبير في معالجة المستندات التجارية.