חזרה →
SiTech Team⏱️ 1 წთ. საკითხავი

Baidu Unlimited OCR — עשרות עמודים במעבר אחד, טיפול בזיכרון כמו שכחה אנושית

Baidu Unlimited OCR — עשרות עמודים במעבר אחד, טיפול בזיכרון כמו שכחה אנושית

חוקרי Baidu בנו מודל OCR שמעבד עשרות עמודים במעבר אחד. מנגנון שכחה רכה שומר על מטמון ה-KV קבוע.

צוואר הבקבוק של OCR

חוקרי Baidu בנו מודל OCR שמעבד עשרות עמודי מסמכים במעבר ניתוק בודד, תוך שמירה על שימוש בזיכרון ומהירות קבועים ללא קשר לאורך הטקסט. מנגנון קשב שעוצב מחדש מאפשר זאת.

אף מודל OCR קיים לא מטפל ביותר מעשרה עמודים במעבר בודד. צוואר הבקבוק הוא מטמון KV, מאגר זמני שבו מודל שפה מאחסן את כל האסימונים שעובדו בעבר במהלך יצירה.

חלון קבוע מגביל את השימוש בזיכרון

הפתרון פועל באמצעות מה שהצוות מכנה "קשב חלון החלקה ייחוס" (R-SWA). כל אסימון שנוצר רואה את כל אסימוני הייחוס. אבל לגבי פלט שיוצר בעבר, הוא מסתכל רק על 128 האסימונים האחרונים.

בנוי על DeepSeek OCR

Unlimited OCR בנוי על DeepSeek OCR כבסיסו. הארכיטקטורה מורכבת מ-DeepEncoder (3 מיליארד פרמטרים) עם מפענח Mixture-of-Experts. המודל הוא קוד פתוח וזמין ב-GitHub וב-Hugging Face.

ציונים טובים יותר למרות קשב מוגבל

Unlimited OCR משיג 93% ב-OmniDocBench v1.5 ו-93.92% ב-v1.6. מהירותו: 5,580 אסימונים בשנייה — 12.7% מהר יותר מ-DeepSeek OCR.

עדיין לא מוגבל באמת

המודל עדיין לא באמת "בלתי מוגבל". החוקרים מתכננים להרחיב את ההקשר של המודל ל-128K אסימונים בגרסה עתידית.

סיכום: שימושים מעשיים והשפעה

למשתמשים בגאורגיה וברחבי העולם, Unlimited OCR יכול להאיץ דיגיטציה של מסמכים משפטיים ורפואיים ארוכים ולארכוב יעיל יותר של מסמכים היסטוריים בשפה הגאורגית.