
ABBYY تمنح تقنية OCR القديمة دورًا في مسار الذكاء الاصطناعي
أعادت ABBYY تغليف محرّك FineReader للتعرف الضوئي على الحروف في أداة FineParser المستضافة ذاتيًا، تعمل داخل حاوية Docker على المعالج دون كرت رسوميات، وتحافظ على تنسيق المستند.
FineReader في خدمة مسار الذكاء الاصطناعي
أعادت شركة ABBYY تغليف محرّك التعرف الضوئي على الحروف FineReader كأداة مستضافة ذاتيًا (self-hosted) تحوّل المستندات إلى نص مهيكل يمكن لأنظمة الذكاء الاصطناعي استخدامه. الأداة الجديدة FineParser تعمل داخل حاوية Docker على المعالج المركزي ولا تحتاج إلى كرت رسوميات، وهدفها الحفاظ على تنسيق المستند أثناء استخراج محتواه.
تستقبل FineParser صور مستندات بلغات متعددة وتحوّلها إلى نص مهيكل ومنسّق يمكن معالجته لاحقًا بنماذج الذكاء الاصطناعي التوليدي. وهذا ليس غرضها الوحيد: تقول ABBYY إن الأداة تساعد أيضًا في نقل النص المطبوع إلى نظام إدارة محتوى حديث، أو في أعمال الأرشفة، أو كمرحلة ضمن مسار إنتاجي.
استخراج «حتمي» ومخرجات توليدية
تصف ABBYY نهج FineParser بأنه ذكاء اصطناعي «حتمي»: يستخرج المحرّك النص وبنية المستند بدلًا من توليد نسخة معقولة منهما، ثم يمكن تمرير الناتج إلى نظام ذكاء اصطناعي توليدي تكون إجاباته أقل قابلية للتنبؤ بكثير.
الحفاظ على البنية يعني التعرف على الأعمدة بترتيب القراءة، والعناوين، والجداول — بما فيها الجداول بلا إطارات — بدلًا من إرجاع كومة من النص المستخرج. وتقول ABBYY إن FineParser يتعامل أيضًا مع الكتابة اليدوية وأكثر من 200 لغة. يرسل المطورون المستندات عبر واجهة REST API ويستلمون الناتج نصًا عاديًا أو JSON أو DocLang، وهو تنسيق مضغوط مخصص كمدخل للنماذج اللغوية الكبيرة.
طبقة مجانية وخادم تراخيص ومكوّنات مفتوحة
FineParser نفسه ليس مفتوح المصدر، وإن كانت ABBYY تدير مستودعًا على GitHub للأمثلة ودعم المجتمع. وللأداة المستضافة ذاتيًا طبقة مجانية تسمح بألف صفحة شهريًا لمدة سنة. تتصل الطبقات المدفوعة بخادم تراخيص للتحقق، وتقول ABBYY إن النشر دون اتصال بالكامل يتطلب خطة Enterprise.
وتقدم الشركة أيضًا NeoML، وهو إطار تعلم آلي قابل للبرمجة مفتوح المصدر ومنشور على GitHub، إلى جانب مجموعة تطوير OCR SDK للشركات التي تريد تضمين محرّك FineReader في منتجاتها.
لماذا يهم ذلك
الفكرة وراء FineParser بسيطة: قبل أن يستفيد نموذج لغوي كبير من مستند، يجب أن يقرأه أحدهم قراءة صحيحة. تراهن ABBYY على أن نهجها في التعرف الضوئي الممتد لعقود — العمل على المعالج، والحفاظ على التنسيق، وترك توليد النص لأدوات أخرى — لا يزال له مكان في مسار الذكاء الاصطناعي. أحيانًا يكون الجزء القديم هو الجزء المفيد.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.