«Unlimited OCR» від Baidu — десятки сторінок за один прохід, пам'ять як людське забування
Дослідники Baidu створили модель OCR, яка обробляє десятки сторінок за один прохід. Механізм м'якого забування підтримує KV-кеш постійним.
Вузьке місце OCR
Дослідники Baidu створили модель OCR, яка обробляє десятки сторінок документів за один прохід, підтримуючи використання пам'яті та швидкість постійними незалежно від довжини тексту. Перероблений механізм уваги робить це можливим.
Фіксоване вікно обмежує використання пам'яті
Рішення працює через механізм, який команда називає Reference Sliding Window Attention (R-SWA). Кожен згенерований токен бачить всі еталонні токени, але стосовно раніше згенерованого виходу він дивиться лише на останні 128 токенів.
Побудовано на DeepSeek OCR
Unlimited OCR базується на моделі DeepSeek OCR. Архітектура Baidu складається з DeepEncoder (3 мільярди параметрів) з декодером Mixture-of-Experts. Модель має відкритий код.
Кращі результати
Unlimited OCR досягає 93% на OmniDocBench v1.5 та 93.92% на v1.6. Швидкість: 5,580 токенів за секунду — на 12.7% швидше за DeepSeek OCR.
Ще не справді безмежний
Модель ще не є справді «безмежною». Дослідники планують розширити контекст моделі до 128K токенів у майбутній версії.
Висновок
Для користувачів у Грузії та всьому світі Unlimited OCR може означати швидшу оцифровку довгих юридичних та медичних документів, ефективніше архівування історичних документів грузинською мовою.