Назад
transcribe.cpp: бібліотека розпізнавання мовлення на базі ggml із понад 60 моделями
SiTech AI Team2 წთ. საკითხავი

transcribe.cpp: бібліотека розпізнавання мовлення на базі ggml із понад 60 моделями

Автор застосунку Handy опублікував transcribe.cpp — бібліотеку транскрипції на базі ggml, яка підтримує 16 родин моделей розпізнавання мовлення та прискорене виконання на Vulkan, Metal і CUDA.

Автор Handy, застосунку для диктування з відкритим кодом, опублікував transcribe.cpp — бібліотеку транскрипції, побудовану на бібліотеці машинного навчання ggml. Проєкт випущено у версії 0.1.0, і, за словами автора, він підтримує всі сучасні моделі транскрипції. Кожна модель, опублікована в організації handy-computer на Hugging Face, перевірена чисельно та протестована за метрикою WER на відповідність референсній реалізації.

Навіщо ще один ASR-стек

Проєкт виріс із труднощів поширення кросплатформного застосунку для перетворення мовлення в текст. За словами автора, для розпізнавання мовлення безпосередньо на пристрої практично існують лише whisper.cpp і ONNX, а на пристроях Apple додається третій шлях — MLX, що змушує підтримувати кілька рушіїв і портувати моделі на кожен із них. ONNX, зазначає він, залишає значну частину продуктивності невикористаною, оскільки працює на процесорі. Інші бібліотеки, які заявляють про широку підтримку моделей, часто мають невідомих авторів і незрозуміле тестування, що викликає питання щодо довгострокової підтримки, біндінгів і бенчмарків.

Що дає бібліотека

transcribe.cpp підтримує 16 родин ASR — понад 60 моделей — і планує додати решту. Прискорення доступне через Vulkan, Metal, CUDA і TinyBLAS, а для кожної підтримуваної моделі опубліковано бенчмарки на Ryzen 4750U (CPU та Vulkan, Fedora) і на M4 Max. Підтримуються як потокова, так і пакетна транскрипція. Бібліотеку описують як практично пряму заміну whisper.cpp: вона вміє запускати популярні файли моделей .bin, а її реалізація whisper працює приблизно на тому самому рівні. Біндінги підтримуються для Python, JavaScript і TypeScript, Rust, а також Objective-C і Swift.

Локальне розпізнавання мовлення без хмари

Мета автора — зробити локальне розпізнавання простішим. Він зазначає, що дешевий вбудований чип Rockchip RK3566 здатен запускати моделі через transcribe.cpp швидше за реальний час, а транскрипція сучасними моделями споживає лише кілька ватів, тож надсилати голос у хмарний сервіс не обов'язково. Роботу підтримали Mozilla AI через програму BiR, ggml, Modal, Blacksmith і Hugging Face. Рушій написано із залученням ШІ, додає автор, хоча сам текст його анонсу — ні.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.