უკან დაბრუნება
transcribe.cpp — ggml-ზე დაფუძნებული ამოცნობის ბიბლიოთეკა 60-ზე მეტი მოდელით
SiTech AI Team2 წთ. საკითხავი

transcribe.cpp — ggml-ზე დაფუძნებული ამოცნობის ბიბლიოთეკა 60-ზე მეტი მოდელით

Handy-ის ავტორმა გამოაქვეყნა transcribe.cpp — ggml-ზე დაფუძნებული ტრანსკრიფციის ბიბლიოთეკა, რომელიც მეტყველების ამოცნობის 16 ოჯახსა და 60-ზე მეტ მოდელს მხარს უჭერს.

Handy-ის, ღია კოდის დიქტაფონის აპლიკაციის, ავტორმა გამოაქვეყნა transcribe.cpp — ტრანსკრიფციის ბიბლიოთეკა, რომელიც ggml მანქანური სწავლების ბიბლიოთეკაზეა აგებული. პროექტის ვერსიაა 0.1.0 და, როგორც ავტორი ამბობს, ის მეტყველების ამოცნობის ყველა თანამედროვე მოდელს მხარს უჭერს. Hugging Face-ზე handy-computer-ის ორგანიზაციაში გამოქვეყნებული ყველა მოდელი რიცხობრივად და WER-ის ტესტებით შემოწმებულია და საცნობარო იმპლემენტაციას ემთხვევა.

რატომ კიდევ ერთი ASR-სტეკი

პროექტი ჯვარედინი პლატფორმის მეტყველების-ტექსტად გადაქცევის აპლიკაციის გავრცელების სირთულეებიდან დაიბადა. ავტორის თქმით, მოწყობილობაზე მუშაობისთვის პრაქტიკულად მხოლოდ whisper.cpp და ONNX არსებობს, Apple-ის მოწყობილობებზე კი მესამე გზა — MLX, რაც რამდენიმე ძრავის მხარდაჭერასა და მოდელების თითოეულ მათგანზე პორტირებას მოითხოვს. ONNX, მისივე შენიშვნით, პერფორმანსის დიდ ნაწილს კარგავს, რადგან პროცესორზე მუშაობს. სხვა ბიბლიოთეკებს, რომლებიც მოდელების ფართო მხარდაჭერას აცხადებენ, ხშირად უცნობი ავტორები და გაურკვეველი ტესტირება აქვთ, რაც კითხვებს ტოვებს მათ გრძელვადიან მხარდაჭერასა და ბენჩმარკებზე.

რას გვაძლევს ბიბლიოთეკა

transcribe.cpp მეტყველების ამოცნობის 16 ოჯახს და 60-ზე მეტ მოდელს მხარს უჭერს, დანარჩენები კი მოგვიანებით დაემატება. აჩქარება ხელმისაწვდომია Vulkan-ის, Metal-ის, CUDA-სა და TinyBLAS-ის მეშვეობით, ხოლო თითოეული მოდელისთვის გამოქვეყნებულია ბენჩმარკები Ryzen 4750U-ზე (CPU და Vulkan, Fedora) და M4 Max-ზე. მხარდაჭერილია როგორც ნაკადური, ისე პაკეტური ტრანსკრიფცია. ბიბლიოთეკა whisper.cpp-ის პრაქტიკულად პირდაპირ ჩამნაცვლებლად აღიწერება: მას შეუძლია პოპულარული .bin მოდელების გაშვება და whisper-ის იმპლემენტაცია დაახლოებით იგივე პერფორმანსს ინარჩუნებს. ბაინდინგები მხარდაჭერილია Python-ის, JavaScript/TypeScript-ის, Rust-ისა და Objective-C/Swift-ისთვის.

ლოკალური მეტყველების ამოცნობა ღრუბლის გარეშე

ავტორის მიზანია ლოკალურად მომუშავე ამოცნობის გამარტივება. მისივე თქმით, იაფფასიან ჩიპ Rockchip RK3566-ს transcribe.cpp-ის მეშვეობით მოდელების რეალურ დროზე სწრაფად გაშვება შეუძლია, ხოლო თანამედროვე მოდელებით ტრანსკრიფცია რამდენიმე ვატს მოიხმარს — ამიტომ ხმის ღრუბლოვან სერვისზე გაგზავნა სავალდებულო არ არის. პროექტს მხარი დაუჭირეს Mozilla AI-მ BiR-პროგრამით, ggml-მა, Modal-მა, Blacksmith-მა და Hugging Face-მა. ძრავი AI-ის დახმარებით დაიწერა, თუმცა თავად განცხადების ტექსტი, ავტორის თქმით, არა.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.