
Desert Ant Labs: მოწყობილობაზე მომუშავე 18 სპეციალიზებული AI მოდელი გამოვიდა
ევროპულმა ლაბორატორიამ Desert Ant Labs ერთი SDK-ით წარადგინა თვრამეტი ლოკალური მოდელი აუდიოს, ხედვისა და ტექსტისთვის; ისინი უფასოა 100 000 თვიურ აქტიურ მოწყობილობამდე.
ევროპულმა AI ლაბორატორიამ Desert Ant Labs 2026 წლის 8 სექტემბერს გამოუშვა თვრამეტი სპეციალიზებული, მოწყობილობაზე მომუშავე მოდელი აუდიოს, ხედვისა და ტექსტისთვის, ერთი SDK Swift-, Kotlin- და JavaScript-ისთვის და მოდელი, რომლის ლოკალური ინფერენსი უფასოა.
ერთი მოდელი ერთ ამოცანაზე
თორმეტი მოდელი სტაბილურია, ექვსი — ბეტა. თითოეული მილიწამებში პასუხობს და მუშაობა არაფერი ღირს, აცხადებს კომპანია. Voz iPhone-ზე ათი წუთის აუდიოს ორ წამში ტექსტად გადააქცევს — Whisper-ზე 4.7-ჯერ სწრაფად — ყოველი სიტყვის დაწყებისა და დასრულების დროით. Clear 9MB მოდელია, რომელიც ხუთწუთიან ჩანაწერს ერთ წამში სტუდიური ხარისხის აუდიოდ აქცევს. Redact სახელებს, მისამართებსა და ბარათის ნომრებს 27 ენაზე რეალურ დროში ნიღბავს, რომ სერვერამდე ვერ მიაღწიონ. Tongue სამი სიტყვიდან 84 ენას ამოიცნობს 2MB მოდელით — 0.933 ქულა 293MB დეტექტორის 0.887-ის წინააღმდეგ, ხოლო Redact პირადი მონაცემების 88.8%-ს იჭერს 2.3GB GLiNER-PII-ის 91.1%-ის ფონზე.
რატომ მოწყობილობაზე
ლაბორატორია ლოკალურ ინფერენსს ევროპის სუვერენულ ნაგულისხმევად წარმოაჩენს: მონაცემები კლიენტის ხელიდან არ გადის, ფუნქცია სხვის ღრუბელზე არ არის დამოკიდებული და ის, რაც არასოდეს აიტვირთა, ვერ მოითხოვება. ეკონომიკა უკვე გადახდილ გამოთვლით ძალაზეა დაფუძნებული: ინდუსტრია წელს მონაცემთა ცენტრებზე დაახლოებით 450 მილიარდ დოლარს დახარჯავს, მაშინ როცა მსოფლიოში მილიარდზე მეტი ტელეფონი, პლანშეტი და ლეპტოპი იყიდება სულ უფრო ძლიერი ჩიპებით — ხალხის ხელში მეტი გამოთვლითი ძალაა, ვიდრე დედამიწის ყველა AI მონაცემთა ცენტრში. Desert Ant ასევე იშვებს NVIDIA-ს მკვლევრებს, რომლებმაც სამი აგენტური სისტემის ანალიზით შეაფასეს, რომ მათი დიდ მოდელზე გამოძახებების 40–70% პატარა, სპეციალიზებულ მოდელზე შეიძლება გადავიდეს. ყველა მოდელი უფასოა 100 000 თვიურ აქტიურ მოწყობილობამდე.
ვიდეო აპიდან საკუთარ მოდელებამდე
გუნდმა ხუთი წელი Detail-ის ვიდეო აპზე იმუშავა, მაგრამ Auto Edit-ის კლიპებისა და პოდკასტის ხმის გაუმჯობესებისთვის ღრუბლოვან API-ებს მიმართა, რადგან ინფრასტრუქტურის ხარჯები იზრდებოდა. მოდელები თავად გაწვრთნეს: Clear-მა Dolby ჩაანაცვლა, Voz-მა მოწყობილობაზე ტრანსკრიფცია ხუთჯერ დააჩქარა. Clips — 284MB მოდელი, რომელიც ათწუთიან ვიდეოს ხუთ წამში ათეულ კლიპად აქცევს — Claude Sonnet-ის ნაცვლად დადგა: 10-ჯერ სწრაფად და 470-ჯერ ნაკლები ენერგიით, იგივე ხარისხით, კომპანიის მტკიცებით. Detail 6, რომელიც iOS 27-თან ერთად გამოვა, ყველა ღრუბლოვან API-ს საკუთარი მოდელებით ჩაანაცვლებს, მთლიანად მოწყობილობაზე.
ჯერ „პატარა ტვინები“
Desert Ant პირველ ასეულ მოდელს „ცერებელუმს“ — პატარა ტვინს, რომელიც მუდმივ ფონურ სამუშაოს ასრულებს — ადარებს, ხოლო შემდეგ კორტექსის ფენას, რომელიც წყვეტს, რომელი მოდელი უპასუხოს: ჯერ პატარა ლოკალური, საჭიროებისამებრ უფრო დიდი და ღრუბელი მხოლოდ მაშინ, როცა სამუშაო მოწყობილობიდან უნდა გავიდეს. მოდელები მოდის შერჩეული ნაგულისხმევითა და მისი შეცვლის საშუალებებით; runtime მოდელთან ერთად ოპტიმიზდება — Clear და Voz iPhone-ის Neural Engine-ზე მუშაობს, ბრაუზერში კი Clear-ის იგივე წონები WebAssembly-ით. SDK GitHub-ზეა, დოკუმენტაციით, Mac-ის CLI-ითა და Hugging Face-ის დემოებით.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.