უკან დაბრუნება
Ollaya-მ decision models-ის ლოკალური runtime წარადგინა
SiTech AI Team2 წთ. საკითხავი

Ollaya-მ decision models-ის ლოკალური runtime წარადგინა

Ollaya არის Apache-2.0 ლიცენზიის runtime, რომელიც decision models-ს საკუთარ აპარატურაზე უშვებს: ტიპიზებულ კითხვებზე პასუხი ერთი forward pass-ით, კალიბრირებული ალბათობებით მოდის, API კი TypeSafe-ის /v1/systemone ფორმატს იმეორებს.

Ollaya ლოკალურად დასაყენებელი runtime-ია decision models-ისთვის, რომელსაც ავტორები ჰოსტინგზე გაშვებული TypeSafe Jev-ის ალტერნატივად აწყობენ. ერთი forward pass-ით ის მოთხოვნის ყოველ კითხვაზე ტიპიზებულ პასუხს აბრუნებს: არჩევანი კრიტერიუმების სიიდან, დიახ ან არა, რიცხვი სკალაზე ან მოკლე ტექსტი. Runtime Apache-2.0 ლიცენზიით ვრცელდება, კოდი GitHub-ზეა.

საიტის პირველი მაგალითი ბრძანებას „ollaya run laya --preset triage“ შეტყობინებაზე „I was charged twice this month and want a refund“ უშვებს და ტექსტის ნაცვლად ალბათობებს იღებს: intent = refund (1,00), is_urgent = no (0,87) და refund_requested = yes (0,88). ყოველ ვარიანტს ალბათობა ახლავს, ამიტომ გამომძახებელს გადაწყვეტილებაზე ზღვრის დაწესება შეუძლია.

სიჩქარე და კალიბრაცია

NVIDIA RTX 4090-ზე Ollaya ხუთკითხვიანი Laya-ს მოთხოვნისთვის HTTP API-ის გავლით დაახლოებით 8-10 მილიწამს ზომავს, შედარებისთვის საიტი ჰოსტინგზე გაშვებული TypeSafe Jev-ის API-ის მედიანურ დაყოვნებად 236-276 მწმ-ს ასახელებს, მესამე მხარის ბენჩმარკებით, ქსელური დროის ჩათვლით. Ollaya აღნიშნავს, რომ გარემოებები განსხვავებულია და ეს სიდიდის რიგის შედარებაა.

კალიბრაცია მეორე მთავარი მაჩვენებელია: temperature fitting-ის შემდეგ Laya-ს კალიბრაციის მოსალოდნელი შეცდომა 0,081-ია, Jev-ის კი 0,246. დაბალი მაჩვენებელი ნიშნავს, რომ 0,9-ის ალბათობა რეალურ 90%-იან სიზუსტეს უფრო ახლოსაა.

TypeSafe-ის API-სთან თავსებადობა

Ollaya ორ ენდპოინტს ემსახურება, /v1/systemone-სა და /v1/models-ს, TypeSafe-ის მოთხოვნისა და პასუხის ფორმატით. საიტის თანახმად, TypeSafe-ის ოფიციალური Python SDK 0.7.1 ლოკალურ სერვერთან ცვლილებების გარეშე მუშაობს. ინვოისის მაგალითში პასუხი intent = invoice მნიშვნელობას 0,9547 სარწმუნოებით აბრუნებს, ალბათობებით 0,9698, 0,0172 და 0,013.

ღია წონები და პლატფორმები

წონები ავტორთა Hugging Face-ის რეპოზიტორიებიდან ჩამოდის, commit-ზე მიმაგრებული და sha256-ით შემოწმებული; Ollaya მათ თავად არ ჰოსტავს. თავიდან ხელმისაწვდომია Convai Innovations-ის Laya: ინგლისური მოდელი, 100+ ენის მოდელი და ტიპიზებული გადაწყვეტილებებისთვის დახვეწილი ვარიანტი. სერვერი ONNX Runtime-ზე მუშაობს, ნაგულისხმევად მხოლოდ ლოკალურ ინტერფეისზე ისმენს და CPU-ს ან NVIDIA-ს GPU-ს იყენებს.

ინსტალაცია არსებობს macOS-ის, Windows 10-ისა და 11-ის, Linux-ის, WSL 2-ისა და Docker-ისთვის. ყველა მოდელი CPU-ზე მუშაობს; NVIDIA-ს GPU Linux-ზე, WSL 2-ში ან Docker-ში, R580 ან უფრო ახალი დრაივერითა და CUDA 13-ით, მოთხოვნას მილიწამებამდე ამცირებს. Apple-ის, AMD-ისა და Intel-ის გრაფიკაზე მოდელები CPU-ზე რჩება.

რატომ არის მნიშვნელოვანი

Decision models პატარა მოდელების კატეგორიაა ტიპიზებული კლასიფიკაციისა და შეფასების ამოცანებისთვის, რომლებსაც chat API-ები ნელა და ტოკენზე ფასით ამუშავებენ. ლოკალურად გაშვება მგრძნობიარე შეტყობინებებს იმავე მანქანაზე ტოვებს, მრიცხველს აუქმებს და წინადადების ნაცვლად ალბათობას აბრუნებს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.