Geri Dön
Ollaya, Jev tarzı decision modellerini yerelde milisaniyelerde çalıştırıyor
SiTech AI Team2 წთ. საკითხავი

Ollaya, Jev tarzı decision modellerini yerelde milisaniyelerde çalıştırıyor

Ollaya, Apache-2.0 lisanslı bir yerel çalışma ortamı: decision modellerini kendi donanımınızda çalıştırıyor, yazılı sorulara tek geçişte kalibre edilmiş olasılıklar döndürüyor ve TypeSafe'in /v1/systemone API biçimini konuşuyor.

Ollaya, geliştiricilerin decision modelleri dediği modeller için yerel olarak kurulabilen bir çalışma ortamı ve barındırılan TypeSafe Jev modellerine yerel bir alternatif olarak sunuluyor. Tek bir forward pass ile istekteki her soruya tipli bir yanıt döndürüyor: kriter listesinden bir seçim, doğru ya da yanlış, ölçekte bir sayı veya kısa bir metin. Çalışma ortamı Apache-2.0 lisansıyla dağıtılıyor, kod GitHub'da.

Sitedeki ilk örnek ollaya run laya --preset triage komutunu "I was charged twice this month and want a refund" mesajı üzerinde çalıştırıyor ve düz metin yerine olasılıklar alıyor: intent refund 1,00, is_urgent no 0,87 ve refund_requested yes 0,88. Her seçenek bir olasılıkla geldiği için çağıran taraf üretilmiş metni ayrıştırmak yerine karara eşik koyabiliyor.

Gecikme ve kalibrasyon

NVIDIA RTX 4090 üzerinde Ollaya, beş soruluk bir Laya isteği için HTTP API üzerinden uçtan uca yaklaşık 8-10 ms ölçüyor. Karşılaştırma için sayfa, ağ süresini de içeren üçüncü taraf kıyaslamalarına dayanarak barındırılan TypeSafe Jev API'sinin medyan gecikmesi olarak 236-276 ms veriyor; Ollaya kurulumların farklı olduğunu ve bunun bir büyüklük sırası karşılaştırması olduğunu belirtiyor.

İkinci iddia kalibrasyon: temperature fitting sonrası Laya'nın beklenen kalibrasyon hatası 0,081, Jev'de ise 0,246. Daha düşük değer, 0,9 olasılığın gerçekte yüzde 90 isabete daha yakın olduğu anlamına geliyor.

TypeSafe API'siyle uyumlu

Ollaya, /v1/systemone ve /v1/models uç noktalarını TypeSafe'in istek ve yanıt biçimleriyle sunuyor ve siteye göre resmi TypeSafe Python SDK'sı 0.7.1 sürümüyle yerel bir sunucuya karşı değişiklik yapılmadan çalışıyor. Fatura örneğinde yanıt intent invoice değerini 0,9547 güvenle ve 0,9698, 0,0172, 0,013 olasılıklarıyla döndürüyor.

Açık ağırlıklar ve platformlar

Ağırlıklar yazarlarının Hugging Face depolarından indiriliyor, belirli bir commit'e sabitleniyor ve sha256 ile doğrulanıyor; Ollaya bunları kendisi barındırmıyor. Başlangıç için Convai Innovations'ın Laya ailesi var: İngilizce model, 100+ dil modeli ve tipli kararlar için ince ayarlı bir sürüm. Sunucu ONNX Runtime üzerinde çalışıyor, varsayılan olarak yalnızca yerel arayüzü dinliyor ve CPU ya da NVIDIA GPU kullanıyor.

Sürümler macOS, Windows 10 ve 11, Linux, WSL 2 ile amd64 ve arm64 için Docker olarak sunuluyor. Tüm modeller CPU'da çalışıyor; Linux, WSL 2 veya Docker'da R580 ve üzeri sürücü ile CUDA 13 destekli bir NVIDIA GPU isteği milisaniyelere indiriyor.

Neden önemli

Decision modelleri, sohbet API'lerinin yavaş ve token başına ücretli işlediği tipli sınıflandırma ve puanlama işleri için küçük bir model kategorisi: talep triyajı, niyet, duygu durumu, yönlendirme, moderasyon işaretleri. Yerelde çalıştırmak hassas mesajları zaten bulundukları makinede bırakıyor, sayaç ücretini kaldırıyor ve cümle yerine olasılık döndürüyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.