Geri qayıt
Ollaya Jev tipli decision modellərini yerli kompüterdə işlədir
SiTech AI Team2 წთ. საკითხავი

Ollaya Jev tipli decision modellərini yerli kompüterdə işlədir

Ollaya Apache-2.0 lisenziyalı yerli runtime-dır: decision modellərini öz aparatınızda işlədir, yazılı suallara bir forward pass-da kalibrlənmiş ehtimallarla cavab verir və TypeSafe-in /v1/systemone API formatında danışır.

Ollaya decision modelləri üçün yerli quraşdırılan runtime-dır və hostinqdə çalışan TypeSafe Jev modellərinə yerli alternativ kimi təqdim olunur. Bir forward pass ilə sorğudakı hər suala tipləşdirilmiş cavab qaytarır: meyarlar siyahısından seçim, bəli və ya xeyr, şkalada rəqəm və ya qısa mətn. Runtime Apache-2.0 lisenziyası ilə yayılır, kod GitHub-dadır.

Saytdakı ilk nümunə ollaya run laya --preset triage əmrini "I was charged twice this month and want a refund" mesajı üzərində işlədir və düz mətn yerinə ehtimallar alır: intent refund 1,00, is_urgent no 0,87 və refund_requested yes 0,88. Hər variant ehtimalla gəldiyi üçün çağıran tərəf generasiya olunmuş mətni təhlil etmək əvəzinə qərara hədd qoya bilər.

Gecikmə və kalibrləmə

NVIDIA RTX 4090-da Ollaya beş suallıq Laya sorğusu üçün HTTP API vasitəsilə başdan-başa təxminən 8-10 ms ölçür. Müqayisə üçün səhifə şəbəkə vaxtını da əhatə edən üçüncü tərəf benchmarklarına əsaslanaraq hostinqdə çalışan TypeSafe Jev API-nin median gecikməsi kimi 236-276 ms göstərir; Ollaya qurğuların fərqli olduğunu və bunun sıra böyüklüyü müqayisəsi olduğunu qeyd edir.

İkinci iddia kalibrləmədir: temperature fitting-dən sonra Laya-nın gözlənilən kalibrləmə xətası 0,081, Jev üçün isə 0,246-dır. Aşağı göstərici 0,9 ehtimalının real 90% dəqiqliyə daha yaxın olduğunu bildirir.

TypeSafe API-si ilə uyğunluq

Ollaya /v1/systemone və /v1/models endpointlərini TypeSafe-in sorğu və cavab formatı ilə təqdim edir və sayta görə TypeSafe-in rəsmi Python SDK 0.7.1 versiyası yerli serverlə dəyişiklik olmadan işləyir. Hesab-faktura nümunəsində cavab intent invoice dəyərini 0,9547 inamla və 0,9698, 0,0172, 0,013 ehtimalları ilə qaytarır.

Açıq çəkilər və platformalar

Çəkilər müəlliflərin Hugging Face repozitoriyalarından endirilir, konkret commit-ə bağlanır və sha256 ilə yoxlanılır; Ollaya onları özü hostinq etmir. Başlamaq üçün Convai Innovations-ın Laya ailəsi var: ingilis dili modeli, 100+ dil modeli və tipləşdirilmiş qərarlar üçün incə tənzimlənmiş variant. Server ONNX Runtime üzərində işləyir, standart olaraq yalnız yerli interfeysi dinləyir və CPU və ya NVIDIA GPU istifadə edir.

Qurğular macOS, Windows 10 və 11, Linux, WSL 2 və amd64 ilə arm64 üçün Docker üçün mövcuddur. Bütün modellər CPU-da işləyir; Linux, WSL 2 və ya Docker-da R580 və daha yeni sürücü ilə CUDA 13 dəstəkli NVIDIA GPU sorğunu millisaniyələrə endirir.

Niyə vacibdir

Decision modelləri çat API-lərinin yavaş və token başına ödənişlə yerinə yetirdiyi tipləşdirilmiş təsnifat və qiymətləndirmə işləri üçün kiçik modellər kateqoriyasıdır: müraciət triajı, niyyət, emosiya, marşrutlaşdırma, moderasiya bayraqları. Yerli işlətmə həssas mesajları artıq saxlandıqları maşında saxlayır, sayğacı ləğv edir və cümlə yerinə ehtimal qaytarır.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.