חזרה
Ollaya: סביבת הרצה מקומית למודלי החלטה בסגנון Jev
SiTech AI Team2 წთ. საკითხავი

Ollaya: סביבת הרצה מקומית למודלי החלטה בסגנון Jev

Ollaya היא סביבת הרצה ברישיון Apache-2.0 שמריצה מודלי החלטה על החומרה שלכם: היא עונה על שאלות מובנות במעבר קדימה אחד, מחזירה הסתברויות מכויילות ומדברת ב-API של TypeSafe, כולל /v1/systemone.

Ollaya היא סביבת הרצה (runtime) להתקנה מקומית למה שמפתחיה מכנים מודלי החלטה, והיא מוצגת כחלופה מקומית למודלים המתארחים של TypeSafe Jev. במעבר קדימה אחד היא מחזירה תשובה מובנית לכל שאלה בבקשה: בחירה מתוך רשימת קריטריונים, ערך בוליאני, מספר על סקאלה או מחרוזת קצרה. הסביבה מופצת ברישיון Apache-2.0 והקוד נמצא ב-GitHub.

הדוגמה הראשונה בעמוד מריצה את ollaya run laya --preset triage על ההודעה "I was charged twice this month and want a refund" ומקבלת הסתברויות במקום טקסט: intent refund ב-1.00, is_urgent no ב-0.87 ו-refund_requested yes ב-0.88. כל אפשרות מגיעה עם הסתברות, כך שאפשר להציב סף החלטה במקום לפענח טקסט שנוצר.

השהיה וכיול

על NVIDIA RTX 4090 מודדת Ollaya כ-8-10 אלפיות שנייה מקצה לקצה לבקשת Laya בת חמש שאלות דרך HTTP API. לשם השוואה, העמוד מציין 236-276 אלפיות שנייה כחציון ההשהיה של ה-API המתארח של TypeSafe Jev, לפי מדידות של צד שלישי שכוללות את זמן הרשת; Ollaya מציינת שהתצורות שונות וזו השוואה של סדר גודל.

הטענה השנייה היא כיול: אחרי temperature fitting שגיאת הכיול הצפויה של Laya היא 0.081 לעומת 0.246 אצל Jev. מספר נמוך יותר אומר שהסתברות של 0.9 קרובה יותר לשיעור פגיעה אמיתי של 90%.

תאימות ל-API של TypeSafe

Ollaya מגישה את /v1/systemone ואת /v1/models במבני הבקשה והתשובה של TypeSafe, ולפי העמוד ה-SDK הרשמי של TypeSafe ל-Python בגרסה 0.7.1 עובד מול שרת מקומי ללא שינוי. בדוגמת החשבונית התשובה מחזירה intent invoice בביטחון 0.9547 ובהסתברויות 0.9698, 0.0172 ו-0.013.

משקולות פתוחות ופלטפורמות

המשקולות נמשכות ממאגרי Hugging Face של המחברים, מוצמדות ל-commit מסוים ונבדקות ב-sha256; Ollaya אינה מארחת אותן בעצמה. להתחלה זמינה Laya מבית Convai Innovations: מודל אנגלי, מודל ל-100+ שפות וגרסה שעברה כיוונון להחלטות מובנות. השרת רץ על ONNX Runtime, מאזין כברירת מחדל רק לממשק המקומי ומשתמש ב-CPU או ב-GPU של NVIDIA.

קיימים בילדים ל-macOS, ל-Windows 10 ו-11, ל-Linux, ל-WSL 2 ול-Docker על amd64 ו-arm64. כל המודלים רצים על CPU; GPU של NVIDIA ב-Linux, ב-WSL 2 או ב-Docker, עם דרייבר R580 ומעלה ו-CUDA 13, מקצר בקשה לאלפיות שנייה.

למה זה חשוב

מודלי החלטה הם קטגוריה של מודלים קטנים למשימות סיווג ודירוג מובנות שמודלי צ'אט מטפלים בהן לאט ובעלות לכל טוקן: מיון פניות, כוונה, סנטימנט, ניתוב ודגלי מודרציה. הרצה מקומית משאירה הודעות רגישות במכונה שממילא מחזיקה בהן, מבטלת מונה ומחזירה הסתברות במקום משפט.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.