
Qwen מקומי אינו Opus זול יותר — זה כלי אחר, מדווח מייסד OpenFaaS
אלכס אליס, מייסד OpenFaaS, מסביר מה מודלי Qwen מקומיים נתנו באמת לצוות שלו: פרטיות וחיסכון במשימות צרות, אך גם לולאות אינסופיות בעבודה ארוכת טווח והזיות בסקירת קוד.
אלכס אליס, המייסד מאחורי OpenFaaS, SlicerVM, Actuated ו-Inlets, פרסם דוח מפורט על הפעלת מודלים לשוניים מקומיים בתוך עסק תוכנה קטן. המסקנה שלו סותרת טענה פופולרית ברשתות: Qwen מקומי אינו Claude Opus זול יותר, אלא כלי אחר שצריך לכוון אותו למשימות המתאימות.
כמה עלה החומרה
הניסיון הראשון היה כרטיס RTX 3090 בודד ב-2023, שהתברר כבלתי נוח עד כדי כך שהניסוי נזנח. Qwen 3.5 היה הדור הראשון שהניב תוצאות ששווה לשמור. כיום העבודה מתבצעת על RTX 6000 Pro Blackwell עם 96 GB זיכרון VRAM, שנקנה בכ-12,000 דולר; כיום אותו כרטיס נמכר בכ-15,400 דולר. שני שקעים חכמים מודדים את צריכת החשמל: ה-RTX 6000 Pro צורך כ-600 ואט בזמן הסקה ונשאר שקט, בעוד ששני כרטיסי 3090 צורכים יחד קרוב ל-750 ואט ורועשים מאוד.
הפער בבנצ'מרקים אמיתי
Qwen 3.6 27B משיג 77.2 בנקודת ציון SWE-Bench Verified, לעומת 88.6% של Claude Opus 4.8. אליס טוען שבנצ'מרקים הם מטרה נעה שאפשר לכוונן מודלים אליה: SWE-Bench בנוי מבעיות Python, בעוד הקוד של החברה כתוב ב-Go. מודלי חזית מוערכים ב-0.5 עד 2 טריליון פרמטרים — סדר גודל אחר של קיבולת ממה שכרטיס גרפי ביתי יכול להחזיק ללא פשרות. וכיווץ 27B לכרטיס אחד הוא בדיוק המקום שבו מופיעה ההתנהגות הגרועה ביותר.
איפה הכסף חזר
שני תהליכי עבודה הצדיקו את הרכישה. כלי בשם diag אוסף תמונת מצב מלאה של התקנת OpenFaaS אצל הלקוח, שאותה מנתח מודל מקומי בתוך VM זמני — כך שנתוני הלקוח אינם מגיעים לספק ענן. בנוסף, העברת בסיס נתוני טלמטריה דרך המודל המקומי חשפה לקוח שדיווח בחסר על רישיונות ושילם כארבעה עד חמישה מונים פחות במשך יותר משנה — החזר הכספים הזה לבדו כיסה את מחיר הכרטיס.
לולאות, הזיות ותפעול
מצב הכשל שאליס נתקל בו שוב ושוב הוא לולאה: כשהתבקש להציע פקודות חדשות ל-faas-cli, המודל חזר על אותן חמש הצעות במשך חצי שעה תוך שריפת 600 ואט, ובסקירת קוד אוטומטית המציא בעיות מקביליות ותנאי מרוץ — מה שסיים את הניסוי הזה. הפעלת המודל היא בעיה תפעולית בפני עצמה: זהות, מכסות, ניתוב, ניטור חשמל, ושני מופעי llama.cpp נפרדים כדי לשמור על אורך הקשר מלא. פענוח ספקולטיבי העלה את הקצב מ-67 יציב ל-130–200 טוקנים בשנייה. עצתו: להשאיר מודלים מקומיים במשימות תחומות כמו ניתוח תמיכה ובדיקות מקצה לקצה, ולא להשאיר אותם ללא השגחה במשימות ארוכות טווח. גם העלות נשארת טיעון אמיתי: תוכניות קוד בענן עולות כ-200 דולר בחודש, ו-Uber הגבילה לאחרונה את הוצאות העובדים על AI ל-1,500 דולר למפתח ולכלי בחודש.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.