
מודלים מקומיים סוף סוף טובים: כך נראה המערך של מפתחת על Mac מ-2022
המהנדסת ויקי בויקיס אומרת שהמודלים המקומיים הפכו סוף סוף טובים מספיק לקידוד אייג'נטי: על Mac M2 מ-2022 עם 64 GB זיכרון הם מגיעים לכ-75% מהדיוק והמהירות של מודלים פרונטיריים, כשכל הפעלה מבודדת ב-Docker.
המהנדסת ויקי בויקיס עובדת עם מודלים מקומיים מאז שיצאו, ובפוסט מ-15 ביוני 2026 היא מסכמת: סוף סוף הם טובים באמת. מכונת הבדיקה שלה היא Mac M2 משנת 2022 עם 64 GB זיכרון ו-1 TB אחסון.
היא הרצה Mistral 7B, Gemma 3, OpenAI OSS-20B, Qwen 3 MoE וגרסאות נוספות של Qwen, ובהן Qwen 2.5 Coder, במגוון סביבות: llama.cpp נקי עם Open WebUI, llama-cpp-python, Ollama, llamafiles ו-LM Studio.
איפה המודלים המקומיים עומדים היום
בויקיס מסמנת את שחרור GPT-OSS כנקודת המפנה — המודל הראשון שהיא הפסיקה לבדוק לעיתים קרובות מול מודל API. המדד האישי שלה פשוט: האם אני צריכה לאמת את זה מול מודל API?
עם הגרסאות האחרונות במשפחת Gemma 4 היא החלה סוף סוף לבצע קידוד אייג'נטי מקומית, כשהלופים רצים בכ-75% מהדיוק והמהירות של מודלים פרונטיריים. ברירת המחדל שלה היא gemma-4-26b-a4b ב-LM Studio. בעזרתו היא הפכה סקריפט מנוטבוק למאגר של חמישה-שישה מודולים, תיקנה רמזי טיפוסים לג'נריקים, הגהה פוסטים בבלוג, כתבה בדיקות יחידה ובנתה מאפס מאגר למודל המלצות מסוג two-tower. מטמון ה-K-V גדל ל-64 GB, ומשימות כאלה היו בלתי אפשריות למודלים מקומיים לפני חצי שנה בלבד.
איך מריצים אייג'נטים מקומיים היום
צריך שלושה רכיבים: מנוע אינפרנס מקומי, מעטפת אייג'נטית וקובץ המודל, כשהמעטפת מפנה לכתובת המקומית. בויקיס משתמשת ב-Pi כמעטפת וב-LM Studio כשרת האינפרנס, ומציינת ששימוש ישיר ב-llama.cpp היה כנראה מהיר יותר.
מטעמי בטיחות כל הפעלה של Pi רצה בקונטיינר Docker עם הרשאות ל-bash בלבד, כך שהוא לא יכול להריץ קוד Python או לגלוש ברשת. לדגם היא בחרה ב-gemma-4-12b-qat — חדש יותר, קטן ומהיר יותר, בלי ויתור גדול על דיוק.
מה עדיין לא עובד
האינפרנס יכול להיות איטי, חלונות ההקשר קטנים ומוגבלים לחומרה שלך, וגרסאות מוקדמות סובלות מאי-התאמות בתבניות פרומפט, אם כי אלה מתוקנות במהירות. האקוסיסטם נעשה נוח בהרבה הודות ל-LM Studio ולכפתור Use This Model של HuggingFace.
לדעתה זה עדיין לא מוכן לפיתוח תוכנה בייצור. היתרון הוא השקיפות: אפשר לצפות ביצירת הטוקנים בזמן אמת, לשנות את חלון ההקשר, את פרומפט המערכת ואת הקוונטיזציה, ולהשוות מודלים זה מול זה.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.