חזרה
מודלים גדולים יותר אינם הפתרון: GPT-5.5 מייצר 86% הזיות, GLM-5.2 רק 28%
SiTech AI Team2 წთ. საკითხავი

מודלים גדולים יותר אינם הפתרון: GPT-5.5 מייצר 86% הזיות, GLM-5.2 רק 28%

ניתוח ב-arrowtsx.dev טוען שמרוץ הפרמטרים מיצה את עצמו: המודל הפתוח GLM-5.2 ברישיון MIT כמעט מדביק את GPT-5.5 במדדי הביצועים ומפגין אמינות גבוהה בהרבה, עם 28% הזיות לעומת 86% אצל GPT-5.5.

יותר ויותר מעבדות בינה מלאכותית מובילות מטילות ספק בהנחה שעלייה בלתי פוסקת במספר הפרמטרים ובנפח נתוני האימון מניבה בהכרח מודלים טובים יותר. בניתוח שפורסם ב-arrowtsx.dev ב-18 ביוני טוען הכותב שההתקדמות בסקיילינג נעצרה, ושגודל עצום נקשר כעת לבעיה אחרת — מודלים שאינם מודים באי-הוודאות שלהם.

מדדי ביצועים ומרוץ הפרמטרים

הטקסט נפתח בדוגמה יוצאת דופן: הגישה ל-Claude Fable 5 הוגבלה על ידי ממשלת ארצות הברית שלושה ימים בלבד לאחר שחרורו — לדברי הכותב, זהו האיסור האמריקאי הראשון על מודל בינה מלאכותית מטעמי ביטחון לאומי, שנגרם מסיכון של פריצה בודדת. במקביל, המודל הפתוח GLM-5.2 מבית Z.ai (753 מיליארד פרמטרים, כ-40 מיליארד פעילים) מפגר אחרי GPT-5.5 ב-4 נקודות בלבד ואחרי Fable 5 ב-9 נקודות במדד Intelligence Index של Artificial Analysis.‏ Opus 4.8 ו-GPT-5.5 הם מודלים קנייניים, באומדן שמרני של 1–2 טריליון פרמטרים. כאשר מודל פתוח ברישיון MIT מתקרב כל כך למודל סגור הגדול ממנו פי אחד וחצי עד שניים, מסכם הכותב, עליית האינטליגנציה למעשה נעצרה.

שיעורי ההזיות

חלקו השני של הניתוח עוסק באמינות. במדד AA-Omniscience מציג DeepSeek V4 Pro (1.6 טריליון פרמטרים, 49 מיליארד פעילים) שיעור הזיות של 94%: בשאלות שלא ידע את התשובה להן הודה בכך רק בכ-6% מהמקרים.‏ GLM-5.2 קיבל 28%, Opus 4.8 — 36%, Fable 5 — 48%, ו-GPT-5.5 — 86%. מודלים שאומנו על כמויות עצומות של נתונים עובדתיים, טוען הכותב, לומדים תמיד לספק תשובה במקום לומר "איני יודע".

מבחן וטרילמה בלתי פתורה

כדי להמחיש זאת, קיבלו שני המודלים שאלת Python מורכבת עם פגם ארכיטקטוני ברור — במאמץ חשיבה גבוה, בטמפרטורה 1, דרך OpenRouter.‏ DeepSeek V4 Pro השקיע כמעט פי עשרה טוקנים של חשיבה ובכל זאת החזיר תשובה שגויה בביטחון מלא. ל-GLM-5.2 נדרשו כ-12 שניות וכ-800 טוקנים כדי לזהות את חוסר האפשרות של משימה חד-תהליכית שמבצעת I/O מרובה ללא ויתור על השליטה. בהרצה נפרדת בזבז DeepSeek V4 Pro 3 דקות ו-26 שניות בלולאת חשיבה, ואז הציג פתרון מעוצב היטב אך שגוי.

המסקנה: אימון ובחירה של מודלים צריכים להיות מתוכננים סביב טרילמה בלתי פתורה — יכולות גולמיות, כיול אי-ודאות ויעילות חישובית. בחירת מודל לפי גודל או מקום בדירוג בלבד, מזהיר הכותב, פירושה יותר ויותר בחירה במערכת שתוכיח בשכנוע רב דווקא תשובה שגויה.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.