חזרה
‏“המודלים נעשים טיפשים בכוונה”: למה מעבדות מחליפות ידע ביכולת הסקה
SiTech AI Team2 წთ. საკითხავი

‏“המודלים נעשים טיפשים בכוונה”: למה מעבדות מחליפות ידע ביכולת הסקה

מסה טוענת שמעבדות AI מחליפות בכוונה ידע עולם ביכולת הסקה: המודלים משתפרים במתמטיקה ובקוד, אך נחלשים ביכולת לזכור עובדות — ושיעורי ההזיות שלהם עולים.

בפוסט בשם “Models Are Getting Dumber on Purpose” טוען המחבר שמעבדות AI מובילות מחליפות בכוונה ידע על העולם ביכולת הסקה: המודלים פותרים משימות מתמטיות וקוד בפחות חישוב לכל טוקן, אך מתקשים יותר לזכור עובדות.

בנצ'מרקים שמצביעים לכיוונים מנוגדים

לפי הפוסט, GLM-5.2 משיג 99.2% ב-AIME 2026 עם כ-40 מיליארד פרמטרים אקטיביים לכל טוקן, Qwen3.5 מגיע ל-91.3% עם 17 מיליארד, ו-DeepSeek V4-Flash פועל עם 13 מיליארד. לצורך קנה מידה: ל-GPT-4 יוחסו ב-2023 כ-280 מיליארד פרמטרים אקטיביים, והוא בקושי פתר שאלת AIME. Qwen3.5 9B נכנס ל-6GB של זיכרון גרפי לאחר כימות, וכמעט מכפיל את הציון של המודל הטוב הבא עד 10 מיליארד פרמטרים במדד האינטליגנציה של Artificial Analysis. בזיכרון עובדות התמונה הפוכה: ב-SimpleQA, שבו אסור להשתמש בכלים, המוביל הוא Gemini 2.5 Pro עם 53%, בעוד Qwen3.5 4B ו-9B מציגים שיעורי הזיות של 80–82%.

עובדות מתיישנות, תהליכים לא

מחקרים על קיבולת ידע, ובהם סדרת “Physics of Language Models”, מעריכים אותה בכ-שני ביטים של ידע עובדתי לכל פרמטר. המחבר טוען שהסקה נדחסת טוב יותר מפני שהיא סט קטן של תהליכים שמופעלים שוב ושוב: פירוק הבעיה לחלקים, מעקב אחר מצב ביניים, בדיקת העבודה וחזרה אחורה. Phi-4 הוא מודל של 14 מיליארד פרמטרים שאומן רבות על נתונים סינתטיים בסגנון ספר לימוד — טוב במתמטיקה וחלש בטריוויה. גם לעובדות יש חיי מדף: ממשקי API ומחירים משתנים, ואלגברה לא.

איפה הידע נמצא עכשיו

אם המודלים לא אוגרים עובדות, התשתית מספקת אותן: אחזור מידע, קריאות לכלים, חיפוש ברשת ותיעוד. סוכן קוד לא צריך לזכור את ממשק ה-API של תלות כלשהי; הוא מחפש ב-node_modules או קורא את התיעוד, וכך תשובתו מבוססת על הגרסה שמותקנת בפועל. המחבר מצפה שבעוד שנתיים-שלוש הסקה באיכות frontier תרוץ על כרטיס גרפי אחד של צרכן: DeepSeek V4-Flash כבר מסיק עם כ-13 מיליארד פרמטרים אקטיביים, ו-271 המיליארד האחרים יושבים בעיקר בשכבות מומחים שמאחסנות עובדות. עובדה שגויה שמוטבעת במשקולות אי אפשר לתקן בלי אימון נוסף, ואילו לשגיאה במסמך יש כתובת שתיקונה משפר כל שאילתה עתידית. לפי המחבר, ייתכן שכרטיסי המודל יפסיקו יום אחד לציין תאריך חיתוך ידע.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.