למה אני עדיין פסימי לגבי מודלי שפה אחרי נאוויה–סטוקס
פוסט שזכה לתשומת לב טוען שתוצאות מתוקשרות בתחום הבינה המלאכותית אינן מעידות על אוטונומיה אמיתית: המודלים עדיין זקוקים לפיקוח כבד, ועלות המפרטים הקפדניים שהיו פותרים זאת היא חסם מבני לרוב החברות.
נגד ההייפ
פוסט שפורסם ב-15 בספטמבר בבלוג dank.systems טוען שההתלהבות סביב מודלי שפה גדולים הקדימה את מה שהמערכות האלה באמת מסוגלות לעשות. לדברי המחבר, השווי של המעבדות המובילות נשען על נרטיב שלפיו הן ייצרו — או ייצרו בעתיד הקרוב מאוד — “תחליף אוטומטי מלא לרוב עובדי הידע”, בעוד שהמודלים הקיימים עדיין זקוקים ל“פיקוח מאומץ ולמעקות בטיחות גם במשימות הפשוטות ביותר”.
הדגמות מתוקשרות — עבודת נאוויה–סטוקס, ממצאי הרצת קוד מרחוק ב-FreeBSD ותקרית Hugging Face — אינן מוכיחות לדבריו שהושגה אוטונומיה ממשית. כראיה הוא מצביע על חברות תוכנה שממשיכות להעסיק מהנדסים שהיו מדורגים נמוך יותר מהמודלים שמפקחים עליהם במבחנים המקובלים היום.
הכללה צרה ומחיר המפרט
הטענה השנייה נוגעת להכללה: המודלים מצליחים רק בסביבה צרה של המשימות שעליהן אומנו, וגם שם “שינויים קטנים בתוך מחלקת משימות שכוסתה מביאים לכישלון מוחלט או לניצול לרעה של אות התגמול”. תיקון הדבר מחייב מפרט קפדני מאת מומחי תחום, שזמנם יקר — וכתיבת מפרט היא מיומנות נפרדת בפני עצמה, ולכן החפיפה בין מי שמכיר את התחום למי שיודע להגדיר אותו בדיוק היא, לדבריו, קטנה מאוד.
עלות העבודה עשויה לעלות על זו של מימוש ישיר של תיאור לא פורמלי. בהנדסת חומרה, פרויקט מעבד טיפוסי מעסיק פי שלושה בערך מהנדסי מפרט וולידציה לעומת מהנדסי תכנון, ויחס של 5:1 אינו נדיר, כותב המחבר.
מתמטיקה כמקרה הטוב ביותר, וסקירה אנושית כגיבוי
תוצאות מתמטיות הן, בלשונו, “התרחיש הטוב ביותר בעולם” לעבודה מול מפרט קפדני: נוסח המשפט הוא כבר מפרט, הוא נבדק במשך עשורים על ידי הקהילה המתמטית, והפורמליזציה שלו ב-Lean היא תרגום של אובייקטים מבוססים מ-mathlib. גם כך, באגים בנכונות איפשרו בעבר למודלי שפה להעביר הוכחות כוזבות דרך הליבה של Lean.
החלופה — סקירה אנושית — אינה מתרחבת בהתאם להיקף התפוקה של המודלים, והיא עצמה חשופה למניפולציה; המחבר מזכיר את הדלת האחורית ב-xz ואת פרשת “קומיטים צבועים” בליבת לינוקס. אם הסקירה האנושית נשארת במעגל, קצב הייצור מוגבל על ידי זמן ותשומת הלב של בני אדם.
אילו חברות יכולות להריץ בינה מלאכותית אוטונומית
מסקנת הפוסט: ברוב התחומים מודלי שפה דומים ל“מתמחה מרוסק: מהיר ואפקטיבי בידיים של מבוגר, אבל לא זה שמקבל את האחריות על המקום”. רק שלושה סוגי חברות יכולות להרשות שימוש אוטונומי מלא: כאלה שסופגות כישלון בזול (למשל צוותי אב-טיפוס מהירים); כאלה שיש להן מערך צר ומוגן היטב של משימות (עבודה פיזית חזרתית מבוקרת, שירות לקוחות בצ'אט); וכאלה שכבר משלמות על מפרט וולידציה קפדניים (תכנון שבבים, פיתוח תרופות).
שתי הקבוצות הראשונות רגישות למחיר, ולדברי המחבר די להן במודלים פתוחים על חומרה זולה. מסקנתו: ההשלכות יחרגו הרבה מעבר למעבדות המובילות.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.