
מאמר: פיתוח מואץ ב-LLM מנרמל כשלים שאיש לא חוקר
מאמר בבלוג ihatethefuture.com שהגיע לראש Hacker News טוען שפיתוח מואץ בעזרת מודלים גדולים של שפה מנרמל כשלים שאיש לא מנסה להסביר, ומוביל לכך ש"לפעמים פשוט רע" הופך לנקודת הסיום של החקירה במקום חיפוש סיבות ממשיות.
מאמר שפורסם בבלוג ihatethefuture.com (שם המחבר: patrickxia) הגיע לראש Hacker News. המחבר טוען שתרבות הפיתוח המואצת באמצעות LLM מנרמלת בהדרגה כשלים שאיש לא עוצר כדי להסביר.
"Stupid thing sucks"
המאמר נפתח בשני קטעים מצוירים שבהם דמות מנסה לעבור בדלת שלא נפתחת. המכשול ממשי: תחילה גוף של אדם, ובהמשך זהב בשווי של כמיליארד דולר. בשני המקרים הדמות המתוסכלת ממלמלת "stupid thing sucks" (בערך "דבר מטופש, פשוט גרוע") וממשיכה הלאה. המחבר קורא לכך "לא מודל סביר של דלתות": לכשל היה גורם קונקרטי, והאשמה הוטלה על האובייקט הלא נכון.
Jev ותיבת ה-"AI-powered"
מכאן עובר המאמר ל-Jev, מודל AI שפיתחה TypeSafe AI, שמחזיר ערכים מטופוסים יחד עם הערכות הסתברות. לדברי המחבר, נקודות המכירה הן מהירות וזוליות: הוא מהיר, זול, וקל לבנות עליו. השאלה היא מה קורה אחרי הבנייה. לפי התיאור, הקונים כמעט אינם מריצים הערכות (evals): הם מפנים שאלות אטומות ל-Jev, מקבלים תשובות אטומות, וכך יכולים לסמן את תיבת ה-"AI-powered". כשמערכת במורד הזרם נשברת, "ובכן, AI טועה" משמש כהסבר, בעוד שתקציבי שגיאה, מצבי כשל וסטים של בדיקות נדחים. בינתיים המשתמשים מגלים את שיעור הכשלים בעצמם.
המאמר מקדים את ההגנה המתבקשת: Jev מחזיר ציוני ביטחון. מה תעשו איתם? כדי לפעול לפי ציון ביטחון צריך להבין עד כמה הוא מכויל, ולדעת מה עולה אי-הוודאות. במקרה הטוב, כותב המחבר, אנשים משתמשים בציוני ביטחון "בסגנון פולחן מטען"; במקרה הרע הם מצטטים אותם כתירוץ לקריאה שנכשלה, כאילו תשובה "בטוחה ב-73%" מקצה תקציב שגיאה של 27%.
אחריות ונקודת הסיום של החקירה
כשכפתור באתר נשבר, למהנדס בדרך כלל יש מודל של מה שהיה אמור לקרות: חוזה הופר, DNS התקלקל, מישהו שחרר סקריפט עם שגיאות תחביר בנתיב מסוים, מטפל זרק חריגה שלא ציפו לה. ייתכן שאין גישה לדבג HTTP 500 עירום, אבל יש אדם שתפקידו להבין למה נקודת הקצה לא עובדת. עבור משתמשים רבים, לעומת זאת, החוויה קרובה יותר ל"לפעמים פשוט רע".
הפחד המרכזי של המאמר אינו מכך שפיתוח מונע LLM ייצר יותר כשלים. הוא ייצר, והוא כבר מייצר: זה חלק מהמחיר של בנייה בדרך חדשה. הפחד הוא ש"לפעמים פשוט רע" יהפוך לנקודת הסיום המקובלת של החקירה עצמה. זהו הפסד, כותב המחבר, מפני שעבודה מואצת ב-LLM יכולה דווקא לעזור לפתור בעיות כאלה: תהליכי QA אוטומטיים לא נכתבים מחוסר זמן הנדסי, וההערכה שתחליף את Jev או תצדיק את השימוש בו "נמצאת במרחק של כמה פרומפטים". המאמר נחתם במטפורה: אנחנו בונים מערכות שבהן לא המשתמש ולא הבונה מעוניינים לבדוק אם יש גוף מאחורי הדלת.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.