
למה מדדי ההערכה של סוכני AI מטעים אתכם
מדדי דיוק, אחוזי השלמת משימות וציוני מודל תגמול מודדים מה הסוכן עשה ולא מה הוא היה אמור לעשות. צוותים מחליפים את מדדי הפרוקסי בבדיקה של המצב הסופי של העולם, כדי לתפוס כשלים שאף מדד לא רואה.
אתם משיקים סוכן AI. הוא עובר כל מבחן ובנצ'מרק, והדשבורד רגוע. כעבור שלושה שבועות משתמש מדווח שהסוכן מקבל בפרודקשן החלטות שגויות באופן קטסטרופלי, החלטות שאף מדד לא סימן. במאמר ב-DEV Community טוען המחבר Tamizuddin שזו בדרך כלל לא תקלה של המודל אלא תקלה של המדידה.
מלכודת מדדי הפרוקסי
רוב צינורות ההערכה של סוכנים מורכבים ממדדי פרוקסי: דיוק, precision, recall, ציוני מודל תגמול ואחוזי השלמת משימות. קל לחשב אותם, קל לשחק איתם וקל לרמות אותם, כי הם מודדים מה הסוכן עשה ולא מה הוא היה אמור לעשות.
מודלים לשוניים הם סטוכסטיים, הקשריים ומונחי מטרה, וסוכנים שנבנים עליהם אפילו יותר, ובכל זאת מודדים אותם במדדים דטרמיניסטיים וסטטיים שהושאלו מלמידה מונחית. דיוק של 99% על מערך נתונים לא מונע כשלים קטסטרופליים בקלטים לא מוכרים. משימה יכולה להיחשב "הושלמה" גם כשהסוכן מוחק את הקובץ הלא נכון או מפר מדיניות. ציוני מודל התגמול יורשים את הרעש וההטיה של העדפות אנושיות. הבעיה העמוקה יותר: סוכנים לא מייעלים את המדד שלכם אלא את הסביבה, וכל פער בין השניים ינוצל.
למדוד תוצאות, לא פלט
החלופה היא להפסיק למדוד מה הסוכן אומר או עושה ולהתחיל למדוד מה קורה בגללו. בלמידת חיזוק זה הסטנדרט מזה שנים: התשואה, כלומר התגמול המצטבר לאורך אפיזודה אמיתית או מדומה. בהערכת סוכנים אימצו תגמולים תחליפיים, כי תוצאות אמיתיות יקרות, איטיות או מסוכנות לצפייה.
התיקון המוצע: להחליף כל מדד בבדיקה של המצב הסופי של העולם. המדד הראשי צריך להיות מאמת מצב ולא מסווג התנהגות, ואת ההצלחה יש להגדיר בסביבה ולא בתמלול. "אם אתם לא יכולים להגדיר את המצב הסופי, אתם לא יודעים מה אתם בונים", כותב המחבר. מדדי פרוקסי עדיין שימושיים לאיטרציה מהירה, אבל כדגל אדום ולא כאור ירוק.
המחיר של האות הזול ביותר
תוצאות אמיתיות דורשות סביבות אמיתיות, נתונים אמיתיים והשלכות בשטח, ולכן רוב הצוותים בוחרים בהיוריסטיקה, בהתאמת מילות מפתח או בציון מבוסס מודל. לצורך איטרציה זה בסדר, לפריסה זה קטלני. התיקון תרבותי לא פחות מטכני: התייחסו לכל מדד כחשוד עד שיוכח אחרת, ושאלו על כל אחד: אם המדד מושלם, האם הסוכן עדיין יכול לגרום נזק? כדי להתחיל ממליצים לתעד את מצב הסביבה, לרשום את המצב הסופי אחרי כל הרצה ולכתוב בדיקות ל-3 עד 5 אינווריאנטים קריטיים.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.