חזרה →
SiTech Team⏱️ 2 წთ. საკითხავი

המכון הבריטי לבטיחות AI: אמות מידה סטנדרטיות ממעיטות באופן שיטתי ביכולתם האמיתית של סוכני AI

המכון הבריטי לבטיחות AI: אמות מידה סטנדרטיות ממעיטות באופן שיטתי ביכולתם האמיתית של סוכני AI

מחקר UK AISI על 7 אמות מידה מגלה: תקציבי חישוב קבועים מדווחים בחסר על יכולות סוכני AI — הגדלת תקציב התווים פי 10 העלתה את שיעורי ההצלחה בכ-25%.

🔍 מדוע אמות מידה סטנדרטיות נכשלות במדידת הכוח האמיתי של סוכני AI

המכון הבריטי לבטיחות בינה מלאכותית (UK AISI) פרסם מחקר שהפך לאחת התגליות החשובות ביותר בתחום הערכת AI. המכון בחן מודלי AI מובילים על שבע אמות מידה שונות ומצא שהבדיקות הסטנדרטיות ממעיטות באופן שיטתי בהערכת יכולות סוכני AI.

הסיבה פשוטה: לכל אמת מידה יש תקציב חישוב קבוע — מספר התווים המקסימלי שסוכן AI יכול להשתמש בו. חוקרי AISI הוכיחו שביצועי סוכן AI אינם נקודה קבועה, אלא עקומה הגדלה עם תוספת זמן חישוב. כאשר אנו קוטעים את התקציב כשעקומה זו עדיין עולה, הציון המתקבל מראה את המינימום, לא את המקסימום. תגלית זו משנה באופן יסודי כיצד עלינו לחשוב על הערכת AI.

📊 תקציב החישוב — המשתנה הנסתר

דמיינו סוכן AI המנסה לפתור משימת הנדסת תוכנה מורכבת. הסוכן צריך לחשוב דרך הבעיה, ליצור גישות מרובות, לבדוק אותן, לנפות שגיאות ולשפר. כל צעד צורך תווים. אמת מידה סטנדרטית עשויה לאפשר רק מחזור אחד של תהליך זה. אבל מה אם הסוכן היה זקוק ל-5 מחזורים? מחקר AISI מראה שכאשר תקציב החישוב הוגדל פי עשרה, שיעורי ההצלחה במשימות הנדסת תוכנה קפצו בכ-25%.

זה יוצר "אפקט תקרה" — אמת המידה מודדת את המבחן, לא את הסוכן. בדיוק כפי שאתלט שנמדד בשעון עצר מקולקל ייראה תמיד איטי יותר, סוכני AI המוגבלים על ידי תקציבי חישוב לא מספקים נראים פחות מסוגלים ממה שהם באמת.

📖 קראו את הכתבה המלאה ב-The Decoder