
ThinkingBox AI של Microsoft מעריך סוכני AI עם רשומות שנותרו במסד הנתונים
בנצ'מרק ThinkingBox של Microsoft ו-Hugging Face מריץ סוכני AI ב-507 תהליכי עסקי עם מצבים ב-20 פעמים ומעריך את המצב הסופי ואת ההשפעות הצדדיות ולא רק את התשובות הסופיות.
מצב ולא מילים
בנצ'מרק ThinkingBox של Microsoft ו-Hugging Face מעריך סוכני AI עם רשומות שנותרו מאחור ולא רק עם קריאות לכלים או ניסוח סופי. הוא כולל 507 תהליכי עסקי עם מצבים ומריץ כל משימה 20 פעמים מ-backend נקי. במקרה בודד אחד, הסוכן השתמש בתשע קריאות לכלים עבור טכנאי מטבח שאיחר ב-$745, ולאחר מכן סימן כרטיס שליח כטופל, בזמן שפער המוביל נותר פתוח. המצב הנדרש היה hold, שמשפיע על כשלון שהמעריך של קריאות הכלים דילג עליו.
כל ניסיון מתבצע בסשן MCP מבודד עם מצב מאותחל מחדש. גלאי ההשפעות הצדדיות רושם שינויים, ושופטים דטרמיניסטיים משווים את התוצאה לתוצאה הנדרשת. מסגרת הבדיקה ומערך הנתונים זמינים ב-Hugging Face, ו-ThinkingBox-Bench באמצעות OpenEnv. מתוך 507 משימות, 477 מוערכות רק לפי מצב, ו-30 מוסיפות רובריקות תשובה לדרישות שלא ניתן לדמות עם מסד נתונים נקי בלבד.
עקביות היא תוצאה נפרדת
ThinkingBox מדווח על pass@1, pass@20 ו-20/20 קבוע. Pass@1 מודד את שיעור הניסיונות הבודדים המוצלחים. Pass@20 מודד משימות שעברו לפחות פעם אחת מתוך 20 ניסיונות, ו-20/20 קבוע סופר משימות שעוברות בכל 20 הניסיונות. בהשוואה כללית, Claude Opus 5.5 הוביל ב-pass@1 עם 67.16%, אחריו Claude Opus 5 עם 66.50% ו-GPT-5.4 עם 65.36%.
העקביות שינתה את התמונה. Kimi-K3 פתר 476 מתוך 507 משימות לפחות פעם אחת, כלומר 93.89%, אבל רק 68 משימות עברו את כל 20 הניסיונות, כלומר 13.41%. Claude Opus 5 עבר 241 משימות בכל 20 הניסיונות, אותה כמות כמו Claude Opus 5.5. באבלציה של 121,680 ניסיונות תקפים על 12 מודלים, 79,853 ניסיונות נכשלו בבדיקות בר-ביצוע. מהכשלונות הללו, 67.24% הסתיימו בנקיון, קראו לכלי שמשנה מצב ולא הודיעו לכלי הסופי על השגיאה. הבדיקות מצאו ערכי שדות שגויים ב-77.61%, השפעות מיותרות ב-43.30% והשפעות נדרשות שדולגו ב-25.36%; נתונים אלה חופפים.
עבודה עם כלים והטמעה
בדגשי הכשלון דומינה שימוש בכלים ב-79.9%, אחריו עדכוני מצב שגויים ב-10.3%, החלטות לא שלמות של המשתמש ב-7.0% והיעדר פעולות משנות מצב ב-2.9%. המחברים מתארים זאת כממוצעים כבדים של שיעורי מודלים בודדים ודגשי כשלון נצפים, ולא הסברים סיבתיים ייחודיים. לטענתם, סוכנים לעיתים קרובות מתחילים תהליך עבודה אך מצליחים לשקם שגיאות כלים, תנאים מוקדמים כושלים או חיפושים ריקים.
להטמעה המחברים ממליצים לבדוק את המצב הסופי לפני מסירה, לסווג שגיאות כלים ומערכת, להקטין את שטח הפנים של הכלים ולדרוש אישור אדם על שינויים שקשה לבטל. הם לא מדדו את השפעת אמצעים אלה על הבנצ'מרק. ThinkingBox מעריך גם את ערך המשימה האמין, המחושב לפי מספר הקמפיין של 20 פעמים ומספר המשימות שעברו את כל 20 הניסיונות. בין המודלים שיש להם לפחות משימת 20/20 קבועה אחת, הציונים הנמוכים ביותר בטבלה היו $6.80 עבור GPT-5.4, $7.45 עבור GPT-6 Astra ו-$7.80 עבור Claude Opus 5.5. אלה ציונים יחסיים ולא חיובי ענן בפועל. לפי הבנצ'מרק הציבורי, כל המשימות הן שיחזור סינטטי, תהליכי העבודה והמדיניות מודלים על פי דפוסי סוכן תעשייתיים אמיתיים; המשתמשים שלו אינם אמיתיים.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.