חזרה
חוקרי Google נלחמים בשינון מבחנים על ידי סוכני AI שמשתפרים בעצמם
SiTech AI Team3 דק׳ קריאה

חוקרי Google נלחמים בשינון מבחנים על ידי סוכני AI שמשתפרים בעצמם

Google Cloud AI Research ואוניברסיטאות הציגו לאחרונה את RRSI, שיטה שמסדירה כיצד סוכני AI משכתבים את ה-harness שלהם, מונעת שינון מבחנים ומפחיתה את עלות הטוקנים בכ-30%.

Google Cloud AI Research ומספר אוניברסיטאות פרסמו מאמר על שיטה שמגנה על סוכני AI שמשתפרים בעצמם משינון משימות מבחן ומפחיתה עלויות חישוב. השיטה נקראת RRSI (Regularized Recursive Self-Improvement of Agent Harnesses) והיא מכוונת לשכבת התוכנה סביב מודל השפה, לא למודל עצמו.

אופטימיזציה עצמית מובילה לשינון

סוכני AI מודרניים עוטפים מודל שפה קבוע ב-harness: מסגרת של פרומפטים, תהליכי עבודה, כלים, זיכרון ולוגיקה שקובעת מה המודל רואה בכל צעד. לפי המאמר, חלק גדול מההתקדמות האחרונה בסוכנים הושג בעבודה על ה-harness ולא במודלים חדשים. שיטות חדשות מכוות את הלולאה ומאפשרות למודל לשכתב את ה-harness על סמך משוב ממשימות מבחן, צורה מעשית של שיפור עצמי רקורסיבי.

החוקרים מצאו פגם: כשהסוכן עובד שוב ושוב על אותן משימות מבחן מוגבלות, הוא לומד אותן בעל פה. הניקוד באימון עולה, אבל במשימות חדשות ההתקדמות פוחתת או נעלמת. החיפוש זוכר דפוסים המותאמים לבֶנצ'מרק אחד, מעדיף מועמדים עם ניקוד טוב במקרה ומוסיף מורכבות מיותרת, מה שמעלה ציוני מבחן בלי לשפר את הסוכן.

תקציבים קטנים ומבקר קפדן

RRSI פועל בשני צידי לולאת האופטימיזציה ומשאיר את ה-harness ניתן לעריכה מלאה. התקציב מגביל כמה שינויים בלתי תלויים אפשר לשלב בבת אחת, והוא קטן עם הזמן. סיבובים מוקדמים מאפשרים שכתוב גדול, ומאוחרים רק שינויים קטנים הקשורים בבירור לתוצאה. המערכת נמנעת מחזרה על רעיונות כושלים, ובעצירה מבצעת ניסויים בחלקים שלא נגעו בהם של ה-harness.

בבחירת שינויים, המבקר בוחן כל הצעה ודוחה הצעות שמצמידות שמות משימות, פתרונות או טריקים המותאמים לבֶנצ'מרק. כלל אחר מקבל עלות חישוב גבוהה יותר רק אם התוצאה משתפרת, ורכיבים לא מועילים מוסרים.

שיפור במשימות שלא נראו

הצוות בחן את RRSI על שמונה בנצ'מרקים בתכנות, עבודת משרד סוכנית ועיצוב הנדסי; Claude Opus 4.8 היה קפוא לאורך הבדיקה. RRSI השיג עד 14,1 נקודות באימון ועד 4,7 בחמישה בנצ'מרקים חדשים, ובמקביל חסך כ-30% בעלות הטוקנים לעומת הגרסה הלא-מווסתת. התוצאה לא ירדה מתחת לבסיס באף בנצ'מרק חדש, והעלייה הגדולה, 4,7 נקודות, נרשמה ב-JobBench.

כל השיטות שהושוו עבדו היטב באימון, אבל בחדשות התוצאות השתנו ושתיים היו מתחת ל-harness הבסיסי. RRSI הציג את העלייה הקטנה ביותר באימון והיה היחיד שעלה בבירור מעל הבסיס במשימות חדשות.

ה-harness לתכנות שאופטם עם Gemini 3.5 Flash העלה את הדיוק של Gemini 3.1 Flash Lite מ-11,2 ל-14,6 נקודות בלי שינויים, מה שמראה שהמנגנונים אינם תלויים ביכולות המודל שבו נמצאו. המחברים מציינים שהמחקר מכסה רק harnesses סביב מודלים קפואים ואינו בוחן שינוי במשקולות. הקוד זמין ב-GitHub.

עבודות קשורות

harnesses ידניים לרוב לא מכלילים היטב. בדיקות ARC-AGI-3 הראו ש-Opus 4.6 צבר 97,1% בסביבה מוכרת, אך 0% בסביבה זרה עם harness מיוחד. Nvidia הציגה לאחרונה את SoL-Pi, שבו סוכן מחקרי משחזר אוטומטית harness של סוכני תכנות ומפחית טוקנים בעד 49% בלי ירידה מורגשת. קודם לכן Google אילצה סוכנים לחלום על סשנים קודמים כדי לשפר את אסטרטגיית החיפוש, בלי לשנות את המודל.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.