חזרה
סוכני AI נכשלים במשימות ברורות: זו בעיית שליפה, לא חשיבה — 49% ו-67% לפי Anthropic
SiTech AI Team2 წთ. საკითხავი

סוכני AI נכשלים במשימות ברורות: זו בעיית שליפה, לא חשיבה — 49% ו-67% לפי Anthropic

המפתח לרס וינסטנד טוען שרוב באגים מסוג "הסוכן טיפש" הם כשלי שליפה ולא כשלי חשיבה. לפי Anthropic: 49% פחות שליפות שנכשלו, ועם דירוג מחדש — 67%. לכן הדיבוג צריך להתחיל משכבת השליפה.

סוכן שמסוגל לסכם PDF ארוך, לקרוא ל-API נכון ולבצע תהליך רב-שלבי עדיין יפספס את חלון ההחזרים שקבור במסמך המדיניות, יבחר SKU שגוי או ישכח תוצאת כלי מלפני עשר שניות. בפוסט שפורסם ב-DEV Community טוען המפתח לרס וינסטנד שרוב הבאגים מסוג "הסוכן טיפש" אינם כשלי חשיבה אלא שליפות שנכשלו — וזה משנה מהיכן מתחילים לדבג.

הכשל נראה כמו חשיבה, אבל אינו כזה

הדפוס שתיאר וינסטנד מוכר מבוטי תמיכה וקופיילוטים פנימיים: הסוכן מתמודד עם החלקים הקשים ואז מפספס שלב אחד ברור. זה מרגיש כמו חשיבה לקויה, אך בדרך כלל עובדה מדויקת אחת פשוט חסרה ברגע מדויק אחד. "זה לא כשל חשיבה. זו שליפה שנכשלה", הוא כותב.

המספרים של Anthropic: 49% ו-67% פחות החמצות

הטיעון נשען על מחקר ה-Contextual Retrieval של Anthropic: כאשר מקטעים מקבלים הקשר ומשולבים בחיפוש סמנטי וב-Contextual BM25, מספר השליפות שנכשלו יורד ב-49%. הוספת שלב דירוג מחדש מעלה את השיפור ל-67%. RAG סטנדרטי — חלוקה בסיסית למקטעים עם חיפוש סמנטי בלבד — אינו מציג נתון דומה.

הקשר ארוך וחיפוש וקטורי אינם מספיקים

שתי הנחות נפוצות מתמוטטות. ראשית, מסירת כל התיעוד למודל אינה מבטיחה שישתמש בקטע הנכון: בגלל אפקט "Lost in the Middle" מודלים מתפקדים לעיתים גרוע יותר כשהעובדה הרלוונטית נמצאת באמצע פרומפט ארוך. שנית, חיפוש embedding טהור מפסיד במאבקי התאמה מדויקת — מזהי הזמנות, שמות מדיניות, מק"טים, שמות תהליכים, קודי שגיאה ומזהי קריאות. שליפה היברידית — מילות מפתח יחד עם סמנטיקה ודירוג מחדש — אמינה יותר במערכות אמיתיות.

לדבג קודם את שכבת השליפה

הצ'קליסט של וינסטנד מתחיל בתיעוד ההקשר המדויק שהסוכן ראה: המקטעים שנשלפו, ההודעות הקודמות, תוצאות הכלים, פרומפט המערכת והזיכרון המוזרק. "אם אינכם יכולים לבדוק את מצב הפרומפט הסופי, אתם מדבגים בעיוורון". לאחר מכן יש להפריד בין זיכרון השיחה, הזיכרון המתמשך והשליפה — שלושה אירועים שונים. הוסיפו חיפוש מילות מפתח למונחים מילוליים, הפעילו דירוג מחדש לפני החלפת מודל, ובדקו היכן ממוקמת העובדה הקריטית בפרומפט.

הסעיף האחרון ארכיטקטוני: אם מאגר הידע נכנס בנוחות להקשר — בערך עד 200,000 טוקנים — Anthropic ממליצה לוותר על RAG כליל, ושמירה במטמון של פרומפטים יכולה לקצר השהיה ביותר מפי שניים ולהוזיל עלויות עד 90%. הכלל שלו: כשסוכן נכשל במשימה ברורה, שאלו מה השליפה החזירה, היכן הופיעה העובדה, האם היה חיפוש התאמה מדויקת, האם הופעל דירוג מחדש והאם הסוכן ראה את הדבר הנכון בצורה שמישה.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.