חזרה
SoL-Pi של NVIDIA חותך כמעט בחצי את צריכת הטוקנים של סוכני קוד
SiTech AI Team2 წთ. საკითხავი

SoL-Pi של NVIDIA חותך כמעט בחצי את צריכת הטוקנים של סוכני קוד

חוקרי NVIDIA בנו את SoL-Pi, מערכת שמשפרת אוטומטית את שכבת השליטה של סוכן קוד. היא שומרת רק שינויים שמשמרים את היכולת ומורידה את תעבורת הטוקנים ב-44.7 עד 49 אחוזים.

חוקרי NVIDIA בנו את SoL-Pi, מערכת שמייעלת את ה-harness, שכבת השליטה בין המודל לסביבה שלו, שעליה פועלים סוכני קוד כמו Codex, Claude Code ו-OpenClaw. לפי המאמר שפורסם ב-ArXiv ב-17 בספטמבר ואשר דווח עליו ב-The Decoder, ה-harness המיועל שומר על ביצועים דומים תוך צמצום תעבורת הטוקנים ב-44.7 עד 49 אחוזים והפחתת עלות ה-API בכשליש.

לולאת המחקר האוטומטית של SoL-Pi

ה-harness הופך למטרה

עבודות יעילות מכוונות בדרך כלל למודל עצמו: ליבות attention מהירות יותר, קוונטיזציה או מודלים זולים יותר. SoL-Pi משנה במקום זאת כיצד הסוכן רואה מצבים, מבצע פעולות ומעבד משוב. AI מחקרי קורא עקבות של סוכן שפועל על ה-harness הבסיסי, מציע שינויים ובודק אותם בסביבות מוכנות; מועמד נשאר רק אם הוא בתוך סובלנות יכולת שהוגדרה מראש ומשפר מדד יעילות.

החיפוש כיסה 152 כיוונים בשש משפחות, בהן הקשר, כלים, האצלה והערכה, על 535 סביבות הרצה. כך נוצרו יותר מ-3,000 הרצות ויותר מ-60,000 אינטראקציות בין סוכן לסביבה.

ארבעה מנגנונים

ארבעה מנגנונים נותרו. Action Fusion מאחד שני צעדים עוקבים לצעד אחד ומבטל קריאה שלמה למודל. Online Context Compact מקצר את ההקשר שנצבר אחרי כל צעד תכנון, אבל רק כשמידע חשוב לא הולך לאיבוד. ObservationPack מאחסן פלטים ארוכים של כלים ושולח בהמשך תקציר קצר במקום את הטקסט המלא. Evidence-Preserving Reducer מפנה יומני שגיאות ובדיקות גדולים למודל זול שמזקק מהם את הממצאים המרכזיים.

ב-EdgeBench הגרסה שמשלבת את כל ארבעת המנגנונים צורכת 49 אחוזים פחות טוקנים ומגיעה ל-93.7 אחוזים מהציון הבסיסי של Pi, ועלות ה-API יורדת ב-50.0 אחוזים מול Codex וב-54.3 אחוזים מול Claude Code. גרסה עם המנגנון החזק ביותר בלבד עוברת את הציון של Pi ב-5.3 אחוזים. בהרצה אחת ירדה העלות מ-1,339 דולר ל-894 דולר. לפי המחברים, החיסכון לשעה הוא 8.75 עד 13.50 דולר מול Codex ו-Claude Code ו-4.36 עד 5.71 דולר מול Pi.

המערכת נבנתה עם GPT-5.6 Sol בלבד והופעלה ללא שינויים על Opus 5, שם שמרה על 94.3 אחוזים מהביצועים של Pi עם חיסכון דומה; המנגנונים פשוט הופעלו בתדירות נמוכה יותר.

בבנצ'מרקים אחרים התמונה מעורבת

מתוך 63 משימות CPU ב-Terminal-Bench 4 פתרה המערכת 15, בעוד Codex ו-Pi פתרו 18 כל אחת, אך העלות נשארה נמוכה בכרבע. במשימות Lean 4 מאומתות מ-IMO 2026 היא פתרה שלוש משש במחיר הנמוך ביותר למשימה, ונחיל של 20 עובדי SoL-Pi הפחית את עלות אופטימיזציית הקרנלים ב-26.8 אחוזים.

לצמצום ההקשר יש מחיר משלו: פרומפטים קצרים יותר עלולים לצמצם את השימוש החוזר במטמון. The Decoder מציין שמחקר נפרד מצא שדחיסת הקשר משמרת בממוצע רק 17 אחוזים מהוראות המשתמש.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.