
OpenAI משפרת את מטמון הפרומפטים ב-GPT-6
OpenAI הציגה מערכת משופרת לזכירת פרומפטים במטמון עבור משפחת המודלים GPT-6: שיעורי פגיעה גבוהים יותר כברירת מחדל, הנחות של עד 90% על טוקני קלט מהמטמון וכלים חדשים לאבחון החמצות.
OpenAI פרסמה פרטים על מערכת משופרת לזכירת פרומפטים במטמון עבור משפחת המודלים GPT-6. לדברי החברה, היא מעלה כברירת מחדל את שיעור הפגיעות במטמון ומעניקה למפתחים הנחות של עד 90 אחוזים על טוקני קלט שנשמרו במטמון. העדכון פורסם ב-22 בספטמבר 2026.
שמירה במטמון חשובה במיוחד לסוכנים שעובדים שעות על משימות מורכבות, משיפור בסיסי קוד ועד הכנת מסמכים מחקריים. יישומים כאלה שולחים שרשראות ארוכות של בקשות API שנושאות את אותן הוראות, הגדרות כלים והקשר קודם, ולכן שימוש חוזר בחישוב מקצר גם את זמן התגובה וגם את העלות.
שיעור פגיעה גבוה יותר
עם GPT-6, כך לפי OpenAI, תחיליות משותפות מתאימות מקבלות הנחה כשהן נעשות בהן שימוש חוזר בתוך חלון של 30 דקות. המערכת פועלת אוטומטית, אך החברה הוסיפה גם כלים שמאפשרים לצוותים למדוד מה באמת נמצא בשימוש חוזר.
לוח הבקרה החדש Prompt Caching Dashboard מציג כמה מקלט היישום מוגש מהמטמון, עוקב אחר שיעור הפגיעות לאורך זמן ומשווה טוקנים מהמטמון לטוקנים שאינם. כשהחמצה נראית בלתי צפויה, כלי האבחון משווה בקשה לתגובה קודמת ומציין את הסיבה — מודל, מערך כלים, הגדרה או קלט שהשתנו — ומעריך כמה טוקנים נפגעו. בדוגמה של OpenAI החמצה מסוג tools_changed הותירה 5,629 טוקנים לשימוש חוזר ללא ניצול.

שליטה למפתחים
נקודות עצירה מפורשות במטמון מאפשרות לבחור אילו תחיליות לעשות בהן שימוש חוזר, ו-OpenAI עדכנה את המדריך בנושא. במודלי GPT-6 אפשר כעת לשנות את מאמץ החשיבה בין תגובות על ידי הוספת configuration_update, בלי לשנות את ההגדרה ברמת הבקשה, כך שהמטמון נשמר.
OpenAI ממליצה גם לשמור על יציבות בהגדרות הכלים, בסכימות ובסדר: לחשוף רק את הכלים הדרושים באמצעות allowed_tools או להגדיר tool_choice כ-none, במקום למחוק הגדרות. הוראות חדשות יש להוסיף כהודעות מפתחים סמוך לסוף ההקשר, ואפשר לחמם מראש הקשר ידוע.
מה מדווחים הלקוחות
מנהל המוצר הראשי של GitHub Copilot, מריו רודריגס, אמר שהעבודה על המטמון סייעה לצמצם ביותר מ-50 אחוזים את חלקם של טוקני הפרומפט הנדרשים לעיבוד מחדש מתוך מיליארדי בקשות. סמנכ"ל הטכנולוגיה של Strawberry Browser, אריאן חניפי, דיווח על עלות נמוכה ב-20 אחוזים ועל כך שנקודות עצירה מפורשות הפכו פיצול שיחות למשימות רקע לכדאי כלכלית. Manus עלה מכ-85 לאחוזים יציבים מעל 90 בתוך פחות משבוע, ואילו Wordsmith מ-83 ל-91 אחוזים, עם צמצום של כשני שלישים בכתיבות למטמון ו-36 אחוזים בעלויות ההסקה.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.