חזרה
GPT-6 Sol מול Claude Opus 5.5: זול יותר רק כשהתוצאות חוזרות על עצמן
SiTech AI Team3 წთ. საკითხავი

GPT-6 Sol מול Claude Opus 5.5: זול יותר רק כשהתוצאות חוזרות על עצמן

The New Stack בחן את GPT-6 Sol של OpenAI ואת Claude Opus 5.5 של Anthropic בשלושה מבחני פיתוח קשים, חמישה סיבובים לכל אחד. Sol יצא זול פי שישה בערך, אבל החמיץ שלוש ריצות מתוך 15, בעוד Opus 5.5 היה מושלם בכל פעם.

OpenAI שחררה את GPT-6 Sol ב-22 בספטמבר 2026 וטוענת שהוא עוקף את Claude Opus 5 במשימות עסקיות ב-9% מהעלות לכל משימה: 33.2% ב-AutomationBench של Zapier לעומת 26.9% של Opus 5. באותו יום שחררה Anthropic את Claude Opus 5.5, ולכן ג'סיקה וכטל מ-The New Stack בחנה את המודל החדש יותר.

לפי מחירי המחירון, Sol עולה 2 דולר למיליון טוקנים בקלט ו-10 דולר למיליון טוקנים בפלט, חצי מהמחיר של GPT-5.6 Sol; Opus 5.5 עולה 4 ו-20 דולר. לכן גם אם חשבון הטוקנים של Sol גבוה יותר, הוא עשוי עדיין לצאת זול יותר.

שלושה מבחנים, חמישה סיבובים לכל אחד

הסיבוב הראשון הסתיים בתיקו: שני המודלים תיקנו שלושה באגים שהונחו בשירות חיוב ב-Python, מינו 40 משימות CI שנכשלו וענו על 20 שאלות על SDK פיקטיבי בלי להמציא אף מתודה. גם הגרסאות הקשות, דוח תקלה בן 3,664 שורות ומימוש מפרט שנבחן ב-120 בדיקות נסתרות, הסתיימו בשוויון. רק ריצות חוזרות הפרידו ביניהם.

שני המודלים נקראו דרך ה-API עם פרומפטים זהים וברמת המאמץ הגבוהה ביותר של כל אחד, חמש פעמים לכל מבחן. במבחן מיון ה-CI המודל מחליט אם לנסות שוב, לחסום או להזעיק תורן; מבחן יומני התקלה כולל 3,664 שורות מחמישה שירותים ושבע שאלות; מפרט הרזולבר דורש כתיבת פותר תלויות מתוך מפרט בן שני עמודים בלי להריץ קוד.

מה מראים המספרים

מיון ה-CI, המבחן הקרוב ביותר לטענה של OpenAI, עבר 5 מ-5 אצל שני המודלים. Opus 5.5 השקיע בממוצע דקה ו-27 שניות, 11,127 טוקני פלט ו-0.24 דולר לריצה; Sol השקיע 18 שניות, 1,143 טוקנים ו-0.02 דולר, כ-8% מהעלות, בקנה אחד עם 9% שמפרסמת OpenAI.

יומני התקלה שינו את התמונה: Opus 5.5 היה מושלם בכל חמש הריצות, Sol רק בשתיים. הוא פספס פעמיים את אותו לקוח, שחיובו אושר 52 שניות אחרי ניסיון חוזר מוצלח, ובפעם אחת ספר 27 רכישות שנכשלו במקום 28. Opus 5.5 עמד על 6 דקות ו-44 שניות, 53,308 טוקני פלט ו-1.68 דולר לריצה; Sol על דקה ו-41 שניות, 7,073 טוקנים ו-0.30 דולר, וקרא את אותו יומן ב-25% פחות טוקני קלט.

במפרט הרזולבר Opus 5.5 עבר כל ריצה ו-Sol ארבע מתוך חמש: סוגר מיותר בשורה 78 הפיל את המודול בטעינה והכשיל את 120 הבדיקות. Opus 5.5 עמד על 9 דקות ו-40 שניות, 70,687 טוקני פלט ו-1.42 דולר; Sol על 6 דקות ו-28 שניות, 21,435 טוקנים ו-0.22 דולר.

זול יותר, אבל לא תמיד צודק

מתוך 15 ריצות Opus 5.5 היה מושלם בכל פעם ו-Sol ב-12. 15 הריצות של Sol עלו 2.68 דולר, כ-16% מ-16.72 הדולר של Opus 5.5. וכטל ממליצה לחלק לפי מחיר הטעות: Sol לעבודה בנפח גבוה שבה אדם או מערך בדיקות בודק את הפלט, ובמחירים האלה אפשר להריץ אותו פעמיים ולהשוות; Opus 5.5 כשטעות יקרה ואיש לא בודק. הטעויות של Sol חומקות מביקורת: לקוח שנשמט מרשימת ההחזרים או קובץ שלא נטען.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.