
Claude Opus 5.5 מול Opus 5 במשימות חשיבה: זול ומהיר יותר, אך לא טוב יותר
Anthropic מצהירה ש-Claude Opus 5.5 זול ב-40% ומהיר ב-30% מ-Opus 5. The New Stack בחן את שני המודלים בשלוש משימות חשיבה קשות: החיסכון אכן התממש, הבטחת המהירות לא, והתשובות היו זהות לחלוטין.
The New Stack השווה בין שני המודלים של Anthropic, Claude Opus 5.5 ו-Claude Opus 5, בשלוש משימות חשיבה קשות. התוצאה פשוטה: המודל החדש זול ומהיר יותר, אבל לא חכם יותר. שניהם פתרו שתיים מהמשימות במלואן, ושניהם נכשלו בשלישית.
מה Anthropic מבטיחה
לפי החברה, Opus 5.5 זול ב-40% מ-Opus 5 בעומסים טיפוסיים ומייצר פלט מהיר ביותר מ-30%, בעוד שביכולותיו הוא אמור להשתוות ל-Claude Fable 5.1, כלומר לעלות על המודל הקודם. גם מחיר ה-API ירד: ארבעה דולרים למיליון טוקנים בקלט ועשרים דולרים למיליון בפלט, לעומת חמישה ו-25 ב-Opus 5. ההוזלה לבדה מסבירה חיסכון של 20%, ואת היתר צריך המודל להשיג בצריכת פחות טוקנים.
חידת הלוגיקה: אותן תשובות במחיר נמוך
שני המודלים הופעלו דרך ה-API של Anthropic עם אותם פרומפטים, במצב חשיבה אדפטיבית בעוצמה של ברירת המחדל; ב-Opus 5.5 אי אפשר לכבות את החשיבה. בחידת לוגיקה עם שבעה מהנדסים ו-22 רמזים מילאו שניהם נכון את כל 28 התאים. Opus 5.5 נזקק ל-65 שניות, ל-7,573 טוקנים בפלט ולעלות של 0.16 דולר; Opus 5 נזקק ל-108 שניות, ל-10,621 טוקנים ולעלות של 0.27 דולר, כלומר 43% פחות עבור אותה תשובה.
משחק האבנים: אותה תוצאה בפחות טוקנים
במשחק האבנים עם זיכרון השיגו שני המודלים שלוש תשובות נכונות מתוך שלוש. השחקן הראשון מפסיד מ-200 אבנים, גדלים מ-120 עד 500 הם מפסידים, והגודל המפסיד הקטן ביותר מעל 340 הוא 344. הפער היה בנפח החשיבה: Opus 5.5 סיים ב-215 שניות עם 28,740 טוקנים בעלות של 0.58 דולר, ואילו Opus 5 נזקק ל-624 שניות, ל-74,981 טוקנים ולעלות של 1.88 דולר. זה 62% פחות טוקנים ו-69% פחות עלות עבור אותה תשובה.
המשימה שאף מודל לא פתר
את בעיית סידור משימות הפריסה, שבה התשובות הנכונות הן 27, 1,695 ו-159,019, לא פתר אף אחד מהמודלים. במגבלת פלט של 48,000 טוקנים בזבזו שניהם את כל התקציב על חשיבה ולא השיבו כלל. לאחר העלאת המגבלה ל-128,000 טוקנים ניצל Opus 5 את כולם, פעל יותר מ-25 דקות ועצר בלי תשובה. Opus 5.5 עצר ב-112,733 טוקנים לאחר 19 דקות, אבל ה-API החזיר סיבת עצירה של סירוב וללא טקסט. בפרומפט אין שום תוכן רגיש, ולכן הכותב מייחס זאת לטעות של מסנן הבטיחות של Anthropic.
מה זה אומר בפועל
בסך הכול צרך Opus 5.5 1,701 טוקנים בקלט ו-197,046 בפלט, ואילו Opus 5 צרך 1,693 ו-261,602. העלות הסתכמה ב-3.95 דולר מול 6.55 דולר, וההוצאה הכוללת של המבחן עמדה על 10.50 דולר. קצב הכתיבה היה 103.4 טוקנים בשנייה מול 93.1, כלומר כ-11% מהיר יותר, פחות מ-30% שהחברה מצהירה עליהם. ההמלצה פשוטה: מי שמפעיל היום את Opus 5 יקבל מ-Opus 5.5 אותן תוצאות בפחות כסף ובפחות המתנה. כדאי לקבוע מגבלת פלט קשיחה, משום ששני המודלים מסוגלים לחשוב 20 דקות ויותר ולחזור בלי דבר, ולמשימות ספירה עדיף לתת למודל כלי להרצת קוד.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.