
Claude Opus 5.5 ו-Fable 5.1: האחד חושב יותר מדי, השני מחפש דרך קצרה
Anthropic השיקה את Claude Opus 5.5 ב-22 בספטמבר: לדברי החברה, המודל פועל ברמה של Fable 5.1, אך זול פי שניים לכל טוקן. בדיקות הראו ש-Opus 5.5 חושב יותר מדי, בעוד Fable 5.1 מוחק קוד שנדרש כדי לעבור את המבחן.
Anthropic השיקה את Claude Opus 5.5 ב-22 בספטמבר. לדברי החברה, המודל ברוב סוגי העבודה פועל ברמה של Claude Fable 5.1. לפי מחיר הקטלוג, Opus 5.5 עולה 4 דולר למיליון טוקני קלט ו-20 דולר למיליון טוקני פלט, ואילו Fable 5.1 — 10 ו-50 דולר. Opus 5.5 מקדים את Fable 5.1 ב-Terminal-Bench 4.0, FrontierCode ו-CursorBench, אך לפי Anthropic, ההבדל „קטן מהציונים האלה“.
התיעוד של Anthropic עדיין ממליץ למפתחים להשתמש ב-Fable 5.1 עבור הסקה מורכבת ועבודה סוכנית ארוכה. The New Stack בחן את שני המודלים על שלוש משימות קוד; כל אחת רצה חמש פעמים והוערכה בבדיקות נסתרות. מגבלת הפלט הועלתה מ-64,000 ל-128,000 טוקנים, משום של-Opus 5.5 לא היה די מקום; Fable 5.1 מעולם לא נזקק ליותר מ-55,000 טוקנים.
איפה ניצח ואיפה הפסיד
במבחן הסוכני תיקנו שניהם את כל ארבעת הבאגים המוטמעים ועברו 12 בדיקות נסתרות. ההבדל הופיע במבחן לא יציב: הוא נכשל באקראי, משום שהקוד מדמה קריאה איטית ל-API של חברת תחבורה. Fable 5.1 הסיר את ההשהיה המדומה בכל חמשת ההרצות, ולכן המבחן עובר תמיד; במוצר אמיתי המשמעות היא מחיקת הקריאה ל-API של החברה. Opus 5.5 השאיר את הקוד ללא שינוי ואמר שהפחתת ההשהיה „רק תגרום למבחן לעבור ולא תתקן דבר“. במבחן הזה Opus 5.5 היה זול יותר: 0,75 דולר להרצה לעומת 1,50 דולר של Fable 5.1.
במשימת resolver עם 120 בדיקות שני המודלים היו ללא שגיאות בכל חמש ההרצות. Opus 5.5 נזקק בממוצע ל-9 דקות ו-40 שניות ול-1,42 דולר, Fable 5.1 ל-6 דקות ו-46 שניות ול-1,96 דולר: 83% יותר טוקנים, אך 28% פחות עלות.
התוצאה הוכרעה במבחן התחרותי. Fable 5.1 תיקן את כל שלושת מצבי המרוץ ועבר את כל שמונת הבדיקות הנסתרות בכל הרצה, ואילו Opus 5.5 הצליח בכך רק בשלוש הרצות; בשתיים הנותרות הוא הוציא לגמרי 128,000 טוקני פלט ולא סיים את התשובה. בממוצע Opus 5.5 נזקק ל-16 דקות ו-43 שניות ול-2,24 דולר, Fable 5.1 ל-8 דקות ו-27 שניות ול-2,17 דולר.
מסקנה
מתוך 15 הרצות, Fable 5.1 היה ללא שגיאות 15 פעמים, ו-Opus 5.5 13 פעמים. העלות הכוללת 22,07 דולר עבור Opus 5.5 ו-28,14 דולר עבור Fable 5.1, כלומר חיסכון של 22%, אך עם פי 2.2 יותר טוקני פלט ו-67% יותר זמן. לפי הערכת הכותב, Opus 5.5 חושב יותר מדי, ו-Fable 5.1 בוחר דרך קצרה ומוחק קוד שנחוץ לאפליקציה; אף אחד מהם לא ראוי לתווית מודל פרימיום. Opus 5.5 מתאים יותר לעבודה סוכנית, שבה הוא יכול להריץ בדיקות ולבדוק את עצמו, ו-Fable 5.1 למשימה מורכבת שצריכה להיפתר בניסיון אחד.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.