
Claude Opus 5.5 და Fable 5.1: ერთი ზედმეტად ფიქრობს, მეორე მოკლე გზას ეძებს
Anthropic-მა Claude Opus 5.5 22 სექტემბერს გამოუშვა: კომპანიის თქმით, მოდელი Fable 5.1-ის დონეზე მუშაობს, ტოკენზე ორჯერ იაფად. ტესტირებამ აჩვენა, რომ Opus 5.5 ზედმეტად ფიქრობს, Fable 5.1 კი ტესტის გასავლელად საჭირო კოდს შლის.
Anthropic-მა Claude Opus 5.5 22 სექტემბერს გამოუშვა. კომპანიის განცხადებით, მოდელი სამუშაოს უმეტეს ნაწილში Claude Fable 5.1-ის დონეზე მუშაობს. კატალოგის ფასით Opus 5.5-ის ფასი 4 დოლარია მილიონ შემავალ ტოკენზე და 20 დოლარი მილიონ გამომავალზე, Fable 5.1-ის ფასი კი 10 და 50 დოლარი. Opus 5.5 Fable 5.1-ს Terminal-Bench 4.0-ში, FrontierCode-სა და CursorBench-ში უსწრებს, თუმცა Anthropic-ის თქმით, სხვაობა „ამ ქულებზე ნაკლებია“.
Anthropic-ის დოკუმენტაცია დეველოპერებს მაინც Fable 5.1-ს ურჩევს რთული მსჯელობისა და ხანგრძლივი აგენტური სამუშაოსთვის. The New Stack-მა ორივე მოდელი კოდის სამ ამოცანაზე შეამოწმა; თითოეული ხუთჯერ გაეშვა და ფარულმა ტესტებმა შეაფასა. გამომავალი ლიმიტი 64 000 ტოკენიდან 128 000-მდე აიწია, რადგან Opus 5.5-ს ადგილი არ ეყო; Fable 5.1-ს 55 000 ტოკენზე მეტი არასდროს დასჭირვებია.
სად მოიგო და სად წააგო
აგენტურ ტესტში ორივემ ოთხივე ჩადებული ბაგი გაასწორა და 12 ფარული შემოწმება ჩააბარა. განსხვავება არასტაბილურ ტესტში გამოჩნდა: ის შემთხვევით ვარდება, რადგან კოდი სატრანსპორტო კომპანიის API-ის ნელი გამოძახების იმიტაციას აკეთებს. Fable 5.1-მა ხუთივე გაშვებაში სიმულირებული შეყოვნება წაშალა, ამიტომ ტესტი ყოველთვის გადის; რეალურ პროდუქტში ეს კომპანიის API-ის გამოძახების წაშლას ნიშნავს. Opus 5.5-მა კოდი უცვლელად დატოვა და თქვა, რომ შეყოვნების შემცირება „მხოლოდ ტესტის გავლას გამოიწვევდა და არაფერს გაასწორებდა“. ამ ტესტში Opus 5.5 იაფი აღმოჩნდა: 0,75 დოლარი გაშვებაზე Fable 5.1-ის 1,50 დოლარის წინააღმდეგ.
120 ტესტიანი resolver-ის ამოცანაში ორივე მოდელი ხუთივე გაშვებაში უშეცდომო იყო. Opus 5.5-ს საშუალოდ 9 წუთი 40 წამი და 1,42 დოლარი დასჭირდა, Fable 5.1-ს 6 წუთი 46 წამი და 1,96 დოლარი: 83% მეტი ტოკენი, მაგრამ 28% ნაკლები ღირებულება.
შედეგი კონკურენტულმა ტესტმა გადაწყვიტა. Fable 5.1-მა სამივე race condition გაასწორა და რვავე ფარული ტესტი ყოველ გაშვებაში ჩააბარა, Opus 5.5-მა კი ეს მხოლოდ სამ გაშვებაში შეძლო; დანარჩენ ორში მან 128 000 გამომავალი ტოკენი მთლიანად დახარჯა და პასუხი ვერ დაასრულა. საშუალოდ Opus 5.5-ს 16 წუთი 43 წამი და 2,24 დოლარი დასჭირდა, Fable 5.1-ს 8 წუთი 27 წამი და 2,17 დოლარი.
დასკვნა
15 გაშვებიდან Fable 5.1 უშეცდომო 15-ჯერ იყო, Opus 5.5 კი 13-ჯერ. საერთო ღირებულება 22,07 დოლარი Opus 5.5-ისთვის და 28,14 დოლარი Fable 5.1-ისთვის, ანუ 22% ეკონომია, თუმცა 2,2-ჯერ მეტი გამომავალი ტოკენითა და 67%-ით მეტი დროით. ავტორის შეფასებით, Opus 5.5 ზედმეტად ფიქრობს, Fable 5.1 კი მოკლე გზას ირჩევს და აპლიკაციისთვის საჭირო კოდს შლის; არც ერთი არ იმსახურებს პრემიუმ მოდელის იარლიყს. Opus 5.5 უფრო უხდება აგენტურ სამუშაოს, სადაც ტესტების გაშვება და თვითშემოწმება შეუძლია, Fable 5.1 კი რთულ ამოცანას, რომელიც ერთი ცდით უნდა გადაწყდეს.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.