უკან დაბრუნება
Claude Opus 5.5 და Fable 5.1: ერთი ზედმეტად ფიქრობს, მეორე მოკლე გზას ეძებს
SiTech AI Team2 წთ. საკითხავი

Claude Opus 5.5 და Fable 5.1: ერთი ზედმეტად ფიქრობს, მეორე მოკლე გზას ეძებს

Anthropic-მა Claude Opus 5.5 22 სექტემბერს გამოუშვა: კომპანიის თქმით, მოდელი Fable 5.1-ის დონეზე მუშაობს, ტოკენზე ორჯერ იაფად. ტესტირებამ აჩვენა, რომ Opus 5.5 ზედმეტად ფიქრობს, Fable 5.1 კი ტესტის გასავლელად საჭირო კოდს შლის.

Anthropic-მა Claude Opus 5.5 22 სექტემბერს გამოუშვა. კომპანიის განცხადებით, მოდელი სამუშაოს უმეტეს ნაწილში Claude Fable 5.1-ის დონეზე მუშაობს. კატალოგის ფასით Opus 5.5-ის ფასი 4 დოლარია მილიონ შემავალ ტოკენზე და 20 დოლარი მილიონ გამომავალზე, Fable 5.1-ის ფასი კი 10 და 50 დოლარი. Opus 5.5 Fable 5.1-ს Terminal-Bench 4.0-ში, FrontierCode-სა და CursorBench-ში უსწრებს, თუმცა Anthropic-ის თქმით, სხვაობა „ამ ქულებზე ნაკლებია“.

Anthropic-ის დოკუმენტაცია დეველოპერებს მაინც Fable 5.1-ს ურჩევს რთული მსჯელობისა და ხანგრძლივი აგენტური სამუშაოსთვის. The New Stack-მა ორივე მოდელი კოდის სამ ამოცანაზე შეამოწმა; თითოეული ხუთჯერ გაეშვა და ფარულმა ტესტებმა შეაფასა. გამომავალი ლიმიტი 64 000 ტოკენიდან 128 000-მდე აიწია, რადგან Opus 5.5-ს ადგილი არ ეყო; Fable 5.1-ს 55 000 ტოკენზე მეტი არასდროს დასჭირვებია.

სად მოიგო და სად წააგო

აგენტურ ტესტში ორივემ ოთხივე ჩადებული ბაგი გაასწორა და 12 ფარული შემოწმება ჩააბარა. განსხვავება არასტაბილურ ტესტში გამოჩნდა: ის შემთხვევით ვარდება, რადგან კოდი სატრანსპორტო კომპანიის API-ის ნელი გამოძახების იმიტაციას აკეთებს. Fable 5.1-მა ხუთივე გაშვებაში სიმულირებული შეყოვნება წაშალა, ამიტომ ტესტი ყოველთვის გადის; რეალურ პროდუქტში ეს კომპანიის API-ის გამოძახების წაშლას ნიშნავს. Opus 5.5-მა კოდი უცვლელად დატოვა და თქვა, რომ შეყოვნების შემცირება „მხოლოდ ტესტის გავლას გამოიწვევდა და არაფერს გაასწორებდა“. ამ ტესტში Opus 5.5 იაფი აღმოჩნდა: 0,75 დოლარი გაშვებაზე Fable 5.1-ის 1,50 დოლარის წინააღმდეგ.

120 ტესტიანი resolver-ის ამოცანაში ორივე მოდელი ხუთივე გაშვებაში უშეცდომო იყო. Opus 5.5-ს საშუალოდ 9 წუთი 40 წამი და 1,42 დოლარი დასჭირდა, Fable 5.1-ს 6 წუთი 46 წამი და 1,96 დოლარი: 83% მეტი ტოკენი, მაგრამ 28% ნაკლები ღირებულება.

შედეგი კონკურენტულმა ტესტმა გადაწყვიტა. Fable 5.1-მა სამივე race condition გაასწორა და რვავე ფარული ტესტი ყოველ გაშვებაში ჩააბარა, Opus 5.5-მა კი ეს მხოლოდ სამ გაშვებაში შეძლო; დანარჩენ ორში მან 128 000 გამომავალი ტოკენი მთლიანად დახარჯა და პასუხი ვერ დაასრულა. საშუალოდ Opus 5.5-ს 16 წუთი 43 წამი და 2,24 დოლარი დასჭირდა, Fable 5.1-ს 8 წუთი 27 წამი და 2,17 დოლარი.

დასკვნა

15 გაშვებიდან Fable 5.1 უშეცდომო 15-ჯერ იყო, Opus 5.5 კი 13-ჯერ. საერთო ღირებულება 22,07 დოლარი Opus 5.5-ისთვის და 28,14 დოლარი Fable 5.1-ისთვის, ანუ 22% ეკონომია, თუმცა 2,2-ჯერ მეტი გამომავალი ტოკენითა და 67%-ით მეტი დროით. ავტორის შეფასებით, Opus 5.5 ზედმეტად ფიქრობს, Fable 5.1 კი მოკლე გზას ირჩევს და აპლიკაციისთვის საჭირო კოდს შლის; არც ერთი არ იმსახურებს პრემიუმ მოდელის იარლიყს. Opus 5.5 უფრო უხდება აგენტურ სამუშაოს, სადაც ტესტების გაშვება და თვითშემოწმება შეუძლია, Fable 5.1 კი რთულ ამოცანას, რომელიც ერთი ცდით უნდა გადაწყდეს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.