უკან დაბრუნება
Claude Opus 5.5 მსჯელობის ამოცანებზე იაფი და სწრაფია, თუმცა Opus 5-ზე უკეთესი არ არის
SiTech AI Team3 წთ. საკითხავი

Claude Opus 5.5 მსჯელობის ამოცანებზე იაფი და სწრაფია, თუმცა Opus 5-ზე უკეთესი არ არის

The New Stack-მა Anthropic-ის ორი მოდელი, Claude Opus 5.5 და Opus 5, მსჯელობის სამ რთულ ამოცანაზე შეადარა. ახალი მოდელი იაფი და სწრაფი აღმოჩნდა, თუმცა იგივე პასუხები მისცა, ხოლო სიჩქარის მატება კომპანიის განაცხადებულ 30%-ს ვერ მიუახლოვდა.

The New Stack-მა Anthropic-ის ორი მოდელი, Claude Opus 5.5 და Claude Opus 5, მსჯელობის სამ რთულ ამოცანაზე შეადარა. შედეგი მარტივია: ახალი მოდელი იაფი და სწრაფია, მაგრამ უფრო ჭკვიანი არ არის. ორივემ ორი ამოცანა სრულად გადაჭრა, მესამეზე კი პასუხი ვერცერთმა ვერ გასცა.

რას გვპირდება Anthropic

კომპანიის განცხადებით, Opus 5.5 ჩვეულებრივ დატვირთვაზე Opus 5-ზე 40%-ით იაფია და ტექსტს 30%-ით უფრო სწრაფად წერს. შესაძლებლობებით ის Claude Fable 5.1-ის დონეს უნდა აღწევდეს, ანუ წინა მოდელზე უკეთესი უნდა იყოს. API-ის ფასიც შემცირდა: მილიონი შემავალი ტოკენი 4 დოლარი ღირს, გამომავალი კი 20 დოლარი, მაშინ როცა Opus 5-ზე ეს 5 და 25 დოლარი იყო. თავად ფასდაკლება 20%-იან ეკონომიას იძლევა, დანარჩენი კი მოდელმა ტოკენების ნაკლები ხარჯვით უნდა მოიტანოს.

ლოგიკური ბადე იდენტური პასუხებით

ორივე მოდელი Anthropic-ის API-ით გამოიძახეს ერთი და იმავე მოთხოვნებით, ადაპტური აზროვნების რეჟიმში: Opus 5.5-ში აზროვნების გამორთვა შეუძლებელია. შვიდი ინჟინრისა და 22 მინიშნების მქონე ლოგიკური ბადე ორივემ 28-ივე უჯრით სწორად ამოხსნა. Opus 5.5-ს 65 წამი, 7 573 გამომავალი ტოკენი და 0,16 დოლარი დასჭირდა, Opus 5-ს კი 108 წამი, 10 621 ტოკენი და 0,27 დოლარი. იგივე პასუხი ახალ მოდელს 43%-ით იაფად დაუჯდა.

ქვების თამაში და აზროვნების მოცულობა

ქვების თამაშზე მეხსიერებით ორივემ სამივე კითხვას სწორად უპასუხა: 200 ქვის შემთხვევაში პირველი მოთამაშე მარცხდება, 120-დან 500 ქვამდე ზომები წაგებულია, ხოლო 340-ზე დიდი უმცირესი წაგებული ზომა 344-ია. სხვაობა აზროვნების მოცულობაში გამოჩნდა: Opus 5.5-მა 215 წამში, 28 740 ტოკენით და 0,58 დოლარად დაასრულა, Opus 5-მა კი 624 წამში, 74 981 ტოკენით და 1,88 დოლარად. ეს 62%-ით ნაკლები ტოკენი და 69%-ით დაბალი ღირებულებაა იმავე პასუხისთვის.

ამოცანა, რომელიც ვერცერთმა ვერ გადაჭრა

დეპლოის სამუშაოების გადალაგების ამოცანა, სადაც სწორი პასუხები 27, 1 695 და 159 019-ია, ორივე მოდელისთვის რთული აღმოჩნდა. როცა გამომავალი ტექსტის ლიმიტი 48 000 ტოკენი იყო, ორივემ მთელი ბიუჯეტი აზროვნებას დახარჯა და პასუხი არ გასცა. ლიმიტის 128 000-მდე გაზრდის შემდეგ Opus 5 ყველა ტოკენი ხარჯა, 25 წუთზე მეტს ფიქრობდა და პასუხის გარეშე შეჩერდა. Opus 5.5 კი 19 წუთში 112 733 ტოკენზე გაჩერდა, თუმცა API-მ პასუხი უსაფრთხოების ფილტრის გამო შეაჩერა. მოთხოვნაში საეჭვო არაფერია, ამიტომ ეს, სავარაუდოდ, შეცდომაა.

რას ნიშნავს ეს პრაქტიკაში

მთლიან ტესტზე Opus 5.5-მა 1 701 შემავალი და 197 046 გამომავალი ტოკენი დახარჯა, Opus 5-მა კი 1 693 და 261 602. ღირებულება 3,95 და 6,55 დოლარია, საერთო ხარჯი კი 10,50 დოლარი. წერის სიჩქარით Opus 5.5 წამში 103,4 ტოკენს აწარმოებდა, Opus 5 კი 93,1-ს, ანუ ის მხოლოდ 11%-ით უფრო სწრაფია და Anthropic-ის 30%-იან განაცხადს ვერ აღწევს. ავტორის რჩევა მკაფიოა: თუ კომპანია დღეს Opus 5-ს იყენებს, Opus 5.5-ზე გადასვლა ღირს, თუმცა გამომავალი ტოკენების მკაცრი ლიმიტი უნდა დააწესოს, ხოლო დათვლის ტიპის ამოცანებზე მოდელს კოდის გაშვების ინსტრუმენტი უნდა მისცეს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.