უკან დაბრუნება
GPT-6 Sol და Claude Opus 5.5: იაფია მხოლოდ მაშინ, როცა შედეგი მეორდება
SiTech AI Team3 წთ. საკითხავი

GPT-6 Sol და Claude Opus 5.5: იაფია მხოლოდ მაშინ, როცა შედეგი მეორდება

The New Stack-მა OpenAI-ს GPT-6 Sol და Anthropic-ის Claude Opus 5.5 სამ რთულ დეველოპერულ ტესტზე თითო ხუთჯერ გამოსცადა. Sol დაახლოებით ექვსჯერ იაფი აღმოჩნდა, თუმცა 15 ცდიდან სამში შეცდომა დაუშვა, Opus 5.5 კი ყველა ცდაზე უშეცდომო იყო.

OpenAI-მ GPT-6 Sol 22 სექტემბერს გამოუშვა და განაცხადა, რომ ბიზნეს პროცესების ამოცანებში ის Claude Opus 5-ს თითო დავალების ღირებულების 9%-ად სჯობს: Zapier-ის AutomationBench-ზე Sol 33,2%-ს აგროვებს, Opus 5 კი 26,9%-ს. Anthropic-მა იმავე დღეს გამოუშვა Claude Opus 5.5, ამიტომ The New Stack-ის ჟურნალისტმა Jessica Wachtel-მა ტესტირება ახალ მოდელზე ჩაატარა.

სიითი ფასებით Sol მილიონ შემავალ ტოკენზე 2 დოლარი და მილიონ გამომავალ ტოკენზე 10 დოლარი ღირს, GPT-5.6 Sol-ის ფასის ნახევარი. Claude Opus 5.5-ს 4 და 20 დოლარი უჯდება, ამიტომ მეტი ტოკენის ხარჯის შემთხვევაშიც Sol შეიძლება იაფი აღმოჩნდეს.

სამი ტესტი, თითო ხუთჯერ

პირველი რაუნდი ფრედ დასრულდა: ორივემ Python-ის ბილინგის სერვისში სამი ჩამალული ხარვეზი იპოვა, 40 ჩავარდნილი CI ამოცანა დაახარისხა და ყალბ SDK-ზე 20 კითხვას ერთი მოგონილი მეთოდის გარეშე უპასუხა. რთულმა ვარიანტებმაც, 3 664 ხაზიანმა ავარიის ანგარიშმა და 120 ფარული ტესტით შეფასებულმა სპეციფიკაციამ, ფრე მოიტანა. მოდელები გამეორებულმა გაშვებებმა დააშორა.

ორივეს API-ით, ერთნაირი მოთხოვნებითა და მაქსიმალური პარამეტრით მიმართეს, თითო ტესტი ხუთჯერ. CI-ის დახარისხებაზე მოდელი 40 ჩავარდნილი ამოცანისთვის წყვეტს, ხელახლა სცადოს, დაბლოკოს თუ მორიგე გამოიძახოს. ავარიის ლოგები ხუთი სერვისის 3 664 ხაზსა და შვიდ კითხვას მოიცავს, გადამწყვეტის ტესტი კი ორგვერდიანი სპეციფიკაციიდან კოდის გაშვების გარეშე წერას მოითხოვს.

რას აჩვენებს ციფრები

CI-ის დახარისხება OpenAI-ს მტკიცებას ყველაზე ახლოს დგას და ორივე მოდელი ხუთივე ცდაზე უშეცდომო იყო. Opus 5.5-ს საშუალოდ 1 წუთი 27 წამი, 11 127 გამომავალი ტოკენი და 0,24 დოლარი სჭირდებოდა, Sol-ს 18 წამი, 1 143 ტოკენი და 0,02 დოლარი. ეს ღირებულების 8%-ია და ემთხვევა OpenAI-ს მიერ რეკლამირებულ 9%-ს.

ავარიის ლოგებზე სურათი შეიცვალა: Opus 5.5 ხუთივე გაშვებაზე უშეცდომო იყო, Sol ორზე. ორჯერ გამოტოვა ერთი და იმავე მომხმარებელი, რომლის გადახდა ხელახალი ცდის წარმატებიდან 52 წამის შემდეგ დადასტურდა, ერთხელ კი ჩავარდნილი შეკვეთები 28-ის ნაცვლად 27-ად დათვალა. Opus 5.5-ს საშუალოდ 6 წუთი 44 წამი, 53 308 გამომავალი ტოკენი და 1,68 დოლარი უჯდებოდა, Sol-ს 1 წუთი 41 წამი, 7 073 ტოკენი და 0,30 დოლარი. იგივე ლოგს Sol 25%-ით ნაკლები შემავალი ტოკენით კითხულობდა.

გადამწყვეტის ტესტზე Opus 5.5-მა ყველა გაშვება ჩააბარა, Sol-მა ხუთიდან ოთხი: 78-ე ხაზზე დარჩენილმა ზედმეტმა ფრჩხილმა მოდული იმპორტზე ჩამოაშალა და 120-ვე ტესტი ჩავარდა. Opus 5.5-ს საშუალოდ 9 წუთი 40 წამი, 70 687 ტოკენი და 1,42 დოლარი უჯდებოდა, Sol-ს 6 წუთი 28 წამი, 21 435 ტოკენი და 0,22 დოლარი.

იაფი, მაგრამ არა ყოველთვის სწორი

15 გაშვებიდან Opus 5.5 ყოველ ჯერზე უშეცდომო იყო, Sol 12-ჯერ. Sol-ის 15 გაშვება სულ 2,68 დოლარი დაჯდა, Opus 5.5-ის 16,72 დოლარის დაახლოებით 16%. Wachtel სამუშაოს შეცდომის ფასით ყოფს: Sol მაღალი მოცულობის სამუშაოზე, სადაც შედეგს ადამიანი ან ტესტები ამოწმებს, ასეთ ფასებზე ორჯერ გაშვებაც შეიძლება; Opus 5.5 მაშინ, როცა შეცდომა ძვირია და შედეგს არავინ ამოწმებს. Sol-ის გამოტოვებები გადამოწმებას ადვილად რჩება მიღმა: მომხმარებელი დაბრუნების სიაში ან ფაილი, რომელიც არ იმპორტირდება.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.