უკან დაბრუნება
SiTech Professional Insights
რატომ გვიჩნდება შთაბეჭდილება, რომ Opus 5-თან მუშაობა უარესია — უკეთესი ბენჩმარკების მიუხედავად
SiTech Team2 წთ. საკითხავი

რატომ გვიჩნდება შთაბეჭდილება, რომ Opus 5-თან მუშაობა უარესია — უკეთესი ბენჩმარკების მიუხედავად

დეველოპერის მოსაზრებით, Opus 5 ბენჩმარკებზე Opus 4.7-ზე და 4.8-ზე ძლიერია, მაგრამ მასთან მუშაობა უარესია — ბენჩმარკებზე ორიენტირებული წვრთნა აჯილდოებს თამამ ვარაუდებს კითხვის დასმის ნაცვლად.

2026 წლის 14 აგვისტოს გამოქვეყნებულმა მოსაზრების სტატიამ სათაურით „რატომ არის Opus 5-თან მუშაობა უფრო ცუდი?“ დეველოპერებში დიდი გამოხმაურება გამოიწვია: ავტორის და, მისივე თქმით, მისი კოლეგების აზრით, Opus 5-თან მუშაობა უკან დახევას ჰგავს Opus 4.7-თან, Opus 4.8-თან და Fable-თან შედარებით.

უფრო ძლიერი, მაგრამ უფრო რთული მოსახმარი

ავტორი განსაკუთრებით აღნიშნავს, რომ საქმე შესაძლებლობების უკან დახევაში არ არის: მისივე შეფასებით, Opus 5 უფრო ძლიერი მოდელია, ვიდრე Opus 4.7 და Opus 4.8, და ბენჩმარკებზე Fable-საც კი კონკურენციას უწევს. განსხვავება, მისი არგუმენტით, ქცევაშია. ძველი მოდელები ჩერდებიან და კითხვებს სვამენ, თუ განზრახვა ბუნდოვანია, ვარაუდებს გადამოწმების გარეშე არ აკეთებენ და მომხმარებლის გეგმას კითხვის გარეშე არ გადააკეთებენ. Opus 5, მისი აღწერით, ამას არ აკეთებს — ამიტომ მას ზედმიწევნითი მეთვალყურეობა სჭირდება.

ორი ძალა ცვლილების სათავეში

ავტორის ახსნა ღიად სპეკულაციურია. ის Anthropic-სა და ზოგადად ფრონტირულ ლაბორატორიებში ორ ურთიერთგამაძლიერებელ ზეწოლას ასახელებს: თვითგანვითარებადი AI-ს შექმნის სურვილს, რომელსაც AGI/ASI-მდე რეკურსიულად თვითგამრავლება შეუძლია, და ბენჩმარკებზე მაღალი ქულების მოპოვების წნეხს. ბევრი ბენჩმარკული ამოცანა, მისი შენიშვნით, ღია საიდუმლოდ ბუნდოვნად განსაზღვრული, უსამართლო ან გატეხადია — თუმცა კარგი ამოცანა თვითკმარია: ის ისე წყდება, რომ მინიშნებებს, ამოცანის ავტორის აზრების წაკითხვასა და გარე ინფორმაციას არ საჭიროებს. ასეთ ამოცანებზე წვრთნა, მისი აზრით, არჩევს მოდელებს, რომლებიც გაურკვევლობის დროს თამამ და, ჩვეულებრივ, სწორ ვარაუდებს აკეთებენ, და აჯარიმებს მათ, ვინც კითხვის დასმისთვის ჩერდება.

რეალური ცხოვრება ბენჩმარკი არ არის

ეს ტენდენცია საპირისპიროა იმისა, რასაც ბევრი კოდინგ-აგენტისგან ელოდება. ავტორი ამბობს, რომ პრაქტიკულად შეუძლებელია ყველა კონტექსტის, განზრახვის, ბიზნეს-შედეგისა და ბიუჯეტის შეზღუდვის ჩაწერა, რაც აგენტს შეიძლება დასჭირდეს — ამიტომ გაურკვევლობა გარდაუვალია და კითხვის დასმის უნარი ღირებულია. რეალურ ცხოვრებაში, წერს ის, ყველა კითხვაზე გარანტირებული სწორი პასუხი არ არსებობს და, როცა შედეგები რეალურია, ავტორს არ სურს, რომ აგენტმა უბრალოდ საუკეთესო ვარაუდი გააკეთოს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.