Geri qayıt
SiTech Professional Insights
Daha yaxşı benchmarklara baxmayaraq, Opus 5 ilə işləmək niyə daha pis hiss etdirir?
SiTech Team2 წთ. საკითხავი

Daha yaxşı benchmarklara baxmayaraq, Opus 5 ilə işləmək niyə daha pis hiss etdirir?

Tərtibatçının rəy məqaləsində iddia olunur ki, Opus 5 benchmarklarda Opus 4.7 və 4.8-dən daha qabiliyyətlidir, amma onunla işləmək daha pisdir — benchmark yönümlü təlim sual vermək əvəzinə əmin ehtimalları mükafatlandırır.

14 avqust 2026-cı ildə “Opus 5 ilə işləmək niyə daha pis hiss etdirir?” başlığı ilə dərc olunan rəy məqaləsi tərtibatçılar arasında geniş əks-səda doğurub: müəllifin və onun sözlərinə görə, söhbət etdiyi həmkarlarının fikrincə, Opus 5 ilə işləmək Opus 4.7, Opus 4.8 və Fable ilə müqayisədə geriyə addım kimi hiss olunur.

Daha qabiliyyətli, amma daha çətin

Müəllif xüsusilə vurğulayır ki, söhbət imkanlarda geriləmədən getmir: onun qiymətləndirməsinə görə, Opus 5 Opus 4.7 və Opus 4.8-dən daha qabiliyyətli modeldir və benchmarklarda hətta Fable ilə rəqabət aparır. Fərq, onun iddiasına görə, davranışdadır. Köhnə modellər niyyət aydın olmayanda dayanıb sual verir, yoxlamadan ehtimallar irəli sürmür və istifadəçinin planını soruşmadan yenidən şərh etmir. Opus 5 isə onun təsvirinə görə bunları etmir — buna görə diqqətli nəzarət tələb edir.

Dəyişikliyin arxasındakı iki qüvvə

İzahatı açıq şəkildə spekulyativdir. O, Anthropic-də və ümumiyyətlə öncül laboratoriyalarda bir-birini gücləndirən iki təzyiqə işarə edir: özünü təkmilləşdirən və AGI/ASI-yə doğru rekursiv yüksələ bilən süni intellekt yaratmaq istəyi və benchmarklarda yüksək nəticə toplama təzyiqi. Onun qeydinə görə, bir çox benchmark tapşırığının qeyri-müəyyən, ədalətsiz və ya sındırıla bilən olması hamıya məlum açıq sirrdir; lakin yaxşı tapşırıq özünü təmin edir — ipucları, tapşırıq müəllifinin fikirlərini oxumaq və xarici məlumat olmadan həll olunur. Bu cür tapşırıqlar üzərində təlim, onun fikrincə, qeyri-müəyyənlik şəraitində cəsarətli və adətən doğru ehtimallar irəli sürən modelləri seçir, sual vermək üçün dayananları isə cəzalandırır.

Real həyat benchmark deyil

Bu meyl istifadəçilərin kodlaşdırma agentindən gözlədiyinin tam əksidir. Müəllif iddia edir ki, agentə lazım ola biləcək bütün konteksti, niyyətləri, biznes nəticələrini və büdcə məhdudiyyətlərini yazıya almaq demək olar ki, mümkünsüzdür; buna görə qeyri-müəyyənlik qaçılmazdır və dayanıb sual vermək dəyərlidir. Real həyatda, yazır o, hər sualın zəmanətli düzgün cavabı yoxdur və nəticələr real olduqda agentin sadəcə ən yaxşı təxminini etməsini istəmir.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.