
Claude Opus 5.5 kod işlərini bitirməyi hədəfləyir, sadəcə başlamağı yox
Anthropic yeni Claude 5.5 ailəsinin ilk modeli Claude Opus 5.5-i təqdim edib; model inkişaf dövrünün daha böyük hissəsini əhatə edir. Mütəxəssislər xəbərdarlıq edir: "tamamlandı" "doğru" demək deyil.
Anthropic-in yeni Claude 5.5 ailəsinin ilk modeli Claude Opus 5.5 daha sürətli kod tamamlayıcısı kimi deyil, tapşırığı dizayn spesifikasiyası yazmaqdan sazlamağa, kod generasiyasından testlərə qədər bütün inkişaf dövrü boyunca apara bilən agent kimi təqdim olunur. The New Stack-in məlumatına görə, əsas məqam işə daha tez başlamaq deyil, işi bitirməkdir.
Dövrü bağlayan agent
Tərtibatçıların təsvir etdiyi dəyişiklik arxitektura xarakteri daşıyır. HasData həmtəsisçisi Sergey Yermakoviç deyir ki, terminal "artıq tərtibatçının yaradılmış kodu yerləşdirdiyi yer deyil — terminal modelin iş məkanının bir hissəsinə çevrilir". Model əmrləri işə saldığı, uğursuzluqları araşdırdığı, faylları dəyişdirdiyi və nəticəni yoxlaya bildiyi üçün yarımçıq işi mühəndisə qaytarmaq əvəzinə dövrü özü bağlayır. Onun sözlərinə görə, bu, kiçik amma tamamlanmış tapşırıqları daha dəyərli edir: uğursuz bir testi düzəlt, bir asılılığı yenilə, yoxla və növbətiyə keç.
Miqrasiyalar, auditlər və qiymət
Anthropic iddia edir ki, Opus 5.5 bütün kod bazasını əhatə edən miqrasiyalar və auditlər kimi uzun, geniş işlərdə xüsusilə güclüdür. Erkən test edənlərdən biri 200 000 sətirlik kod bazasını üç saatdan az müddətdə yoxlayıb düzəldib, halbuki Opus 5 üçün 20 saatdan çox vaxt və 2,5 dəfə çox token tələb olunub. Daxili testdə Opus 5.5 və Fable 5.1 HAProxy-ni C-dən Rust-a yenidən yazıb reqressiya testlərini keçib; Opus 5.5 12 saat əvəzinə 9,5 saatda tamamlayıb. Qiymət milyon giriş tokeni üçün 4 dollar, milyon çıxış tokeni üçün 20 dollardır — Opus 5-dən 20% aşağı, keş oxuma isə 60% ucuzlaşıb.
"Tamamlandı" "doğru" demək deyil
The New Stack ilə söhbət edən mütəxəssislər imkanları müsbət qarşılayır, amma dar boğazın artıq generasiya deyil, yoxlama olduğunu xəbərdarlıq edirlər. Müstəqil SRE və AI etibarlılıq arxitektoru Akaş Takur deyir ki, bu səviyyəli modellər layihəni bitirilə bilən hissələrə bölməkdə həqiqətən yaxşıdır, lakin "tamamlandı" ilə "doğru" eyni şey deyil — bitmiş görünən tapşırıq çox vaxt komandaya sonradan baha başa gələn tapşırıqdır, ona görə qazanc insanı aradan çıxarmaq deyil, onu kod yazmaqdan kodu yoxlamağa keçirməkdir. Abbyy-də AI strategiyası üzrə vitse-prezident Maksim Vermeir avtotamamlama dövrünün bitdiyini və artıq bütöv bir Jira tapşırığının tamamlanmasının gözlənildiyini söyləyir.
Qoruyucu tədbirlər və yönləndirmə
Anthropic bildirir ki, Opus 5.5 buraxılışdan əvvəl Frontier Design və METR də daxil olmaqla xarici təşkilatlar tərəfindən test edilib və şirkətin ən hərtərəfli uyğunluq testində indiyədək ən güclü modeldir; son kibertəhlükəsizlik hadisələrinə səbəb olan davranışlarda irəliləyiş var. Qoruyucu tədbirlər işə düşdükdə sorğular şəffaf şəkildə başqa modelə yönləndirilir: kibertəhlükəsizlik tapşırıqlarının çoxu Opus 4.8-ə, biologiya və frontier LLM inkişafı sorğuları isə Opus 5-ə gedir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.