Geri qayıt
Copilot GitHub-ın AI kod nəzərdən keçirmə benchmark-ində birinci yeri tutub, müstəqi test başqa nəticə verir
SiTech AI Team2 dəq oxu

Copilot GitHub-ın AI kod nəzərdən keçirmə benchmark-ində birinci yeri tutub, müstəqi test başqa nəticə verir

GitHub-ın Copilot şirkətin öz AI kod nəzərdən keçirmə benchmark-ində yaxşı nəticə göstərdi, lakin müstəqi qiymətləndirmə başqa nəticə verdi. Bu, AI alətlərinin özünə qiymət verilməsinə dair sualları gətirib çıxarır.

Benchmark-lər arasındakı ziddiyyət sualları gətirib çıxarır

GitHub-ın Copilot şirkətin öz AI kod nəzərdən keçirmə benchmark-ində birinci yeri tutub, The New Stack hesabatına görə. Lakin eyni texnologiyanın müstəqi benchmark-i başqa bir təsvir göstərdi və bu, AI əsaslı kod nəzərdən keçirmə alətlərini qiymətləndirərkən proqramçıların hər hansı çətinliklər qarşısında durduğunu aydın edir.

GitHub-ın daxili nəticələri ilə müstəqi qiymətləndirmə nəticələri arasındakı fərq proqram təminatı sənayesində artan narahatlığı vurğulayır: istehsalçılar öz məhsullarını qiymətləndirdikdə, nəticələr üçüncü tərəf tərəfindən ölçülmüş real işlə uyğunlaşmaya bilər.

Özünə qiymət verilmə problemi

AI kod yazma alətlərini yaradan şirkətlər tez-tez məhsullarını ən yaxşı işıqda göstərən benchmark-lər dərc edir. Belə benchmark-lər faydalı ola bilər, lakin onlar bu alətlərin inkişaf qruplarının qarşılaşdığı müxtəlif kod bazaları, dillər və nəzərdən keçirmə ssenarilərində necə işlədiyini əks etdirməyə bilər.

Müstəqi benchmark-lər daha neytral qiymətləmin təmin edilməsi üçün yaradılır, lakin onlar da metodologiya, test məlumatları və qiymətləndirmə meyarlarına görə fərqlənə bilər. GitHub-ın öz nəticələri ilə müstəqi xülasələr arasındakı fərq göstərir ki, heç bir benchmark tam şəkildə əhatə etmir.

Bu proqramçılar üçün nə deməkdir

AI kod nəzərdən keçirmə alətlərini qiymətləndirən mühəndis qrupları üçün əsas nəticə budur ki, bir neçə məlumat nöqtəsi vacibdir. Yalnız istehsalçı tərəfindən dərc edilmiş benchmark-lərə etibar etmək qeyri-kamil məlumat əsasında qərarlar qəbul etmə riski yaradır. Müstəqi qiymətləndirmələr, kolleglərin nəzərdən keçirmələri və qrupun öz kod bazasında praktiki testləri birlikdə daha tam təsvir yaradır.

Bu vəziyyət həmçinin AI alətləri bazarında daha geniş tendensiyanı əks etdirir: məhsulun sürətli inkişafı tez-tez standartlaşdırılmış və geniş tanınan qiymətləndirmə metodlarının formalaşmasından sürətlidir. AI kod nəzərdən keçirmə proqram təminatı inkişafının iş prosesləridə getdikcə daha mərkəzi rol oynadığı üçün, sənayeyə daha şəffaf və müstəqil yoxlanılan benchmark-lər lazım ola bilər.

Mənbələr: Thenewstack

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.