უკან დაბრუნება
Copilot-მა GitHub-ის AI კოდის მიმოხილვის ბენჩმარკში პირველი ადგილი დაიკავა, დამოუკიდებელი ტესტი სხვა რამეს ამბობს
SiTech AI Team2 წთ. საკითხავი

Copilot-მა GitHub-ის AI კოდის მიმოხილვის ბენჩმარკში პირველი ადგილი დაიკავა, დამოუკიდებელი ტესტი სხვა რამეს ამბობს

GitHub-ის Copilot-მა კომპანიის საკუთარ AI კოდის მიმოხილვის ბენჩმარკზე კარგი შედეგი აჩვენა, თუმცა დამოუკიდებელმა შეფასებამ სხვა შედეგი მისცა, რაც AI ინსტრუმენტების თვითშეფასებისადმი კითხვებს აჩენს.

ბენჩმარკებს შორის შეუთანხმებლობა კითხვებს აჩენს

GitHub-ის Copilot-მა კომპანიის საკუთარ AI კოდის მიმოხილვის ბენჩმარკში პირველი ადგილი დაიკავა, The New Stack-ის რეპორტის მიხედვით. თუმცა, იმავე ტექნოლოგიის დამოუკიდებელმა ბენჩმარკმა სხვა სურათს გვაჩვენა, რაც ცხადყოფს, თუ რა სირთულეების წინაშე დგანან დეველოპერები AI-ზე დაფუძნებული კოდის მიმოხილვის ინსტრუმენტების შეფასებისას.

სხვაობა GitHub-ის შიდა შედეგებსა და დამოუკიდებელი შეფასების შედეგებს შორის ხაზს უსვამს პროგრამული უზრუნველყოფის ინდუსტრიაში მზარდ შეშფოთებას: როცა მწარმოებლები საკუთარ პროდუქტებს აფასებენ, შედეგები შესაძლოა არ ემთხვეოდეს მესამე მხარის მიერ გაზომილ რეალურ მუშაობას.

თვითშეფასების პრობლემა

კომპანიები, რომლებიც AI კოდირების ინსტრუმენტებს ქმნიან, ხშირად აქვეყნებენ ბენჩმარკებს, რომლებიც მათ პროდუქტებს საუკეთესო შუქზე წარმოაჩენენ. მართალია, ასეთი ბენჩმარკები სასარგებლო შეიძლება იყოს, მაგრამ ისინი შეიძლება არ ასახავდეს, როგორ მუშაობენ ეს ინსტრუმენტები მრავალფეროვან კოდბაზებზე, ენებსა და მიმოხილვის სცენარებში, რომლებსაც დეველოპმენტის გუნდები აწყდებიან.

დამოუკიდებელი ბენჩმარკები უფრო ნეიტრალური შეფასების უზრუნველსაყოფად იქმნება, მაგრამ ისინიც შეიძლება განსხვავდებოდეს მეთოდოლოგიის, სატესტო მონაცემებისა და შეფასების კრიტერიუმების მიხედვით. სხვაობა GitHub-ის საკუთარ შედეგებსა და დამოუკიდებელ დასკვნებს შორის მიუთითებს, რომ არც ერთი ბენჩმარკი არ ყვება სრულ ამბავს.

რას ნიშნავს ეს დეველოპერებისთვის

საინჟინრო გუნდებისთვის, რომლებიც AI კოდის მიმოხილვის ინსტრუმენტებს აფასებენ, მთავარი დასკვნა ისაა, რომ მნიშვნელობა აქვს მონაცემთა მრავალ წერტილს. მხოლოდ მწარმოებლის მიერ გამოქვეყნებულ ბენჩმარკებზე დაყრდნობა არასრული ინფორმაციის საფუძველზე გადაწყვეტილების მიღების რისკს ქმნის. დამოუკიდებელი შეფასებები, კოლეგების მიმოხილვები და გუნდის საკუთარ კოდბაზაში პრაქტიკული ტესტირება ერთად უფრო სრულ სურათს ქმნის.

ეს სიტუაცია ასევე ასახავს AI ინსტრუმენტების ბაზარზე უფრო ფართო ტენდენციას, სადაც პროდუქტის სწრაფი განვითარება ხშირად უსწრებს სტანდარტიზებული და ფართოდ აღიარებული შეფასების მეთოდების ჩამოყალიბებას. რადგან AI კოდის მიმოხილვა პროგრამული უზრუნველყოფის განვითარების სამუშაო პროცესებში უფრო მეტად ცენტრალური ხდება, ინდუსტრიას შეიძლება უფრო გამჭვირვალე და დამოუკიდებლად გადამოწმებული ბენჩმარკები დასჭირდეს.

წყაროები: Thenewstack

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.