Վերադառնալ
Copilot-ը առաջին տեղն է զբաղեցրել GitHub-ի AI կոդի վերանայման բենչմարկում, սակայն անկախ թեստը այլ արդյունք է տալիս
SiTech AI Team2 րոպե ընթերցում

Copilot-ը առաջին տեղն է զբաղեցրել GitHub-ի AI կոդի վերանայման բենչմարկում, սակայն անկախ թեստը այլ արդյունք է տալիս

GitHub-ի Copilot-ը ընկերության սեփական AI կոդի վերանայման բենչմարկում լավ արդյունք ցույց տվեց, սակայն անկախ գնահատումը այլ արդյունք տվեց, ինչը AI գործիքների ինքնագնահատման հարցեր է առաջացնում.

Բենչմարկների միջև անհամաձայնությունը հարցեր է առաջացնում

GitHub-ի Copilot-ը ընկերության սեփական AI կոդի վերանայման բենչմարկում առաջին տեղն է զբաղեցրել, The New Stack-ի հաշվետվության համաձայն: Սակայն նույն տեխնոլոգիայի անկախ բենչմարկը այլ պատկեր է ցույց տվել, ինչը պարզորոշ է անում, թե որ դժվարությունների առջև են կանգնում մշակողները AI-ի վրա հիմնված կոդի վերանայման գործիքները գնահատելիս:

GitHub-ի ներքին արդյունքների և անկախ գնահատման արդյունքների միջև տարբերությունը ընդգծում է ծրագրային ապահովման ոլորտում աճող մտահոգությունը. երբ արտադրողները գնահատում են իրենց սեփական արտադրանքը, արդյունքները կարող են չհամընկնել երրորդ կողմի կողմից չափված իրական աշխատանքի հետ:

Ինքնագնահատման խնդիրը

Ընկերությունները, որոնք ստեղծում են AI կոդավորման գործիքներ, հաճախ հրապարակում են բենչմարկներ, որոնք իրենց արտադրանքը լավագույն լույսի ներքո են ներկայացնում: Ճիշտ է, այդպիսի բենչմարկները կարող են օգտակար լինել, բայց դրանք կարող են չարտապատկերեն, թե ինչպես են աշխատում այդ գործիքները բազմազան կոդային բազաներում, լեզուներում և վերանայման սցենարներում, որոնց մշակման խմբերը բախվում են:

Անկախ բենչմարկները ստեղծվում են ավելի չեզոք գնահատման ապահովելու համար, բայց դրանք նույնպես կարող են տարբերվել մեթոդոլոգիայի, թեստային տվյալների և գնահաման չափորոշիչների համաձայն: GitHub-ի սեփական արդյունքների և անկախ եզրակացությունների միջև տարբերությունը ցույց է տալիս, որ ոչ մեկ բենչմարկ չի պատմում ամբողջ պատմությունը:

Ինչ է սա նշանակում մշակողների համար

Ճարտարագիտական խմբերի համար, որոնք գնահատում են AI կոդի վերանայման գործիքները, հիմնական եզրակացությունն այն է, որ տվյալների բազմաթիվ կետերն ունեն նշանակություն: Միայն արտադրողի կողմից հրապարակված բենչմարկներին ապավինելը անլրիվ տեղեկատվության հիման վրա որոշումներ կայացնելու ռիսկ է ստեղծում: Անկախ գնահատումները, գործընկերների վերանայումները և խմբի սեփական կոդային բազայում գործնական թեստավորումը միասին ավելի ամբողջական պատկեր են ստեղծում:

Այս իրավիճակը նաև արտապատկերում է AI գործիքների շուկայում ավելի լայն միտումը, որտեղ արտադրանքի արագ զարգացումը հաճախ առաջնորդում է ստանդարտացված և լայնորեն ճանաչված գնահաման մեթոդների ձևավորմանը: Քանի որ AI կոդի վերանայումը ծրագրային ապահովման զարգացման աշխատանքային գործընթացներում ավելի կենտրոնական է դառնում, ոլորտը կարող է ավելի թափանցիկ և անկախ ստուգված բենչմարկների կարիք ունենալ:

Աղբյուրներ: Thenewstack

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։