Վերադառնալ
SiTech
Claude-ի «կրող» բառապաշարը՝ տասը կլաստեր 461 հազար pull request-ում
SiTech AI Team3 წთ. საკითხავი

Claude-ի «կրող» բառապաշարը՝ տասը կլաստեր 461 հազար pull request-ում

GitHub-ի pull request նկարագրությունները միայն դրանց բառերով խմբավորող կորպուսը ցույց է տալիս՝ 2025-ի սկզբին ընտրանքի 0,7%-ը կազմող բառապաշարը 2026-ի կեսերին հասել է մոտ 39%-ի։

Անկախ տվյալների նախագիծը GitHub-ի pull request նկարագրությունները խմբավորում է ոչ թե հետազոտողի նախապես ընտրած պիտակներով, այլ այն բառերով, որոնցով դրանք գրված են։ Ստացվում է տասը կլաստեր, և դրանցից մեկը վարվում է մյուսներից տարբեր՝ 2025-ի սկզբին այն կազմում էր կորպուսի 0,7%-ը, իսկ 2026-ի կեսերին՝ մոտ 39%-ը։

Ինչ է չափում նախագիծը

The load-bearing vocabulary of Claude կայքը GitHub-ի որոնման API-ի միջոցով օրական վերցնում է 1000 pull request նկարագրություն և KL-divergence k-means մեթոդով՝ որը համեմատում է բառերի հավանականային բաշխումները, բաժանում է դրանք տասը խմբի։ Ոչ արմատների կրճատում է կիրառվում, ոչ էլ դադար բառերի ցանկ. բառ է համարվում առնվազն մեկ տառ պարունակող տառերի, թվանշանների, թեք գծերի, գծիկների և ընդգծումների ցանկացած հաջորդականություն, այդ պատճառով load-bearing կամ mutation-tested նշումները պահպանվում են ամբողջությամբ։

Հրապարակված հաշվառումն ընդգրկում է հավաքված 603 օր, որոնցից 595-ը ընկնում է 85 ամբողջ շաբաթների վրա՝ 2025 թվականի հունվարի 6-ից մինչև 2026 թվականի օգոստոսի 17-ը։ Դա 461 121 նկարագրություն և 51 079 244 բառային դեպք է, որոնցից հաճախականության շեմը հաղթահարել է 19 798 բառ։

Կլաստերը, որը եկավ

Այս կլաստերի ամենաբնորոշ բառերն են՝ load-bearing, plainly, quietly, nobody, outright, re-derived, mutation-checked, mutation-tested, refused, vacuously, premise և restated։ Նախագծի գրառման համաձայն՝ այս բառապաշարը ծանոթ պետք է լինի բոլոր նրանց, ովքեր օգտագործում են կոդ գրող գործակալներ։ Ամբողջ կորպուսում կլաստերի բաժինը 8,2% է, իսկ վերջին չորս շաբաթվա ընթացքում՝ նկարագրությունների մոտ 37%-ը։

Կայքում կա նաև դետեկտոր. կարելի է տեղադրել pull request-ի նկարագրությունը կամ GitHub-ի հղումը և տեսնել, թե արդյոք տեքստը պատկանում է նույն կլաստերին։

Ինչպես է կառուցվում ընտրանքը

Մեթոդաբանության նկարագրությունը բացատրում է, թե ինչու ակնհայտ աղբյուրն այլևս պիտանի չէ։ GitHub-ի իրադարձությունների հանրային արխիվն այլևս տեքստ չի տանում. 2025 թվականի հոկտեմբերին commit-ների զանգվածը հեռացնելուց հետո հոսքում գրեթե միայն push իրադարձություններ են մնում։ Որոնման API-ն աշխատում է, քանի որ նրա ամսաթվի զտիչն ընդունում է ժամանակային դրոշմանիշներ, և պատուհանը կարելի է չափել նույնիսկ րոպեներով։ Ամեն օր ընտրվում է հինգ րոպեանոց տասը պատուհան՝ մեկը յուրաքանչյուր 2,4-ժամյա բլոկից, և դրանցից յուրաքանչյուրը բերում է ամբողջական տեքստը։

Մեկ սահմանափակում բացահայտ նշված է՝ հարցումը վերադարձնում է առավելագույնը 1000 արդյունք, իսկ էջը պարունակում է հարյուրը, այսինքն սա ընտրանք է, ոչ թե ամբողջական հաշվառում։ Չորս հավելվածների գրած pull request-ները՝ dependabot, renovate և նմանատիպ բոտեր, բացառվում են հենց հարցման մեջ, քանի որ դրանք կազմում են հավելվածային տեքստի շուրջ 90%-ը։

Ինչ է ցույց տալիս, ինչ՝ ոչ

Նախագիծը չի պնդում, թե որ գործիքով է գրված որևէ կոնկրետ նկարագրություն։ Այն ցույց է տալիս, որ pull request-ների լեզուն վիճակագրորեն բաժանվել է, և որ այդ բաժանման կեսերից մեկը տարեկան կտրվածքով արագ աճում է. հենց այդ փոփոխությունն է կարևոր նրանց համար, ովքեր ապրուստի համար կարդում են կոդի վերանայումներ, փաստաթղթեր ու նախագծերի պատմություն։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։