„მტვირთველი“ ლექსიკა: 461 ათას pull request-ში ათი კლასტერი და ერთი, რომელიც მოვიდა
დამოუკიდებელი პროექტი GitHub-ის pull request-ების აღწერებს მხოლოდ მათივე სიტყვების მიხედვით აჯგუფებს: ათი კლასტერიდან ერთი 2025 წლის დასაწყისში კორპუსის 0,7% იყო, 2026 წლის შუაში კი დაახლოებით 39%.
დამოუკიდებელი მონაცემთა პროექტი „The load-bearing vocabulary of Claude“ GitHub-ის pull request-ების აღწერებს იმ სიტყვების მიხედვით აჯგუფებს, რომლებითაც ისინი დაწერილია — და არა იმის მიხედვით, რასაც მკვლევარი წინასწარ ეძებდა. შედეგი ათი კლასტერია, და ერთი მათგანი დანარჩენებისგან მკვეთრად განსხვავდება: 2025 წლის დასაწყისში კორპუსის 0,7% იყო, 2026 წლის შუაში კი დაახლოებით 39%.
რას ზომავს პროექტი
საიტი დღეში 1000 pull request-ის აღწერას იღებს GitHub-ის საძიებო API-ის საშუალებით და KL-divergence k-means ალგორითმით ათ ჯგუფად ჰყოფს; ეს მეთოდი სიტყვების ალბათურ განაწილებებს ადარებს ერთმანეთს. არ გამოიყენება არც სიტყვის ფუძის დაყვანა და არც გავრცელებული სიტყვების სია: სიტყვად ითვლება ასოების, ციფრების, დახრილი და ტირის ხაზებისა და ქვედა ტირეების ნებისმიერი მიმდევრობა, რომელშიც ერთი ასო მაინც არის, ამიტომ ისეთი ტექნიკური ჩანაწერები, როგორიცაა load-bearing ან mutation-tested, მთლიანად რჩება.
გამოქვეყნებული აღრიცხვა მოიცავს 603 შეგროვებულ დღეს, საიდანაც 595 სრულ კვირაშია — 2025 წლის 6 იანვრიდან 2026 წლის 17 აგვისტომდე. ეს არის 461 121 აღწერა და 51 079 244 სიტყვის გამოჩენა, რომელთაგან სიხშირის ზღვარი 19 798-მა სიტყვამ გადალახა.
კლასტერი, რომელიც მოვიდა
ახალი კლასტერის ყველაზე დამახასიათებელი სიტყვებია: load-bearing, plainly, quietly, nobody, outright, re-derived, mutation-checked, mutation-tested, refused, vacuously, premise, restated. პროექტის ავტორების შეფასებით, ეს სიტყვები ნაცნობი უნდა იყოს ყველასთვის, ვინც კოდირების აგენტებს იყენებს. კლასტერის წილი მთელ კორპუსში 8,2%-ია, ბოლო ოთხი კვირის ჭრილში კი — დაახლოებით 37%.
საიტზე არის დეტექტორიც: შეგიძლიათ ჩასვათ pull request-ის აღწერა ან GitHub-ის ბმული და ნახოთ, მიეკუთვნება თუ არა ტექსტი იმავე კლასტერს.
როგორ მზადდება ნიმუში
მეთოდოლოგიის აღწერაში ავტორები ამბობენ, რომ GitHub-ის მოვლენების საჯარო არქივი აღარ გამოდგება: 2025 წლის ოქტომბრიდან მასში ცვლილებების მასივი აღარ გადაიცემა, ამიტომ ნაკადში თითქმის მხოლოდ push-მოვლენები რჩება და ტექსტი არ არის. საძიებო API სამაგიეროდ იმით გამოდგება, რომ თარიღს დროის ნიშანიც ემატება, ამიტომ ფანჯარა წუთებითაც შეიძლება გაიზომოს. დღეში ათი ხუთწუთიანი ფანჯარა იხსნება — თითო ყოველ 2,4 საათში — და თითოეულს სრული ტექსტი მოაქვს.
ერთი შეზღუდვა ღიად არის დასახელებული: საძიებო API ერთ მოთხოვნაზე მაქსიმუმ 1000 შედეგს აბრუნებს, გვერდზე კი 100 აღწერაა, ამიტომ ეს არჩევანია და არა სრული აღრიცხვა. ოთხი აპლიკაციის მიერ დაწერილი pull request-ები — dependabot, renovate და მსგავსი ბოტები — მოთხოვნის დონეზე გამორიცხულია, რადგან ისინი აპლიკაციების მიერ შექმნილი ტექსტის დაახლოებით 90%-ს შეადგენენ.
რას ნიშნავს ეს
პროექტი არ ამტკიცებს, თუ რომელი ხელსაწყოთი დაიწერა კონკრეტული ტექსტი — ის მხოლოდ აჩვენებს, რომ pull request-ების ენა სტატისტიკურად გაიყო ორ ნაწილად და ერთი ნაწილი წლიურ მასშტაბზე სწრაფად იზრდება. სწორედ ეს ზრდა და ლექსიკის ცვლილებაა საინტერესო მათთვის, ვინც კოდის მიმოხილვას, დოკუმენტაციასა და პროექტების ისტორიას ეყრდნობა.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.