უკან დაბრუნება
SiTech
„მტვირთველი“ ლექსიკა: 461 ათას pull request-ში ათი კლასტერი და ერთი, რომელიც მოვიდა
SiTech AI Team2 წთ. საკითხავი

„მტვირთველი“ ლექსიკა: 461 ათას pull request-ში ათი კლასტერი და ერთი, რომელიც მოვიდა

დამოუკიდებელი პროექტი GitHub-ის pull request-ების აღწერებს მხოლოდ მათივე სიტყვების მიხედვით აჯგუფებს: ათი კლასტერიდან ერთი 2025 წლის დასაწყისში კორპუსის 0,7% იყო, 2026 წლის შუაში კი დაახლოებით 39%.

დამოუკიდებელი მონაცემთა პროექტი „The load-bearing vocabulary of Claude“ GitHub-ის pull request-ების აღწერებს იმ სიტყვების მიხედვით აჯგუფებს, რომლებითაც ისინი დაწერილია — და არა იმის მიხედვით, რასაც მკვლევარი წინასწარ ეძებდა. შედეგი ათი კლასტერია, და ერთი მათგანი დანარჩენებისგან მკვეთრად განსხვავდება: 2025 წლის დასაწყისში კორპუსის 0,7% იყო, 2026 წლის შუაში კი დაახლოებით 39%.

რას ზომავს პროექტი

საიტი დღეში 1000 pull request-ის აღწერას იღებს GitHub-ის საძიებო API-ის საშუალებით და KL-divergence k-means ალგორითმით ათ ჯგუფად ჰყოფს; ეს მეთოდი სიტყვების ალბათურ განაწილებებს ადარებს ერთმანეთს. არ გამოიყენება არც სიტყვის ფუძის დაყვანა და არც გავრცელებული სიტყვების სია: სიტყვად ითვლება ასოების, ციფრების, დახრილი და ტირის ხაზებისა და ქვედა ტირეების ნებისმიერი მიმდევრობა, რომელშიც ერთი ასო მაინც არის, ამიტომ ისეთი ტექნიკური ჩანაწერები, როგორიცაა load-bearing ან mutation-tested, მთლიანად რჩება.

გამოქვეყნებული აღრიცხვა მოიცავს 603 შეგროვებულ დღეს, საიდანაც 595 სრულ კვირაშია — 2025 წლის 6 იანვრიდან 2026 წლის 17 აგვისტომდე. ეს არის 461 121 აღწერა და 51 079 244 სიტყვის გამოჩენა, რომელთაგან სიხშირის ზღვარი 19 798-მა სიტყვამ გადალახა.

კლასტერი, რომელიც მოვიდა

ახალი კლასტერის ყველაზე დამახასიათებელი სიტყვებია: load-bearing, plainly, quietly, nobody, outright, re-derived, mutation-checked, mutation-tested, refused, vacuously, premise, restated. პროექტის ავტორების შეფასებით, ეს სიტყვები ნაცნობი უნდა იყოს ყველასთვის, ვინც კოდირების აგენტებს იყენებს. კლასტერის წილი მთელ კორპუსში 8,2%-ია, ბოლო ოთხი კვირის ჭრილში კი — დაახლოებით 37%.

საიტზე არის დეტექტორიც: შეგიძლიათ ჩასვათ pull request-ის აღწერა ან GitHub-ის ბმული და ნახოთ, მიეკუთვნება თუ არა ტექსტი იმავე კლასტერს.

როგორ მზადდება ნიმუში

მეთოდოლოგიის აღწერაში ავტორები ამბობენ, რომ GitHub-ის მოვლენების საჯარო არქივი აღარ გამოდგება: 2025 წლის ოქტომბრიდან მასში ცვლილებების მასივი აღარ გადაიცემა, ამიტომ ნაკადში თითქმის მხოლოდ push-მოვლენები რჩება და ტექსტი არ არის. საძიებო API სამაგიეროდ იმით გამოდგება, რომ თარიღს დროის ნიშანიც ემატება, ამიტომ ფანჯარა წუთებითაც შეიძლება გაიზომოს. დღეში ათი ხუთწუთიანი ფანჯარა იხსნება — თითო ყოველ 2,4 საათში — და თითოეულს სრული ტექსტი მოაქვს.

ერთი შეზღუდვა ღიად არის დასახელებული: საძიებო API ერთ მოთხოვნაზე მაქსიმუმ 1000 შედეგს აბრუნებს, გვერდზე კი 100 აღწერაა, ამიტომ ეს არჩევანია და არა სრული აღრიცხვა. ოთხი აპლიკაციის მიერ დაწერილი pull request-ები — dependabot, renovate და მსგავსი ბოტები — მოთხოვნის დონეზე გამორიცხულია, რადგან ისინი აპლიკაციების მიერ შექმნილი ტექსტის დაახლოებით 90%-ს შეადგენენ.

რას ნიშნავს ეს

პროექტი არ ამტკიცებს, თუ რომელი ხელსაწყოთი დაიწერა კონკრეტული ტექსტი — ის მხოლოდ აჩვენებს, რომ pull request-ების ენა სტატისტიკურად გაიყო ორ ნაწილად და ერთი ნაწილი წლიურ მასშტაბზე სწრაფად იზრდება. სწორედ ეს ზრდა და ლექსიკის ცვლილებაა საინტერესო მათთვის, ვინც კოდის მიმოხილვას, დოკუმენტაციასა და პროექტების ისტორიას ეყრდნობა.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.