Назад
SiTech
«Несуча» лексика Claude: десять кластерів у 461 тисячах pull request-ів
SiTech AI Team3 წთ. საკითხავი

«Несуча» лексика Claude: десять кластерів у 461 тисячах pull request-ів

Корпус, який групує описи pull request-ів лише за словами, якими вони написані, показує: одна лексика зросла з 0,7% вибірки на початку 2025 року до приблизно 39% у середині 2026-го.

Незалежний проєкт із аналізу даних групує описи pull request-ів на GitHub за словами, якими вони написані, а не за ярликами, визначеними заздалегідь. Результат — десять кластерів, і один із них поводиться інакше, ніж решта: на початку 2025 року він становив 0,7% корпусу, а в середині 2026-го — приблизно 39%.

Що саме вимірюють

Сайт The load-bearing vocabulary of Claude щодня бере 1000 описів pull request-ів через пошуковий API GitHub і розбиває їх на десять груп методом KL-divergence k-means, який порівнює ймовірнісні розподіли слів. Ані стемінгу, ані списку стоп-слів тут не застосовують: словом вважається будь-яка послідовність літер, цифр, скісних рисок, дефісів і підкреслень, що містить хоча б одну літеру, тож технічні токени на кшталт load-bearing чи mutation-tested зберігаються повністю.

Опублікований підрахунок охоплює 603 зібрані дні, з яких 595 припадають на 85 повних тижнів — з 6 січня 2025 року до 17 серпня 2026-го. Це 461 121 опис і 51 079 244 появи слів, серед яких поріг частоти подолали 19 798 слів.

Кластер, що прийшов

Найхарактерніші слова цього кластера — load-bearing, plainly, quietly, nobody, outright, re-derived, mutation-checked, mutation-tested, refused, vacuously, premise та restated. Автори проєкту зазначають, що ця лексика має бути знайомою кожному, хто працює з агентами для написання коду. У всьому корпусі кластер займає 8,2%, а за останні чотири тижні — близько 37% описів.

На сайті є й детектор: вставте опис pull request-а або посилання на GitHub, і та сама модель покаже, чи належить текст до цього кластера.

Як будують вибірку

В описі методології пояснено, чому очевидне джерело не підійшло. Публічний архів подій GitHub перестав передавати текст: після того як у жовтні 2025 року з нього прибрали масив комітів, стрічка містить майже самі лише push-події. Пошуковий API працює, бо його фільтр дати приймає часові мітки, тож вікно можна зробити завширшки кілька хвилин. Щодня обирають десять п'ятихвилинних вікон — по одному на кожен блок у 2,4 години — і кожне повертає повний текст.

Про одне обмеження сказано відкрито: запит повертає щонайбільше 1000 результатів, а сторінка вміщує сотню, тож це вибірка, а не повний перелік. Pull request-и, створені чотирма застосунками — dependabot, renovate та подібними ботами, — виключені самим запитом, бо вони становлять близько 90% текстів, написаних застосунками.

Що це показує, а що ні

Проєкт не береться визначити, яким інструментом написано конкретний опис. Він показує, що мова pull request-ів статистично розділилася і що одна половина цього поділу швидко зростає в річному масштабі — саме такий зсув важливий для тих, хто щодня читає код-рев'ю, документацію та історію проєктів.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.