Geri qayıt
Sıxma proqnozdur: kompressorlar və LLM-lər niyə eyni problemi həll edir
SiTech Team2 წთ. საკითხავი

Sıxma proqnozdur: kompressorlar və LLM-lər niyə eyni problemi həll edir

ngrok bloqundakı məqalədə Enni Sekston verilənlərin sıxılması ilə böyük dil modellərinin eyni riyaziyyatın iki təzahürü olduğunu, entropiyanın isə hər ikisinin aşağı salmağa çalışdığı hədd olduğunu yazır.

ngrok-da developer təhsilçisi olan Enni Sekston avqustun 11-də "Compression is prediction" başlıqlı geniş məqalə dərc edib. Onun əsas tezi budur: verilənlərin sıxılması və böyük dil modelləri eyni riyaziyyatın iki ifadəsidir. Müəllif kompressorun işini addım-addım izah edir və bu iki sahənin kəsişdiyi nöqtəyə gəlib çıxır.

Artıqlıq, sadəcə qısaltma deyil

Sekston minifikasiyadan başlayır: şərhlər, boşluqlar və uzun dəyişən adları silinən JavaScript fraqmenti 156 simvoldan 62-yə düşür, lakin bunu heç kim verilənlərin sıxılması saymır. Əsl sıxma artıqlıqdan istifadə edir: 28 simvolluq "AAAAAAAAABBBBCCDAAADDDDDDDDD" sətri təkrar uzunluğu kodlaması ilə "A9B4C2D1A3D9" kimi yazılır — 224 bit əvəzinə 96 bit, yəni 57 faiz kiçik.

Müasir alətlər üç hissəni birləşdirir: çevirmələr, model və entropiya kodlayıcısı. Model simvollara ehtimallar təyin edir, kodlayıcı isə onları bit axınına çevirir. Arifmetik kodlama "ABABAAC" sətrinin hamısını 0.3876953125 tək ikilik kəsri kimi təqdim edir; bunun üçün 56 bit əvəzinə 10 bit kifayət edir.

Entropiya hədddir

Bir simvola düşən orta bit sayı entropiyadır — itkisiz sıxmanın keçə bilmədiyi Şennon həddi. Qeyri-bərabər paylanma daha yaxşı sıxılır: bir hərfin üstünlük təşkil etdiyi 12 simvolluq sətir simvol başına 0.82 bit tutdu, daha balanslı nümunə isə 1.38 bit tələb edirdi. Kontekst ehtimalları kəskinləşdirir: ingilis mətnində U hərfinin ehtimalı 0.028-dir, Q-dan sonra isə 0.999-a qalxır — 5.16 bit əvəzinə təxminən 0.001 bit. "TO BE OR NOT TO BE" üzərində birinci dərəcəli model sıxılmış nəticəni təxminən 47 bitdən 21 bitə endirdi.

LLM-lər proqnozlaşdırıcı kimi

Google DeepMind-ın 2023-cü il məqaləsi dil modelləşdirməsi ilə sıxmanın eyni hadisənin iki görünüşü olduğunu iddia edirdi. Sekston bu məntiqi davam etdirir: LLM növbəti token üçün ehtimal paylanması qaytarır və həmin tokeni saxlamaq üçün lazım olan bit sayı modelin verdiyi ehtimalın mənfi loqarifminə bərabərdir. Dil modellərinin təlimdə azaltdığı cross-entropy eyni düsturla hesablanır. Dikkensin sitatında birinci dərəcəli modelə 434 bit lazım gəldi, GPT-2 isə cəmi 176 bitlə kifayətləndi — orijinalın 10 faizi.

Praktik məhdudiyyətlər də qalır: HTTP cavablarını sıxmaq üçün giqabaytlarla model daşımaq qənaət edilən baytlardan baha başa gəlir, buna görə vebi hələ də gzip və Brotli daşıyır. Açıq sual kodlayıcının həddə nə qədər yaxınlaşdığı deyil, daha yaxşı proqnozlaşdırıcının bu həddi nə qədər aşağı sala biləcəyidir.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.