Վերադառնալ
Սեղմումը կանխատեսում է. ինչու՞ կոմպրեսորներն ու LLM-ները լուծում են նույն խնդիրը
SiTech Team2 წთ. საკითხავი

Սեղմումը կանխատեսում է. ինչու՞ կոմպրեսորներն ու LLM-ները լուծում են նույն խնդիրը

ngrok-ի հոդվածում Աննի Սեքսթոնը պնդում է, որ տվյալների սեղմումն ու մեծ լեզվական մոդելները նույն մաթեմատիկայի երկու դրսևորումներ են, իսկ էնտրոպիան այն սահմանն է, որն երկուսն էլ փորձում են իջեցնել։

ngrok-ի ծրագրավորող-ուսուցիչ Աննի Սեքսթոնը օգոստոսի 11-ին հրապարակել է «Compression is prediction» վերնագրով ընդարձակ հոդված, որի հիմնական թեզն այն է, որ տվյալների սեղմումն ու մեծ լեզվական մոդելները նույն մաթեմատիկայի երկու արտահայտություններ են։ Հեղինակը քայլ առ քայլ բացատրում է կոմպրեսորի աշխատանքը և հասնում այն կետին, որտեղ այս երկու ոլորտները հանդիպում են։

Ավելորդությունը, և ոչ միայն կրճատումը

Սեքսթոնը սկսում է մինիֆիկացիայից. JavaScript-ի կոդի հատվածը, որից հանվում են մեկնաբանությունները, բացատները և երկար անունները, 156 նշանից դառնում է 62, սակայն ոչ ոք դա տվյալների սեղմում չի անվանում։ Իրական սեղմումը օգտագործում է ավելորդությունը. 28 նշանանոց «AAAAAAAAABBBBCCDAAADDDDDDDDD» տողը կրկնությունների կոդավորմամբ գրվում է որպես «A9B4C2D1A3D9»՝ 224 բիթի փոխարեն 96 բիթ, 57 տոկոսով փոքր։

Ժամանակակից գործիքները միավորում են երեք մաս՝ ձևափոխություններ, մոդել և էնտրոպիայի կոդավորիչ։ Մոդելը նշաններին հավանականություններ է վերագրում, կոդավորիչը դրանք վերածում է բիթային հոսքի։ Թվաբանական կոդավորումը «ABABAAC» ամբողջ տողը ներկայացնում է մեկ երկուական կոտորակով՝ 0.3876953125, որի համար 56 բիթի փոխարեն բավական է 10 բիթ։

Էնտրոպիան սահման է

Մեկ նշանի վրա միջինում ծախսվող բիթերի քանակը էնտրոպիան է՝ Շենոնի սահմանը, որը կորուստ չունեցող սեղմումը չի կարող անցնել։ Շեղ բաշխումը ավելի լավ է սեղմվում. մեկ տառով գերակշռվող 12 նշանանոց տողը միջինում 0.82 բիթ է պահանջել, մինչդեռ հավասարակշռված օրինակը՝ 1.38։ Համատեքստը սրում է հավանականությունները. անգլերեն տեքստում U տառի հավանականությունը 0.028 է, սակայն Q-ից հետո այն հասնում է 0.999-ի՝ մոտ 5.16 բիթի փոխարեն 0.001 բիթ։ «TO BE OR NOT TO BE» արտահայտության վրա առաջին կարգի մոդելը սեղմված արդյունքը մոտ 47 բիթից իջեցրել է 21-ի։

LLM-ները որպես կանխատեսող

Google DeepMind-ի 2023 թվականի հոդվածը պնդում էր, որ լեզվական մոդելավորումն ու սեղմումը նույն երևույթի երկու հայացքներն են։ Սեքսթոնը շարունակում է տրամաբանությունը. LLM-ը վերադարձնում է հաջորդ թոկենի հավանականային բաշխումը, իսկ այն պահելու համար անհրաժեշտ բիթերի քանակը մոդելի տված հավանականության բացասական լոգարիթմն է։ Cross-entropy-ն, որը լեզվական մոդելները փոքրացնում են ուսուցման ընթացքում, հաշվարկվում է նույն բանաձևով։ Դիքենսի մեջբերման վրա առաջին կարգի մոդելին պահանջվել է 434 բիթ, իսկ GPT-2-ին՝ ընդամենը 176՝ բնագրի 10 տոկոսը։

Գործնական սահմանափակումները մնում են. մի քանի գիգաբայթանոց մոդել տեղափոխելը HTTP պատասխանները սեղմելու համար ավելի թանկ կարժենա, քան խնայված բայթերը, դրա համար էլ վեբը դեռ կրում են gzip-ը և Brotli-ն։ Բաց հարցը ոչ թե այն է, թե կոդավորիչը որքան է մոտենում սահմանին, այլ այն, թե որքան ներքև կարող է իջեցնել այն ավելի լավ կանխատեսողը։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։