უკან დაბრუნება
შეკუმშვა პროგნოზირებაა: რატომ წყვეტენ კომპრესორები და LLM-ები ერთსა და იმავე ამოცანას
SiTech Team2 წთ. საკითხავი

შეკუმშვა პროგნოზირებაა: რატომ წყვეტენ კომპრესორები და LLM-ები ერთსა და იმავე ამოცანას

ngrok-ის სტატიაში ენი სექსტონი ამტკიცებს, რომ მონაცემთა შეკუმშვა და დიდი ენობრივი მოდელები ერთი და იმავე მათემატიკის ორი მხარეა, ენტროპია კი ის ზღვარია, რომლის დაწევასაც ორივე ცდილობს.

ngrok-ის დეველოპერ-განმანათლებელმა ენი სექსტონმა 11 აგვისტოს გამოაქვეყნა ვრცელი სტატია „Compression is prediction", რომლის ცენტრალური მტკიცებაა, რომ მონაცემთა შეკუმშვა და დიდი ენობრივი მოდელები ერთი და იმავე მათემატიკის ორი გამოხატულებაა. ავტორი ნაბიჯ-ნაბიჯ ხსნის, როგორ მუშაობს კომპრესორი, და იმ წერტილამდე მიდის, სადაც ეს ორი სფერო ერთმანეთს ემთხვევა.

ზედმეტობა და არა მხოლოდ შემოკლება

სექსტონი იწყებს მინიფიკაციით: JavaScript-ის კოდის ფრაგმენტი კომენტარების, ცარიელი ადგილებისა და გრძელი ცვლადების სახელების მოშორებით 156 სიმბოლოდან 62-მდე მცირდება, თუმცა ამას მონაცემთა შეკუმშვად არავინ თვლის. ნამდვილი შეკუმშვა ზედმეტობას იყენებს: 28-სიმბოლოიანი სტრიქონი „AAAAAAAAABBBBCCDAAADDDDDDDDD" გამეორებათა კოდირებით (run-length encoding) იწერება როგორც „A9B4C2D1A3D9" და 224 ბიტიდან 96 ბიტამდე, 57 პროცენტით მცირდება.

თანამედროვე ხელსაწყოები სამი ნაწილისგან შედგება: ტრანსფორმაცია, მოდელი და ენტროპიული კოდერი. მოდელი სიმბოლოებს ალბათობებს ანიჭებს, ენტროპიული კოდერი კი ამ ალბათობებს ბიტებად აქცევს. არითმეტიკული კოდირება მთელ „ABABAAC" სტრიქონს ერთ ორობით წილადად — 0.3876953125 — წარმოადგენს, რისთვისაც 56 ბიტის ნაცვლად 10 ბიტი საკმარისია.

ენტროპია ზღვარია

სიმბოლოზე საშუალოდ დახარჯული ბიტების რაოდენობა ენტროპიაა — შენონის ზღვარი, რომელსაც უდანაკარგო შეკუმშვა ვერ გადალახავს. დახრილი განაწილება უკეთ იკუმშება: ერთი ასოს მიერ დომინირებულ 12-სიმბოლოიან სტრიქონზე საშუალოდ 0.82 ბიტი მოდის, მაშინ როცა ბალანსირებულ მაგალითს 1.38 ბიტი სჭირდებოდა. კონტექსტი კიდევ უფრო ამძაფრებს ალბათობებს: ასო U ინგლისურ ტექსტში 0.028 ალბათობით გვხვდება, Q-ს შემდეგ კი — 0.999-ით, რაც 5.16 ბიტის ნაცვლად 0.001 ბიტია. „TO BE OR NOT TO BE"-ზე პირველი რიგის მოდელმა შეკუმშული მონაცემი 47 ბიტიდან 21-მდე დაიყვანა.

LLM-ები როგორც პროგნოზირების ხელსაწყო

2023 წელს Google DeepMind-ის ნაშრომმა დაასაბუთა, რომ ენობრივი მოდელირება და შეკუმშვა ერთი მოვლენის ორი ხედვაა. სექსტონი ამ ლოგიკას მიჰყვება: LLM შემდეგი ტოკენისთვის ალბათობათა განაწილებას აბრუნებს, ხოლო ამ ტოკენის შესანახად საჭირო ბიტების რაოდენობა მოდელის მიერ მინიჭებული ალბათობის უარყოფითი ლოგარითმია. Cross-entropy — სიდიდე, რომელსაც ენობრივი მოდელები წვრთნისას ამცირებენ — იგივე ფორმულით გამოითვლება. დიკენსის ციტატაზე პირველი რიგის მოდელს 434 ბიტი დასჭირდა, GPT-2-ს კი მხოლოდ 176 — ორიგინალის 10 პროცენტი.

პრაქტიკული შეზღუდვებიც რჩება: მრავალგიგაბაიტიანი მოდელის ჩატვირთვა HTTP-პასუხების შესაკუმშად მეტი დაჯდება, ვიდრე დაზოგილი ბაიტები, ამიტომ ვებს ისევ gzip და Brotli ატარებენ. ღია კითხვა კი ის არის, რამდენად დაბლა შეუძლია უკეთეს პროგნოზირებას ამ ზღვრის დაწევა.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.