العودة
الضغط تنبؤ: كيف يحل الضاغطات والنماذج اللغوية الكبيرة المسألة نفسها
SiTech Team2 წთ. საკითხავი

الضغط تنبؤ: كيف يحل الضاغطات والنماذج اللغوية الكبيرة المسألة نفسها

في مقال على مدونة ngrok ترى آني سيكستون أن ضغط البيانات والنماذج اللغوية الكبيرة وجهان للرياضيات نفسها، وأن الإنتروبيا هي الحد الذي يسعى كلاهما إلى خفضه.

نشرت آني سيكستون، المدرّبة التقنية في ngrok، في 11 أغسطس مقالاً مطوّلاً بعنوان "Compression is prediction" ترى فيه أن ضغط البيانات والنماذج اللغوية الكبيرة تعبيران عن الرياضيات نفسها. ويشرح المقال عمل الضاغط خطوة بخطوة حتى النقطة التي يلتقي فيها المجالان.

التكرار لا مجرد الاختصار

تبدأ سيكستون بالتصغير: مقطع من كود جافاسكربت تُحذف منه التعليقات والمسافات وأسماء المتغيرات الطويلة يتقلص من 156 حرفاً إلى 62، لكن لا أحد يعدّ ذلك ضغطاً للبيانات. الضغط الحقيقي يستغل التكرار: سلسلة من 28 حرفاً مثل "AAAAAAAAABBBBCCDAAADDDDDDDDD" تُكتب بترميز طول التكرار على شكل "A9B4C2D1A3D9"، أي 96 بتة بدلاً من 224، بتراجع نسبته 57 في المئة.

تجمع الأدوات الحديثة ثلاثة عناصر: التحويلات والنموذج ومشفّر الإنتروبيا. يمنح النموذج احتمالات للرموز، ويحوّل المشفّر هذه الاحتمالات إلى تدفق بتات. ويمثّل الترميز الحسابي السلسلة "ABABAAC" كاملة بكسر ثنائي واحد هو 0.3876953125، ولا يحتاج سوى 10 بتات بدلاً من 56.

الإنتروبيا حدّ أدنى

متوسط عدد البتات لكل رمز هو الإنتروبيا، أي حد شانون الذي لا يمكن للضغط بدون فقدان أن يتجاوزه. والتوزيع المنحاز يُضغط أفضل: سلسلة من 12 حرفاً يغلب عليها حرف واحد استهلكت 0.82 بتة لكل رمز، في حين احتاج المثال المتوازن إلى 1.38. والسياق يشحذ الاحتمالات: احتمال حرف U في النص الإنكليزي 0.028، لكنه بعد Q يبلغ 0.999، أي نحو 0.001 بتة مقابل 5.16. وعلى عبارة "TO BE OR NOT TO BE" خفّض نموذج من الرتبة الأولى الناتج المضغوط من نحو 47 بتة إلى 21.

النماذج اللغوية متنبئة

خلصت ورقة لـGoogle DeepMind عام 2023 إلى أن نمذجة اللغة والضغط وجهان للظاهرة نفسها. ويتبع المقال المنطق: يعيد النموذج اللغوي توزيع احتمالات للرمز التالي، وعدد البتات اللازمة لتخزينه يساوي سالب لوغاريتم الاحتمال الذي منحه النموذج. ويُحسب الإنتروبيا المتقاطعة، التي تصغّرها النماذج اللغوية أثناء التدريب، بالصيغة نفسها. وعلى اقتباس من ديكنز احتاج نموذج من الرتبة الأولى 434 بتة، بينما اكتفى GPT-2 بـ176 بتة، أي عشرة في المئة من الأصل.

تبقى القيود العملية: نقل نموذج بحجم غيغابايتات لضغط استجابات HTTP يكلّف أكثر من البايتات الموفَّرة، ولهذا ما زال الويب يعتمد على gzip وBrotli. والسؤال المفتوح ليس مدى اقتراب المشفّر من الحد، بل إلى أي مدى يستطيع متنبئ أفضل خفضه.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.