
Sıkıştırma tahmindir: sıkıştırıcılar ve LLM'ler neden aynı problemi çözer
ngrok'ta yayımlanan bir yazıda Annie Sexton, veri sıkıştırma ile büyük dil modellerinin aynı matematiğin iki görünümü olduğunu, entropinin ise ikisinin de indirmeye çalıştığı sınır olduğunu savunuyor.
ngrok'ta geliştirici eğitmeni olan Annie Sexton, 11 Ağustos'ta yayımladığı "Compression is prediction" başlıklı uzun yazıda veri sıkıştırma ile büyük dil modellerinin aynı matematiğin iki ifadesi olduğunu savunuyor. Yazı, bir sıkıştırıcının çalışmasını adım adım açıklıyor ve iki alanın kesiştiği noktaya kadar gidiyor.
Fazlalık, yalnızca kısaltma değil
Sexton, küçültme (minification) ile başlıyor: yorumlar, boşluklar ve uzun değişken adları atılan bir JavaScript parçası 156 karakterden 62'ye iniyor, ancak kimse bunu veri sıkıştırma saymıyor. Gerçek sıkıştırma fazlalıktan yararlanıyor: 28 karakterlik "AAAAAAAAABBBBCCDAAADDDDDDDDD" dizisi, tekrar uzunluğu kodlamasıyla "A9B4C2D1A3D9" olarak yazılıyor; 224 bit yerine 96 bit, yani yüzde 57 daha küçük.
Modern araçlar üç bileşeni birleştiriyor: dönüşümler, model ve entropi kodlayıcı. Model sembollere olasılık atıyor, kodlayıcı bu olasılıkları bit akışına çeviriyor. Aritmetik kodlama, "ABABAAC" dizisinin tamamını 0.3876953125 tek ikili kesiriyle temsil ediyor; bunun için 56 bit yerine 10 bit yetiyor.
Entropi bir sınırdır
Sembol başına ortalama bit sayısı entropidir; kayıpsız sıkıştırmanın geçemeyeceği Shannon sınırıdır. Çarpık dağılımlar daha iyi sıkışır: tek bir harfin baskın olduğu 12 karakterlik dizi sembol başına 0.82 bit tutarken, daha dengeli örnek 1.38 bit gerektiriyordu. Bağlam olasılıkları keskinleştiriyor: İngilizce metinde U harfinin olasılığı 0.028 iken Q'dan sonra 0.999'a çıkıyor; bu 5.16 bit yerine yaklaşık 0.001 bit demek. "TO BE OR NOT TO BE" üzerinde birinci dereceden bir model, sıkıştırılmış çıktıyı yaklaşık 47 bitten 21 bite indirdi.
LLM'ler birer tahminci
Google DeepMind'ın 2023 tarihli bir makalesi, dil modellemenin ve sıkıştırmanın aynı olgunun iki görünümü olduğunu savunuyordu. Sexton bu mantığı izliyor: bir LLM, sıradaki token için olasılık dağılımı döndürüyor ve o tokeni saklamak için gereken bit sayısı, modelin verdiği olasılığın eksi logaritmasına eşit. Dil modellerinin eğitimde küçülttüğü çapraz entropi aynı formülle hesaplanıyor. Dickens'tan bir alıntıda birinci dereceden bir model 434 bit gerektirirken GPT-2 yalnızca 176 bit, yani orijinalin yüzde 10'unu kullandı.
Pratik sınırlar sürüyor: HTTP yanıtlarını sıkıştırmak için gigabaytlarca model taşımak, kazanılan baytlardan daha pahalıya geliyor; bu yüzden web'i hâlâ gzip ve Brotli taşıyor. Açık soru, bir kodlayıcının sınıra ne kadar yaklaştığı değil, daha iyi bir tahmincinin bu sınırı ne kadar aşağı çekebileceği.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.