Geri qayıt
Transformer Explainer: GPT-2 dil modelinin işini brauzerdə vizuallaşdırır
SiTech AI Team2 წთ. საკითხავი

Transformer Explainer: GPT-2 dil modelinin işini brauzerdə vizuallaşdırır

Corciya Texnologiya İnstitutunun alimlərinin hazırladığı brauzer aləti GPT-2-ni yerli olaraq işə salır və tokenlərin, diqqət mexanizminin və seçmənin növbəti sözü necə yaratdığını addım-addım göstərir.

Transformer Explainer, transformer tipli dil modelinin sorğunu növbəti sözə necə çevirdiyini addım-addım göstərən interaktiv veb saytdır. Brauzerdə birbaşa 124 milyon parametrli GPT-2 (small) modeli işləyir, ona görə səhifədəki bütün qrafiklər istifadəçinin yazdığı mətnə reaksiya verir. Layihəni Corciya Texnologiya İnstitutunun səkkiz nəfərlik komandası hazırlayıb; komandada Aeree Cho, Grace C. Kim və Polo Chau da var. Layihəni ACM Digital Library-də dərc olunmuş məqalə və video dərs müşayiət edir.

Tokenlərdən ehtimallara

Giriş mətni tokenlərə — sözlərə və ya söz hissələrinə — bölünür və hər token 768 ölçülü vektora çevrilir. GPT-2-nin lüğəti 50 257 token ehtiva edir, buna görə təkcə embedding matrisi təxminən 39 milyon parametr saxlayır. Mövqe məlumatı ayrıca əlavə olunur, çünki arxitekturada söz sırasının daxili hissi yoxdur.

Embedding mərhələləri: tokenizasiya, token embedding və mövqe kodlaşdırması

Sonra vektorlar 12 eyni transformer blokundan keçir. Hər blok tokenlərin məlumat mübadiləsi etməsinə imkan verən çoxbaşlı öz-diqqəti hər tokeni ayrıca emal edən çoxqatlı perseptronla birləşdirir. Diqqət balları maskalanır: mövqe yalnız solundakı tokenləri görür — növbəti tokenin gələcəyə baxmadan proqnozlaşdırılmasını mümkün edən də budur.

Diqqətin və MLP-nin içi

Query, Key və Value vektorları embeddinglərdən öyrənilmiş çəki matrisləri ilə alınır. Sayt onları veb axtarışına bənzədir: sorğu yazdığınız mətn, açarlar nəticələrin başlıqları, dəyərlər isə səhifələrin məzmunudur. GPT-2 (small) onları 12 başa bölür: biri sintaksisi, digəri daha geniş mənanı izləyə bilər. Nöqtə hasilləri miqyaslanır, maskalanır və softmax-dan keçdikdən sonra dəyər matrisinə vurulur.

Query, Key və Value matrislərindən hesablanan maskalanmış öz-diqqət

MLP hər tokenin təsvirini xətti qat və GELU aktivasiyası ilə 768 ölçüdən 3 072 ölçüyə genişləndirir, sonra yenidən 768-ə sıxır. Son xətti qat nəticəni 50 257 tokendən ibarət lüğətin üzərinə logitlər kimi proyeksiya edir, softmax isə onları növbəti tokenin seçildiyi ehtimal paylanmasına çevirir.

Slayderlər, seçmə və icra

Ziyarətçilər temperatur slayderini dəyişə bilər: 1-dən aşağı qiymətlər paylanmanı kəskinləşdirib nəticəni proqnozlaşdırıla bilən edir, 1-dən yuxarı qiymətlər isə onu yumşaldıb müxtəlifliyi artırır. top-k və top-p parametrləri seçməni ən ehtimallı namizədlərlə məhdudlaşdırır.

Demo tamamilə brauzerdə işləyir: Andrej Karpathy-nin nanoGPT layihəsindəki PyTorch GPT reallaşdırması ONNX Runtime-a çevrilib, interfeys isə Svelte və D3.js ilə qurulub.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.