
Transformer Explainer — ვიზუალური გზამკვლევი GPT-2 მოდელის არქიტექტურაში
ჯორჯიის ტექნოლოგიური ინსტიტუტის მკვლევრებმა შექმნეს Transformer Explainer — ბრაუზერის ინსტრუმენტი, რომელიც GPT-2-ს ლოკალურად ამუშავებს და ტოკენებს, ყურადღების მექანიზმსა და შერჩევას ეტაპობრივად აჩვენებს.
ინტერაქტიული ვებინსტრუმენტი Transformer Explainer აჩვენებს, როგორ აქცევს ტრანსფორმერ-მოდელი მომხმარებლის ტექსტს შემდეგ სიტყვად. ბრაუზერშივე მუშაობს 124 მილიონი პარამეტრის მქონე GPT-2 (small) მოდელი, ამიტომ გვერდის ყველა გრაფიკა შეყვანილ ტექსტზე რეაგირებს. პროექტი ჯორჯიის ტექნოლოგიური ინსტიტუტის რვაკაციანმა გუნდმა შექმნა, რომელშიც Aeree Cho, Grace C. Kim და Polo Chau შედიან; მას თან ახლავს სტატია ACM Digital Library-ში და ვიდეოგაკვეთილი.
ტოკენებიდან ალბათობებამდე
შეყვანილი ტექსტი იყოფა ტოკენებად — სიტყვებად ან სიტყვის ნაწილებად — და თითოეული მათგანი 768-განზომილებიან ვექტორად გარდაიქმნება. GPT-2-ის ლექსიკონი 50 257 ტოკენს მოიცავს, ამიტომ მხოლოდ ემბედინგის მატრიცა დაახლოებით 39 მილიონ პარამეტრს ინახავს. პოზიციური ინფორმაცია ცალკე ემატება, ვინაიდან არქიტექტურას სიტყვათა რიგის ჩაშენებული გრძნობა არ აქვს.

ვექტორები შემდეგ 12 იდენტურ ტრანსფორმერ-ბლოკს გადის. თითოეული ბლოკი აერთიანებს მრავალთავიან self-attention-ს, რომელიც ტოკენებს შორის ინფორმაციის გაცვლას უზრუნველყოფს, და MLP ფენას, რომელიც თითოეულ ტოკენს დამოუკიდებლად ამუშავებს. ყურადღების ქულები ნიღბიანია: პოზიცია მხოლოდ მარცხნივ მყოფ ტოკენებს ხედავს — სწორედ ეს შესაძლებელს ხდის შემდეგი ტოკენის წინასწარმეტყველებას მომავალში ჩახედვის გარეშე.
რას აკეთებს ყურადღება და MLP
Query, Key და Value ვექტორები ემბედინგებიდან ნასწავლი წონის მატრიცებით მიიღება. საიტი მათ ვებძიებას ადარებს: Query არის ის, რასაც აკრეფთ, Key — შედეგების სათაურები, Value კი გვერდების შიგთავსი. GPT-2 (small) მათ 12 თავად ყოფს; ერთი შეიძლება სინტაქსს ადევნებდეს თვალს, მეორე — უფრო ფართო მნიშვნელობას. სკალარული ნამრავლები სკალირდება, ნიღბიანდება და softmax-ს გადის, შემდეგ კი Value მატრიცაზე მრავლდება.

MLP ფენა თითოეული ტოკენის წარმოდგენას 768-დან 3 072 განზომილებამდე აფართოებს ხაზოვანი ფენითა და GELU აქტივაციით, შემდეგ კვლავ 768-მდე ამცირებს. ბოლო ხაზოვანი ფენა შედეგს 50 257 ტოკენის ლექსიკონზე ლოგიტებად ასახავს, softmax კი მათ ალბათობის განაწილებად აქცევს, საიდანაც შემდეგი ტოკენი ირჩევა.
სლაიდერები, შერჩევა და რეალიზაცია
მნახველს შეუძლია temperature-ის სლაიდერის გადაადგილება: 1-ზე დაბალი მნიშვნელობა განაწილებას ამკვეთრებს და შედეგს უფრო წინასწარმეტყველებადს ხდის, 1-ზე მაღალი — არბილებს და ტექსტს მრავალფეროვნებას მატებს. top-k და top-p პარამეტრები შერჩევას ყველაზე სავარაუდო კანდიდატებით ზღუდავს.
დემო მთლიანად ბრაუზერში მუშაობს: Andrej Karpathy-ის nanoGPT პროექტის PyTorch-ის GPT რეალიზაცია ONNX Runtime-ზეა გადატანილი, ინტერფეისი კი Svelte-ითა და D3.js-ითაა აწყობილი.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.