უკან დაბრუნება
Transformer Explainer — ვიზუალური გზამკვლევი GPT-2 მოდელის არქიტექტურაში
SiTech AI Team2 წთ. საკითხავი

Transformer Explainer — ვიზუალური გზამკვლევი GPT-2 მოდელის არქიტექტურაში

ჯორჯიის ტექნოლოგიური ინსტიტუტის მკვლევრებმა შექმნეს Transformer Explainer — ბრაუზერის ინსტრუმენტი, რომელიც GPT-2-ს ლოკალურად ამუშავებს და ტოკენებს, ყურადღების მექანიზმსა და შერჩევას ეტაპობრივად აჩვენებს.

ინტერაქტიული ვებინსტრუმენტი Transformer Explainer აჩვენებს, როგორ აქცევს ტრანსფორმერ-მოდელი მომხმარებლის ტექსტს შემდეგ სიტყვად. ბრაუზერშივე მუშაობს 124 მილიონი პარამეტრის მქონე GPT-2 (small) მოდელი, ამიტომ გვერდის ყველა გრაფიკა შეყვანილ ტექსტზე რეაგირებს. პროექტი ჯორჯიის ტექნოლოგიური ინსტიტუტის რვაკაციანმა გუნდმა შექმნა, რომელშიც Aeree Cho, Grace C. Kim და Polo Chau შედიან; მას თან ახლავს სტატია ACM Digital Library-ში და ვიდეოგაკვეთილი.

ტოკენებიდან ალბათობებამდე

შეყვანილი ტექსტი იყოფა ტოკენებად — სიტყვებად ან სიტყვის ნაწილებად — და თითოეული მათგანი 768-განზომილებიან ვექტორად გარდაიქმნება. GPT-2-ის ლექსიკონი 50 257 ტოკენს მოიცავს, ამიტომ მხოლოდ ემბედინგის მატრიცა დაახლოებით 39 მილიონ პარამეტრს ინახავს. პოზიციური ინფორმაცია ცალკე ემატება, ვინაიდან არქიტექტურას სიტყვათა რიგის ჩაშენებული გრძნობა არ აქვს.

ემბედინგის ეტაპები: ტოკენიზაცია, ტოკენების ემბედინგი, პოზიციური კოდირება

ვექტორები შემდეგ 12 იდენტურ ტრანსფორმერ-ბლოკს გადის. თითოეული ბლოკი აერთიანებს მრავალთავიან self-attention-ს, რომელიც ტოკენებს შორის ინფორმაციის გაცვლას უზრუნველყოფს, და MLP ფენას, რომელიც თითოეულ ტოკენს დამოუკიდებლად ამუშავებს. ყურადღების ქულები ნიღბიანია: პოზიცია მხოლოდ მარცხნივ მყოფ ტოკენებს ხედავს — სწორედ ეს შესაძლებელს ხდის შემდეგი ტოკენის წინასწარმეტყველებას მომავალში ჩახედვის გარეშე.

რას აკეთებს ყურადღება და MLP

Query, Key და Value ვექტორები ემბედინგებიდან ნასწავლი წონის მატრიცებით მიიღება. საიტი მათ ვებძიებას ადარებს: Query არის ის, რასაც აკრეფთ, Key — შედეგების სათაურები, Value კი გვერდების შიგთავსი. GPT-2 (small) მათ 12 თავად ყოფს; ერთი შეიძლება სინტაქსს ადევნებდეს თვალს, მეორე — უფრო ფართო მნიშვნელობას. სკალარული ნამრავლები სკალირდება, ნიღბიანდება და softmax-ს გადის, შემდეგ კი Value მატრიცაზე მრავლდება.

ნიღბიანი self-attention, გამოთვლილი Query, Key და Value მატრიცებიდან

MLP ფენა თითოეული ტოკენის წარმოდგენას 768-დან 3 072 განზომილებამდე აფართოებს ხაზოვანი ფენითა და GELU აქტივაციით, შემდეგ კვლავ 768-მდე ამცირებს. ბოლო ხაზოვანი ფენა შედეგს 50 257 ტოკენის ლექსიკონზე ლოგიტებად ასახავს, softmax კი მათ ალბათობის განაწილებად აქცევს, საიდანაც შემდეგი ტოკენი ირჩევა.

სლაიდერები, შერჩევა და რეალიზაცია

მნახველს შეუძლია temperature-ის სლაიდერის გადაადგილება: 1-ზე დაბალი მნიშვნელობა განაწილებას ამკვეთრებს და შედეგს უფრო წინასწარმეტყველებადს ხდის, 1-ზე მაღალი — არბილებს და ტექსტს მრავალფეროვნებას მატებს. top-k და top-p პარამეტრები შერჩევას ყველაზე სავარაუდო კანდიდატებით ზღუდავს.

დემო მთლიანად ბრაუზერში მუშაობს: Andrej Karpathy-ის nanoGPT პროექტის PyTorch-ის GPT რეალიზაცია ONNX Runtime-ზეა გადატანილი, ინტერფეისი კი Svelte-ითა და D3.js-ითაა აწყობილი.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.