العودة
Transformer Explainer: نظرة تفاعلية داخل نموذج GPT-2 اللغوي
SiTech AI Team2 წთ. საკითხავი

Transformer Explainer: نظرة تفاعلية داخل نموذج GPT-2 اللغوي

أداة تفاعلية من معهد جورجيا التقني تشغّل نموذج GPT-2 داخل المتصفح وتشرح كيف تحوّل الرموز وآلية الانتباه والاختيار العشوائي النصَّ المدخل إلى الكلمة التالية.

يشرح موقع Transformer Explainer التفاعلي كيف يحوّل نموذج لغوي من نوع Transformer نصاً يكتبه المستخدم إلى الكلمة التالية. يعمل نموذج GPT-2 (small) المكوّن من 124 مليون معامل مباشرة داخل المتصفح، لذا تتفاعل كل الرسوم البيانية في الصفحة مع النص الذي يكتبه الزائر. أنجز المشروع فريق من ثمانية باحثين في معهد جورجيا التقني، بينهم Aeree Cho وGrace C. Kim وPolo Chau، ويصاحبه بحث منشور في مكتبة ACM الرقمية ودرس مصوّر.

من الرموز إلى الاحتمالات

يُقسَّم النص المدخل إلى رموز، كلمات أو أجزاء كلمات، ويتحوّل كل رمز إلى متجه من 768 بُعداً. تحتوي مفردات GPT-2 على 50,257 رمزاً، لذا تحمل مصفوفة التضمين وحدها نحو 39 مليون معامل. تُضاف المعلومة الموضعية بشكل منفصل، لأن البنية لا تملك إحساساً مدمجاً بترتيب الكلمات.

مراحل التضمين: التقطيع إلى رموز، تضمين الرموز، والترميز الموضعي

ثم تمر المتجهات عبر 12 كتلة Transformer متماثلة، تجمع كل واحدة بين الانتباه الذاتي متعدد الرؤوس، الذي يسمح للرموز بتبادل المعلومات، وشبكة عصبية متعددة الطبقات تعالج كل رمز على حدة. تُقنّع درجات الانتباه بحيث لا يرى كل موضع إلا الرموز الواقعة إلى يساره، وهو ما يجعل توقّع الرمز التالي ممكناً من دون الاطلاع على المستقبل.

داخل الانتباه وشبكة MLP

تُشتق متجهات Query وKey وValue من التضمينات عبر مصفوفات أوزان مُدرَّبة. يشبّه الموقع ذلك بالبحث في الويب: الاستعلام هو ما تكتبه، والمفاتيح عناوين النتائج، والقيم محتوى الصفحات. يقسّمها GPT-2 (small) إلى 12 رأساً، قد يتتبّع أحدها النحو وآخر المعنى الأوسع. تُقاس حواصل الجداء النقطي وتُقنّع وتُمرَّر عبر softmax، ثم تُضرب بمصفوفة القيم.

الانتباه الذاتي المقنّع المحسوب من مصفوفات Query وKey وValue

توسّع شبكة MLP تمثيل كل رمز من 768 إلى 3072 بُعداً عبر طبقة خطية وتفعيل GELU، ثم تعيد ضغطه إلى 768. تُسقط الطبقة الخطية الأخيرة النتيجة على المفردات كاملة البالغة 50,257 رمزاً على شكل قيم لوغاريتمية، ويحوّلها softmax إلى توزيع احتمالي يُنتقى منه الرمز التالي.

المنزلقات والاختيار العشوائي والتنفيذ

يمكن للزوار تحريك منزلق الحرارة الذي يقسم القيم اللوغاريتمية: القيم دون 1 تجعل التوزيع أحدّ والمخرجات أكثر قابلية للتوقّع، والقيم فوق 1 تجعله أكثر انبساطاً وتضيف تنوّعاً. تقصر إعدادات top-k وtop-p الاختيار على المرشحين الأرجح، ويمنح مرور المؤشر فوق خرائط الانتباه فكرةً عن الرموز التي يركّز عليها النموذج.

يعمل العرض التجريبي بالكامل داخل المتصفح: حُوّل تطبيق GPT بلغة PyTorch من مشروع nanoGPT الخاص بـ Andrej Karpathy إلى ONNX Runtime، وبُنيت الواجهة باستخدام Svelte وD3.js.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.