العودة
تحويل Qwen3-1.7B إلى نموذج قرار بمرور واحد وباحتمالات معايرة
SiTech AI Team2 دقيقة قراءة

تحويل Qwen3-1.7B إلى نموذج قرار بمرور واحد وباحتمالات معايرة

يقدّم هذا الدليل العملي طريقة تقييد مخرجات النموذج اللغوي لإجابات محددة مسبقًا، ثم تقييمها على CommonsenseQA وتصحيح درجات الثقة الزائدة من خلال توسيع درجة الحرارة.

حوّل فكّ الترميز المقيّد النموذج اللغوي العادي إلى محرّك قرار يختار، في تمريرة واحدة، من بين خيارات ثابتة بدل توليد نص حر رمزًا برمز. الطريقة الموضحة على Qwen/Qwen3-1.7B تقلّص المعجم إلى بضعة رموز مسموحة كي يُخرج النموذج إجابة واحدة فقط من الإجابات المحددة مسبقًا.

كيف تعمل التمريرة الأحادية

تعتمد نماذج قرار System one القياسية على احتمالات معايرة لكل إجابة مسموحة ثم ترد. عند طلب إخراج JSON من نموذج لغوي عام عبر Structured Output، يظل مضطرًا إلى تمريرة لكل رمز مُولَّد؛ وقد احتاج الإخراج النهائي في المثال المعروض إلى 11 تمريرة. أما نموذج القرار مثل Jev فيخفّف مجموعة خيارات ثابتة، ويحجب بقية المعجم، ويقرأ من التمريرة الأولى الإجابة ذات الاحتمال الأعلى. هذا لا يضمن صحة الإجابة، وقد تعكس احتمالات الرموز الخام ثقة الرمز التالي لا الاحتمال الحقيقي لكون الإجابة صحيحة.

نتائج CommonsenseQA والثقة الزائدة

في عينة اختبار عشوائية من CommonsenseQA، أجاب نموذج 1,7B إجابة صحيحة عن 725 من 1221 سؤالًا، أي دقة 0,5938 وmacro F1 بقيمة 0,5844. وحسّن الضبط السريع على مجموعة البيانات هذا إلى 762 من 1221، أي دقة 0,6241 وmacro F1 بقيمة 0,6234. ظهرت المشكلة في الأسئلة الغامضة. حين سُئل أين من المرجح أن يجد خفاشًا أو مضرب بيسبول، مع الخيارات: كهف، مباراة بيسبول، آخرون، حديقة حيوان، ومتجر سلع رياضية، اختار النموذج الكهف باحتمال 0,9978 رغم عدم وجود إجابة واضحة. وأكّد تقييم مقسّم إلى فئات الثقة الزائدة: في فئة الثقة من 0,90 إلى 1,00، حيث كان هناك 809 عينة، كانت الدقة 0,7009 فقط، بينما في الفئة من 0,80 إلى 0,90، مع 121 عينة، انخفضت إلى 0,4711.

المعايرة بتوسيع درجة الحرارة

لجعل الثقة متوافقة مع الدقة، استخدم المؤلف توسيع درجة الحرارة وضبط معامل درجة الحرارة على دقة النموذج بالانحدار التدريجي. وكانت القيمة المضبوطة 3,797280788421631. بعد التوسيع اقترب توزيع الثقة المقسم إلى فئات من الدقة أكثر بكثير: أظهرت الفئة العليا ثقة 0,9333 مقابل دقة 0,9541، بينما كانت الفئات الوسطى قريبة من الدقة المقاسة بفارق نقاط مئوية قليلة. ونشر المؤلف مستودع GitHub مع سكربتات لجمع مجموعة البيانات وتقييم النموذج وضبطه ومعايرته، ودعا الجميع إلى تجربة عملية العمل هذه على نماذج أكبر أيضًا.

المصادر: nishtahir.com

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.