
ما هو RLCD؟ السِّرّ وراء نموذج القرار Jev
RLCD هدفُ Plackett-Luce مشروطٌ بالمخطط، يضيف معايرة الاحتمالات إلى نمذجة التفضيلات متعددة الخيارات. وبحسب شرحٍ تقني، لم يعد نموذج المكافأة وراء Jev من TypeSafe مختبئًا خلف مولّد نصوص، بل صار هو المنتج نفسه.
في تدوينة تقنية على مدونة di-zhang-llm يُوصف RLCD بأنه السِّر وراء Jev، نموذج اتخاذ القرار من TypeSafe: نمذجة التفضيلات متعددة الخيارات مع معايرة الاحتمالات، أو بشكل أدق هدفُ Plackett-Luce مشروط بالمخطط. ويحوّله Jev إلى منتج عبر المخرجات المُنمَّطة والاستدلال المتوازي، ولم يعد نموذج المكافأة مختبئًا خلف مولّد نصوص: بل صار هو النموذج نفسه.
من مكافأة عددية إلى احتمال تفضيل
يعيد نموذج المكافأة الكلاسيكي رقمًا واحدًا لكل سياق وإجابة مرشَّحة، لكن الكاتب يرى أن هذا الرقم ليس مطلقًا: فـ 0.8 لا يحمل معنى ثابتًا بين المسائل أو مجموعات المرشحين. وقد أظهر نموذج PPRM من LLaMA-Berry الإشارة الحقيقية باحتمال Bradley-Terry، ودُرِّب على قرابة 7.8 مليون زوج من الحلول الرياضية بـ DPO.
Plackett-Luce هو النسخة متعددة الخيارات من PPRM
تستقبل واجهات القرار عادةً أكثر من مرشحَين. يمنح نموذج اختيار Luce، المعروف أيضًا باللوجيت متعدد الحدود، منفعة لكل مرشح ويطبّعها؛ وعند وجود مرشحَين يتحول تمامًا إلى Bradley-Terry. وعند توفر ترتيب كامل، يختار احتمال Plackett-Luce في كل مرة المرشح الأفضل التالي، وهو ما يسمّيه الكاتب المركز الرياضي لـ RLCD.

المعايرة تحوّل التوزيع إلى قرار
التطبيع ليس معايرة: فـ softmax يجمع دائمًا إلى واحد، لكن هذا لا يعني أن توقعًا أُبلغ بـ 0.8 صحيح في 80 بالمئة من الحالات. العقد هو أن تكون نحو 80 بالمئة من التوقعات التي حملت احتمال 0.8 صحيحة، وهو ما تؤكده TypeSafe أيضًا في Jev.
يمنح مقياس Brier هذا الهدف ثمنًا: القرار المُبلَّغ عنه بـ 0.8 يسجّل 0.04 عند وقوع الحدث و0.64 عند عدم وقوعه، أي أن توقعًا خاطئًا بثقة يكلّف ستة عشر ضعف التوقع الصحيح بثقة. والثقة المعايَرة هي ما يحدد ما إذا كان البرنامج سينفّذ القرار أو يؤجّله أو يحوّله إلى إنسان.
Jev يجعل المُقيِّم واجهةً للتشغيل
في منظومة RLHF المعتادة يبقى نموذج المكافأة في الخلفية خلف مولّد النصوص. أما Jev فيعكس ذلك: يدخل الحالة ومخطط المرشحين، ويخرج توزيع قرارات معايَر. وNoul وChoice وScore ثلاثة مخططات فوق كائن واحد: احتمال نتيجة مُنمَّطة بمعطى الحالة والسؤال ومجموعة المرشحين.
كما يفكك الكاتب ادعاء الاستدلال المتوازي: بعد إزالة العلامة التجارية، يتكون المُعيّن من sequence packing مع attention mask ورؤوس قرار مُنمَّطة، بحيث تقيّم تمريرة forward واحدة كل المرشحين دون حلقة توليد توكين بتوكين. وتعلن TypeSafe عن بنية جديدة، كما يلاحظ الكاتب، لكنها لا تنشر مشغّل attention جديدًا ولا اختبار استئصال.
وفي الخلاصة، يُعرَّف RLCD بعقد المخرجات: توزيع احتمالات مُنمَّط. وJev هو ما يحدث عندما يتوقف نموذج المكافأة عن تقييم المنتج ويصبح هو المنتج.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.