
מהו RLCD ומה הסוד מאחורי Jev
RLCD הוא יעד Plackett-Luce מותנה-סכימה שמוסיף כיול הסתברויות למידול העדפות רב-כיווני. לפי פוסט טכני, מודל התגמול שמאחורי Jev של TypeSafe כבר לא מתחבא מאחורי גנרטור, אלא הופך למוצר עצמו.
בפוסט טכני בבלוג di-zhang-llm מכנים את RLCD הסוד שמאחורי Jev, מודל קבלת ההחלטות של TypeSafe: מידול העדפות רב-כיווני בתוספת כיול הסתברויות, או ליתר דיוק יעד Plackett-Luce מותנה-סכימה. Jev הופך אותו למוצר בעזרת פלטים מטופוסים ואינפרנס מקבילי, ומודל התגמול כבר לא מתחבא מאחורי גנרטור: הוא עצמו הופך למודל.
מציון סקלרי להסתברות העדפה
מודל תגמול קלאסי מחזיר מספר אחד עבור הקשר ותשובת מועמדת, אבל לפי הפוסט המספר הזה אינו מוחלט: ל-0.8 אין משמעות יציבה בין בעיות או מאגרי מועמדים. המודל PPRM של LLaMA-Berry חשף את האות האמיתי בהסתברות Bradley-Terry, ואומן על כמעט 7.8 מיליון זוגות של פתרונות מתמטיים עם DPO.
Plackett-Luce הוא ה-PPRM הרב-כיווני
ממשקי החלטות פוגשים בדרך כלל יותר משני מועמדים. מודל הבחירה של Luce, הוא הלוגיט המולטינומי, מנרמל תועלת לכל מועמד; עם שני מועמדים הוא מצטמצם בדיוק ל-Bradley-Terry. בהינתן דירוג מלא, נראות Plackett-Luce בוחרת שוב ושוב את המועמד הבא בטיבו, וזהו המרכז המתמטי של RLCD.

כיול הופך התפלגות להחלטה
נרמול אינו כיול: softmax תמיד מסתכם לאחת, אבל זה לא אומר שתחזית שדווחה כ-0.8 נכונה ב-80% מהמקרים. החוזה: אם תחזיות קיבלו הסתברות 0.8, כ-80% מהן אמורות להיות נכונות, ולפי הפוסט זה גם מה ש-TypeSafe מבטיחה עבור Jev.
ציון Brier נותן למטרה הזו מחיר: החלטה שדווחה כ-p=0.8 מקבלת 0.04 כשהאירוע קורה ו-0.64 כשהוא לא, כך שתחזית בטוחה ומוטעית יקרה פי שישה-עשר מתחזית בטוחה ונכונה. הביטחון המכויל הוא שקובע אם תוכנה תבצע החלטה, תדחה אותה או תעביר אותה לאדם.
Jev הופך את המעריך לממשק
בערימת RLHF הרגילה מודל התגמול נשאר מאחורי הקלעים, מאחורי גנרטור. Jev הופך את זה: נכנסים מצב וסכימת מועמדים, ויוצאת התפלגות החלטות מכוילת. Noul, Choice ו-Score הם שלוש סכימות מעל אובייקט אחד: ההסתברות לתוצאה מטופוסת בהינתן מצב, שאלה וקבוצת מועמדים.
הפוסט גם מפרק את הטענה על אינפרנס מקבילי: בלי המיתוג, הסמפלר הוא sequence packing, attention mask וראשי החלטה מטופוסים, כך שתהליך forward אחד מדרג את כל המועמדים בלי לולאת טוקן-אחר-טוקן. TypeSafe מכריזה על ארכיטקטורה חדשה, מציין המחבר, אך לא מפרסמת אופרטור attention חדש ואף לא אבלציה.
בסיכום, את RLCD מגדיר חוזה הפלט: התפלגות הסתברויות מטופוסת. Jev הוא מה שקורה כשמודל התגמול מפסיק לדרג את המוצר והופך למוצר עצמו.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.