חזרה
הפיכת Qwen3-1.7B למודל החלטות עם הסתברויות מכוונת
SiTech AI Team2 דק׳ קריאה

הפיכת Qwen3-1.7B למודל החלטות עם הסתברויות מכוונת

מדריך מעשי מראה כיצד לחסום פלט של מודל שפה כללי לתשובות מוגדרות מראש, להעריך את התוצאה ב-CommonsenseQA ולתקן ציוני ביטחון עודפים באמצעות סולם טמפרטורה והתאמת שיפוע לדיוק המודל.

קידוד מוגבל הופך בדרך כלל מודל שפה למנוע החלטה שבמעבר קדמי בודד בוחר מתוך אפשרויות קבועות, במקום ליצור טקסט טוקן-טוקן. הגישה המודגמת ב-Qwen/Qwen3-1.7B מגבילה את הלקסיקון למספר טוקנים מותרים כדי שהמודל יפיק רק תשובה אחת מתוך התשובות המוגדרות מראש.

כיצד עובד החלק היחיד

מודלי החלטה System one רגילים מפיקים הסתברויות מכוונות עבור כל תשובה מותרת ועונים. כאשר מבקשים ממודל שפה כללי לפלוט JSON באמצעות Structured Output, הוא עדיין צריך לעבור עבור כל טוקן שנוצר; בדוגמה המודגמת הפלט הסופי דרש 11 מעברים. מודל החלטה כמו Jev לוקח דגימות מקבוצות אפשרויות קבועות, מסתיר את שאר הלקסיקון וקורא את התשובה בעלת ההסתברות הגבוהה ביותר מהמעבר הראשון. זה לא מעניק ערבון לתשובה נכונה, והסתברויות טוקן נמוכות עשויות לשקף את ביטחון הטוקן הבא ולא את ההסתברות האמיתית שהתשובה נכונה.

תוצאות CommonsenseQA וביטחון עודף

בדגימת בדיקה אקראית שנבחרה מ-CommonsenseQA, מודל 1.7B ענה נכונה על 725 מתוך 1221 שאלות, מהווה דיוק של 0,5938 ו-F1 מקרו של 0,5844. כוונון עדין מהיר על ערכת הנתונים שיפר זאת ל-762 מתוך 1221, כלומר דיוק של 0,6241 ו-F1 מקרו של 0,6234. הבעיה נחשפה בשאלות לא חד-משמעיות. כששאלו היכן סביר ביותר למצוא עטלף או מקל בייסבול, עם האפשרויות: מערה, משחק בייסבול, אחר, גן חיות וחנות ציוד ספורט, המודל בחר במערה בהסתברות 0,9978, למרות שלא היתה תשובה מפורשת. הערכה מחולקת לחבילות אישרה ביטחון עודף: בחבילת ביטחון של 0,90 עד 1,00, שבה היו 809 דגימות, הדיוק היה רק 0,7009, ובחבילה שבין 0,80 ל-0,90, עם 121 דגימות, הוא ירד ל-0,4711.

כיול באמצעות סולם טמפרטורה

כדי להתאים את רמת הביטחון לדיוק, המחבר השתמש בסולם טמפרטורה והתאים את פרמטר הטמפרטורה לדיוק המודל באמצעות התאמת שיפוע. הערך המותאם היה 3,797280788421631. לאחר הסולם, הביטחון המחולק לחבילות התקרב הרבה יותר לדיוק: החבילה העליונה הציגה ביטחון של 0,9333 לעומת דיוק של 0,9541, והחבילות הבינוניות היו במרחק של מספר נקודות אחוז מהדיוק המדוד. המחבר פרסם מאגר GitHub עם סקריפטים לבניית ערכת הנתונים, הערכת המודל, כוונון עדין וכיול, וקורא לכולם לנסות תהליך עבודה זה גם על מודלים גדולים יותר.

מקורות: nishtahir.com

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.