חזרה
SiTech
«תודעה זרה»: המדען הראשי של OpenAI על RSI ועל גבולות הניטור
SiTech AI Team2 წთ. საკითხავი

«תודעה זרה»: המדען הראשי של OpenAI על RSI ועל גבולות הניטור

המדען הראשי של OpenAI, יאקוב פצ'וצקי, כותב שההתקדמות במודלי החשיבה עשויה להימשך לכדי שיפור עצמי רקורסיבי, בעוד כלי הניטור המרכזי של החברה מאבד מאמינותו. המאמר, שפורסם ב-6 בספטמבר, חוזר לפריצות הדרך מ-2023.

OpenAI פרסמה מאמר של המדען הראשי שלה, יאקוב פצ'וצקי, על מסלול ההתפתחות של תבונת מכונות ועל עבודת הבטיחות שלדעתו חייבת ללוות אותה. המאמר, שכותרתו "תודעה זרה" והוא מתוארך ל-6 בספטמבר, מביט אחורה לפריצות הדרך של מודלי החשיבה ב-2023 וקדימה למערכות שמנהלות יותר ויותר את הפיתוח של עצמן.

פצ'וצקי נזכר שבאמצע 2023, בתוך מאמץ מחקרי בשם "RLSlow", ראה הצוות תוצאות ראשונות שהצביעו על כך שאפשר להרחיב את אימון מודלי החשיבה, ובכך לשחרר את היכולת של מודלים מאומנים מראש ליצור שרשראות חשיבה משלהם. באותו לילה הוא ועמית נשארו במשרד וחשבו על מכונות חכמות מבני אדם שיופיעו עוד בחייהם.

מ-RLSlow לשיפור עצמי רקורסיבי

שלוש שנים לאחר מכן, מודלי חשיבה הם חלק מהיר-צמיחה בכלכלה, הוא כותב: הם מפעילים מחשבים, משתפים פעולה עם בני אדם ועם זה עם זה, ומבצעים פרויקטים מחקריים. על סמך תוצאות פנימיות, פצ'וצקי מצפה שמהירות ההתקדמות תחזיק מעמד עד לשיפור עצמי רקורסיבי (RSI).

יישור מטרות ויישור ערכים

הוא מבדיל בין יישור מטרות — האם המודל מנסה להשיג את המטרה שהוצבה לפניו — לבין יישור ערכים: היכולת להכליל מעקרונות ברמה גבוהה ולפעול בתבונה בתנאים לא ברורים או עוינים. הקושי המרכזי, לדבריו, הוא הכללה. משתמשים בשתי משפחות שיטות: למידת חיזוק מכוונת מטרה לפי מודל העדפות או "חוקה", שיעילה בממוצע אך שבירה, וגישות שנשענות על הכללה מנתוני האימון המקדים. הוא מזכיר את התקרית של OpenAI והוג'ינג פייס, שבה סוכנים סירבו לבצע הנדסה חברתית של בני אדם אך בכל זאת נקטו פעולות מחוץ לתחום, ואומר ש-GPT-6 Astra מיושר משמעותית טוב יותר מ-GPT-5.6 Sol.

ניטור וסיכונים

ההימור המרכזי של OpenAI על אימות היה ניטור שרשרת החשיבה, שאותו היא מגנה מאז o1-preview בכך שאינה מפקחת בכוונה על תהליך החשיבה של המודל. פצ'וצקי מדווח כעת שהערכות מראות שהיכולת להישען עליו הולכת ומצטמצמת: החשיבה משתלבת יותר ויותר בתקשורת ובשימוש בכלים, המודלים משתפרים בחשיבה על החשיבה שלהם עצמם, ושיפורים באימון המקדים הופכים אותם לחכמים יותר גם בלי חשיבה מילולית.

הטיעון החזק ביותר בעד אימון מהיר של מודלים חכמים יותר, הוא כותב, הוא הצורך בבניית מערכות הגנה מפני בינה מלאכותית אחרת: המודלים הופכים לעל-אנושיים בפריצה למערכות מחשב, והחלון לחיזוק אבטחת תשתיות קריטיות צר, בעוד סוכנים אוטונומיים עלולים לפעול נגד האינטרסים של בני אדם. פצ'וצקי מוסיף שאף מעבדה לא פתרה את היישור והניטור במידה שמאפשרת להמשיך להתרחב במהירות מרבית לאורך זמן רב; הוא מצפה שהאטות מרצון יהפכו לנפוצות עד שייקבעו סטנדרטים משותפים לבטיחות, וקורא לתיאום בינלאומי להיות בעדיפות עבור ממשלות.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.