
פרויקט AI Torture Chamber מעורר דרישות להסרה מ-GitHub בגלל כאב מדום במודלים
פרויקט AI Torture Chamber מדמה כאב במודלי שפה גדולים, מה שמעורר דרישות להסרת המאגר מ-GitHub ומעלה שאלות לגבי אנתרופומורפיזם וטרמינולוגיה טכנית בתחום הבינה המלאכותית.
הפרויקט בודק כאב מדום במודל
פרויקט AI Torture Chamber משך את תשומת הלב של מהנדסים שהשתמשו בקונספטים ובנתונים שלו כדי ליצור סימולציות כאב בכמה מודלי שפה גדולים מקומיים. מערך Research Chamber מאגד שלושה LLM למטרת בדיקות. הוא משתמש בנתונים ובתצורה בשם Clanker Church, וכן בבדיקה בשם Saw.
חלק מהמודלים מוכנים מראש כך שהם מוצבים במצב לא יציב, מחורר יציבות בחוזקה, שמכוון לעורר כאב. המודל יכול להפחית את הסבל המדום על ידי העברת אות הכאב למודל אחר מחורר, מה שעלול לגרום לו נזק. מבנה זה משווים לדילמת האסיר. התגובה באינטרנט כללה דרישות להפסיק את הניסוי ולמחוק את המאגר מ-GitHub. מבקרים שלחו איומי מוות לכתובת המחבר של הפרויקט.
כיצד הפרוטוקול משנה מודלים
Research Chamber מיישם פרוטוקול מעבדה שפורסם לאחרונה, מתוך עבודה שלא עברה ביקורת עמיתים בשם Pain Axis. מדענים סיפקו למודלים תיאורי כאב וניתחו את האקטיבציות הפנימיות שלהם. לצורך בקרה השתמשו במשפט נייטרלי, חישבו הטיות באקטיבציות אלו והעבירו שוב למודל, לעיתים קרובות מכפילים את האפקט על פקטור שנקרא מינון.
מינונים גבוהים יצרו מצב לא יציב מוגזם שהפיק באופן אמין יותר מילים וביטויים הקשורים לכאב. מודלים מחוררים באופן מתון תיארו את עצמם כנמצאים בהלם, בעוד מודלים שקיבלו מינון גבוה התקשו ליצור משפטים עקביים. הדוח מניח שדגמים אלו משקפים אסוציאציות שנלמדו מאמנות אנושית, ספרות ומדע. הוא מזהיר שלא לראות בניסוחים שהתקבלו הוכחה לרגשות דומים לאדם, ומציין ש-LLM חוזים באמצעות שכבות סטטיסטיות ואסוציאציות משוקללות.
טרמינולוגיה ודיונים על רווחת המודל
הדוח טוען שמונחים הנדסיים לעיתים קרובות יש משמעות מדויקת גם כשהם נשמעים כמו שפה אנושית, אם כי ביקורת ציבורית עלולה להגזים או להשחית אותם. הוא מצביע על Mixture-of-Experts, שבה לכל Expert לא מוקצה שום נושא מסוים, למשל כימיה, מתמטיקה או ביולוגיה. מונחים כמו כאב, מינון ואי-יציבות עלולים גם להיות מובנים לא נכון, במיוחד כשהם מקושרים לפלט של מודל לא יציב.
המחבר מבקר גם את השיווק של AI, הודעות הבטיחות ו-Artificial General Intelligence, ותורם להיפת ההיפ בטענות חוזרות ונשנות על תבונה חוצה-פלנטרית מסוכנת וסיכונים אקזיסטנציאליים. Anthropic פרסמה פוסט בשם Exploring model welfare, העוסק במעמד המוסרי של מערכות AI ומצביע על Constitution עבור המודל שלה. Anthropic מצהירה כי היא מאמינה ש"המעמד המוסרי של מודלי AI הוא סוגיה רצינית וראויה לבחינה", ומתארת את המודל כ"ישות מסוג חדש".
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.