מסמכים שנחשפו: במיקרוסופט כינו איסוף הנתונים ל-AI "גניבת העבודה הגדולה בהיסטוריה"

מסמכים שהוסרו מהם ההשחרות בתביעת "ניו יורק טיימס" נגד OpenAI ומיקרוסופט חושפים שההנהלות כינו באינטרניות את איסוף הנתונים לאימון מודלים "גניבה" ו"גניבת העבודה הגדולה בהיסטוריה".
מה חושפים המסמכים
מסמכים חדשים שהוסרו מהם ההשחרות בתביעת זכויות היוצרים של "ניו יורק טיימס" נגד OpenAI ומיקרוסופט חושפים שההנהלות עצמן הודו בפנימיות שהאימון של מודלי AI הוא גניבה סמויה בהיקף עצום. בתזכיר פנימי מינואר 2023, מנהל המדע היישומי של מיקרוסופט כינה זאת "גניבה מדהימה במימדים חסרי תקדים" ו"גניבת העבודה הגדולה בהיסטוריה האנושית".
93% פחות קליקים
לפי הנתונים של מיקרוסופט עצמה, מנוע התשובות Copilot צמצם את שיעור ההקלקות לאתר הטיימס בעד 93% לעומת חיפוש Bing רגיל; במצגת פנימית מ-2024 תוארה התופעה כ"לופ מוות" שיפגע גם במודלים וגם ב"אינטרנט כולו".
המספרים וקו ההגנה
על פי המסמכים, מערכי האימון של OpenAI הכילו יותר מ-91,692 עותקים של יצירות של הטיימס, הדיילי ניוז ו-CIR, ובמערך שנשען על Common Crawl — יותר מ-2 מיליון מסמכים מ-nytimes.com. OpenAI ומיקרוסופט לא מסרו תגובה; הראיות של הטיימס עדיין חסומות, ובתי המשפט עד כה נוטים לטובת "שימוש הוגן".