გაშიფრული დოკუმენტები: Microsoft-მა AI-ს მონაცემების მოპარვას „შრომის უდიდესი ქურდობა“ უწოდა

NYT-ის სარჩელში გაშიფრული მასალები აჩვენებს, რომ Microsoft-ისა და OpenAI-ის ხელმძღვანელები AI-მოდელებისთვის მონაცემების მოპარვას შიდა დოკუმენტებში თავად აღიარებდნენ — „ისტორიაში შრომის უდიდესი ქურდობა“.
რას ამხელს ახალი დოკუმენტები
New York Times-ის სამწლიან საავტორო უფლებების სარჩელში ახლად გაშიფრული მასალები აჩვენებს, რომ Microsoft-ისა და OpenAI-ის ხელმძღვანელობა შიდა კომუნიკაციაში თავად აღიარებდა: AI-მოდელების სწავლება მასობრივი, შენიღბული ქურდობაა. 2023 წლის იანვრის შიდა მემორანდუმში Microsoft-ის გამოყენებითი მეცნიერების დირექტორმა ამას „უპრეცედენტო მასშტაბის საოცარი ქურდობა“ და „ისტორიაში შრომის უდიდესი ქურდობა“ უწოდა.
93%-ით ნაკლები კლიკი
Microsoft-ის საკუთარი მონაცემებით, მისმა Copilot-ის „პასუხების ძრავმა“ The Times-ის საიტზე გადასვლები ჩვეულებრივ Bing-თან შედარებით 93%-ამდე შეამცირა; 2024 წლის შიდა პრეზენტაციაში ამას „doom loop“ — დამღუპველი ციკლი ეწოდა, რომელიც მოდელებსაც და „მთელ ინტერნეტსაც“ დააზიანებს.
რიცხვები და დაცვის ხაზი
დოკუმენტების მიხედვით, მხოლოდ OpenAI-ის საწყისი (mid-training) მონაცემთა ნაკრებებში Times-ის, Daily News-ისა და CIR-ის 91 692-ზე მეტი ნაწარმოების ასლია, ხოლო Common Crawl-ზე დაფუძნებულ ნაკრებში — 2 მილიონზე მეტი დოკუმენტი nytimes.com-იდან. OpenAI და Microsoft კომენტარს არ აკეთებენ; Times-ის მტკიცებულებები ჯერ კიდევ დალუქულია, სასამართლოები კი ჯერჯერობით „სამართლიან გამოყენებას“ (fair use) ემხრობიან.