
Розсекречені документи: дослідник Microsoft назвав скрейпінг новин «найбільшою крадіжкою праці в історії людства»
Розсекречені документи у справі The New York Times проти OpenAI і Microsoft: дослідник Microsoft назвав тренування ШІ «крадіжкою», а Copilot знизив переходи на домен The Times аж до 93%.
Розсекречені судові документи у справі про авторські права, яку The New York Times подала проти OpenAI і Microsoft, показують: високопосадовий дослідник Microsoft у внутрішній записці назвав практику тренування ШІ «крадіжкою», а керівництво OpenAI вважало чат-боти екзистенційною загрозою для видавців, чиїми матеріалами ці моделі навчали.
Що йдеться у документах
У документах цитується внутрішня записка Брента Хехта (Brent Hecht), директора Microsoft з прикладної науки, від січня 2023 року: він назвав скрейпінг новин «неймовірною крадіжкою безпрецедентних масштабів» і «найбільшою крадіжкою праці в історії людства». У презентації, яку він підготував у січні 2024 року, описано внутрішній «doom loop» (замкнене коло занепаду): за даними самої Microsoft, її пошуковий помічник Copilot знижував переходи на домен The Times аж до 93% порівняно зі звичайним пошуком Bing, і це, за документом, «шкодить і нашим моделям, і всьому вебу водночас».
В іншому документі Microsoft ідеться про «реальний ризик» того, що генеративний ШІ «суттєво підірве зайнятість саме тих людей, які створили дані, на яких навчали базову модель». Керівник ChatGPT в OpenAI Нік Терлі (Nick Turley) писав у внутрішньому листуванні, що видавці стикаються з «екзистенційною загрозою» від продуктів, які «здебільшого замінюють» оригінал і «замінюватимуть його дедалі більше в міру вдосконалення». Президент OpenAI Грег Брокман назвав моделі «чудовими для новин».
Масштаб копіювання і платні стіни
З документів випливає, що самі лише датасети OpenAI для проміжного тренування містять понад 91 692 примірники творів The Times, Daily News і Center for Investigative Reporting, а набір на основі Common Crawl включив понад 2 мільйони документів лише з nytimes.com. Дані, зібрані в межах ініціативи «Project Mango», містили щонайменше 160 903 унікальні твори новинних видавців.
У позові також описано спроби обходити платні стіни непомітно. Коли дослідник OpenAI Нік Райдер сказав Брокману про «хак, щоб обійти paywall nytimes», той відповів: «ah nice». Генеральний директор Microsoft Сатья Наделла на допиті цього року заявив, що «все, що стоїть за платною стіною, має ліцензуватися кожним, хто хоче використовувати це… для заземлення чи тренування», і додав, що вимагав би від OpenAI перенавчити моделі, якби знав про дані з-за платної стіни.
Чому це важливо
Ці викриття підривають опору захисту OpenAI, який спирається на доктрину fair use: вона вимагає, щоб використання не замінювало оригінал і не шкодило його ринку. Суди поки що схилялися на бік AI-компаній. Втім, потрібна обережність: більшість нових матеріалів походить із власної заяви The Times, а не з первинних доказів, які досі засекречені, і цитати наведено без початкового контексту. OpenAI і Microsoft не відповіли на запити про коментар.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.