Վերադառնալ
Փաստաթղթեր. Microsoft-ի հետազոտողը AI-ի ուսուցումը կոչել է «աշխատուժի ամենամեծ գողությունը պատմության մեջ»
SiTech AI Team2 წთ. საკითხავი

Փաստաթղթեր. Microsoft-ի հետազոտողը AI-ի ուսուցումը կոչել է «աշխատուժի ամենամեծ գողությունը պատմության մեջ»

The New York Times-ի հայցով գաղտնազերծված փաստաթղթերում Microsoft-ի հետազոտողը AI-ի վարժեցումն անվանել է «գողություն», իսկ Copilot-ը The Times-ի դոմենի անցումները նվազեցրել է մինչև 93%-ով։

The New York Times-ի հայցով գաղտնազերծված նոր փաստաթղթերը ցույց են տալիս, որ Microsoft-ի բարձրաստիճան հետազոտողը ներքին հուշագրում ընկերությունների AI ուսուցման պրակտիկան անվանել է «գողություն», իսկ OpenAI-ի ղեկավարությունն ինքը չաթբոթերը համարել է գոյաբանական սպառնալիք այն հրատարակիչների համար, ում աշխատանքով վարժեցրել է մոդելները։

Ինչ է ասվում փաստաթղթերում

Փաստաթղթերում մեջբերվում է Microsoft-ի կիրառական գիտության տնօրեն Brent Hecht-ի 2023 թվականի հունվարի ներքին հուշագիրը, որտեղ նա լուրերի scraping-ը կոչում է «աննախադեպ մասշտաբի ապշեցուցիչ գողություն» և «մարդկության պատմության մեջ աշխատուժի ամենամեծ գողություն»։ Նրա՝ 2024 թվականի հունվարին գրած ներկայացման մեջ նկարագրվում է ներքին «doom loop»-ը. Microsoft-ի սեփական տվյալներով Copilot պատասխանների համակարգը The Times-ի դոմենի վրա անցումները նվազեցրել է մինչև 93%-ով՝ Bing-ի ավանդական որոնման համեմատ, իսկ փաստաթուղթը զգուշացնում է, որ դա «վնասում է և՛ մեր մոդելների աշխատանքին, և՛ ողջ վեբին միաժամանակ»։

Microsoft-ի մեկ այլ փաստաթուղթ զգուշացնում է «իրական ռիսկի» մասին, որ գեներատիվ AI-ն կարող է «էականորեն խաթարել հենց այն մարդկանց զբաղվածությունը, ովքեր ստեղծել են այն տվյալները, որոնցով վարժեցվել է հիմնային մոդելը»։ OpenAI-ի ChatGPT-ի ղեկավար Nick Turley-ն ներքին նամակագրությունում գրել է, որ հրատարակիչները կանգնած են «գոյաբանական սպառնալիքի» առջև, քանի որ այդ ապրանքները «մեծապես փոխարինող» են և «որքան լավանան, այնքան ավելի կփոխարինեն» բնօրինակին։ OpenAI-ի նախագահ Greg Brockman-ը մոդելներն անվանել է «գերազանց լուրերի համար»։

Պատճենման մասշտաբը և վճարովի պատերը

Փաստաթղթերի համաձայն՝ միայն OpenAI-ի mid-training տվյալների հավաքածուները պարունակում են The Times-ի, Daily News-ի և Center for Investigative Reporting-ի հրատարակած աշխատանքների ավելի քան 91 692 օրինակ, իսկ Common Crawl-ի հիման վրա կառուցված հավաքածուն ընդգրկել է ավելի քան 2 միլիոն փաստաթուղթ միայն nytimes.com-ից։ «Project Mango»-ի շրջանակում հավաքված տվյալները պարունակել են լրատվական հրատարակիչների առնվազն 160 903 եզակի աշխատանք։

Հայցի փաստաթղթում նկարագրվում են նաև վճարովի պատերը (paywall) աննկատ շրջանցելու ծրագրերը։ Երբ OpenAI-ի հետազոտող Nick Ryder-ը Brockman-ին պատմել է «nytimes-ի paywall-ը շրջանցելու hack»-ի մասին, վերջինս պատասխանել է՝ «ah nice»։ Microsoft-ի CEO Satya Nadella-ն այս տարի ցուցմունքում ասել է, որ «այն ամենը, ինչ գտնվում է վճարովի պատի հետևում, պետք է լիցենզավորվի բոլորի կողմից, ովքեր ուզում են օգտագործել այն… հիմնավորման կամ վարժեցման համար», և հավելել է, որ կպահանջեր OpenAI-ից վերավարժեցնել մոդելները, եթե իմանար վճարովի պատի հետևի տվյալների մասին։

Ինչու է դա կարևոր

Այս բացահայտումները խարխլում են OpenAI-ի fair use-ի պաշտպանության հենասյուները. վարդապետությունը պահանջում է, որ օգտագործումը չփոխարինի բնօրինակին և չվնասի դրա շուկային։ Դատարանները մինչ այժմ հակվել են AI ընկերությունների կողմը։ Սակայն զգուշություն է պետք. նոր նյութի մեծ մասը գալիս է The Times-ի սեփական փաստաթղթից, ոչ թե դեռևս կնքված ապացույցներից։ OpenAI-ն և Microsoft-ը չեն պատասխանել մեկնաբանության հարցումներին։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։