Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

techcrunchtechcrunchtechcrunchNya, avhemligade dokument i New York Times tre år gamla upphovsrättsstämning mot OpenAI och Microsoft avslöjar att höga chefer på båda företagen privat erkände att deras metoder för AI-träning motsvarade stöld och utgjorde ett existentiellt hot mot de utgivare vars arbete drev deras modeller.
De avhemligade dokumenten, som offentliggjordes på torsdagen, visar att Microsofts direktör för tillämpad vetenskap, Brent Hecht, beskrev företagens massiva skrapning av nyhetsinnehåll som "en häpnadsväckande stöld av aldrig tidigare skådad omfattning" och "historiens största arbetsstöld" i ett internt memo från januari 2023. I en separat presentation från januari 2024 varnade Hecht för att Microsofts AI-drivna strategi hade skapat en "dödsspiral" som skulle "skada prestandan hos våra modeller och hela webben samtidigt".wsj+1
Microsofts egna data visade att deras Copilot-svarstjänst fick klickfrekvensen för Times domän att sjunka med så mycket som 93 % jämfört med traditionell Bing-sökning. OpenAIs chef för ChatGPT, Nick Turley, skrev internt att utgivare står inför ett "existentiellt hot" från produkter som chattboten, vilken han beskrev som "i hög grad substituerande". OpenAI-presidenten Greg Brockman kallade modellerna "utmärkta på nyheter", medan Microsofts vd Satya Nadella vittnade under ed om att samtal med chattbottar "har ersatt… att ge dig informationen direkt där på webbplatsen på AI-plattformen kontra att behöva gå till den underliggande källan".techcrunch
Dokumenten avslöjar för första gången omfattningen av den påstådda kopieringen: OpenAIs träningsdataset innehöll ensamt mer än 91 692 kopior av verk publicerade av Times, Daily News och Center for Investigative Reporting, medan ett dataset härlett från Common Crawl inkluderade mer än 2 miljoner dokument från nytimes.com. Företagen ska också ha samlat in träningsdata genom initiativ kallade Project Taxi och Project Mango, där det senare innehöll kopior av minst 160 903 unika verk från nyhetsutgivarna.techcrunch
Dokumenten beskriver hur OpenAI-anställda påstås ha utarbetat metoder för att kringgå betalväggar utan att upptäckas. När forskaren Nick Ryder berättade för Brockman om ett "hack för att komma runt nytimes betalvägg", svarade Brockman: "ah nice". Anställda ska också ha tagit bort upphovsrättsnotiser från träningsdata, eftersom forskare "inte skulle vilja att modellen matade ut" sådana notiser till användare.techcrunch
Medgivandena kan underminera OpenAIs försvar om "fair use", särskilt kravet på att användningen inte skadar marknaden för originalverket. Nadella vittnade själv om att "allt som ligger bakom en betalvägg bör licensieras av alla som vill använda det… för grundning eller träning". Tidigare denna månad lämnade Trump-administrationen in ett inlägg till försvar för OpenAIs olicensierade användning av upphovsrättsskyddat material, enligt TechCrunch. OpenAI och Microsoft har inte besvarat förfrågningar om kommentarer.techcrunch