Een hooggeplaatste Microsoft-manager noemde het trainen van AI met nieuwsartikelen 'ongekende diefstal'. Dat blijkt uit documenten uit de rechtszaak van The New York Times. Die krant klaagde OpenAI en Microsoft aan wegens het gebruik van zijn verhalen als trainingsdata voor AI.
Dit nieuws in het kort
- Een Microsoft-directielid noemt het gebruik van nieuwsartikelen om AI te trainen 'ongekende diefstal'.
- Die uitspraak is relevant in een rechtszaak tegen OpenAI en Microsoft, die worden beschuldigd van het gebruik van miljoenen artikelen van The New York Times voor hun AI-diensten.
- OpenAI zou ook hebben erkend de paywall van The New York Times bewust te omzeilen.
De uitspraken zijn afkomstig van Brent Hecht, Microsofts hoofd toegepaste wetenschap, zo blijkt uit de documenten. Hij sprak van 'een ongekende diefstal van nooit eerder vertoonde omvang'. Hecht noemde het gebruik van gescrapete artikelen daarnaast 'misschien wel de grootste diefstal van arbeid in de geschiedenis van de mensheid'.
OpenAI en Microsoft gebruiken 'fair use' als verdediging. Zij stellen daarmee dat het gebruik van auteursrechtelijk beschermde werken voor het trainen van AI is toegestaan. Hecht is het daar ook niet mee eens. Als de partijen daarmee winnen, zou die overwinning 'het begrip fair use volledig belachelijk maken', aldus de directeur.
Miljoenen artikelen
Advocaten van The New York Times stellen dat OpenAI 'miljoenen artikelen' van de krant heeft gekopieerd en gebruikt bij het trainen van verschillende taalmodellen. Het gaat daarbij om GPT-3 tot en met GPT-4o en varianten daarvan.
Die modellen werden onder andere gebruikt voor OpenAI's api's voor ontwikkelaars, naast ChatGPT, dat draait op modellen vanaf GPT-3.5. OpenAI zou daarbij ook bewust de paywall van het dagblad hebben omzeild. Toen een OpenAI-medewerker een 'hack' daarvoor deelde met OpenAI-president Greg Brockman, reageerde die laatste: "Ah, nice."
Minder verkeer naar media
De documenten stellen dat OpenAI zich bewust was van de gevolgen daarvan. Het hoofd van ChatGPT zou gezegd hebben dat uitgevers als The New York Times door dat soort AI-diensten worden geconfronteerd met een 'existentiële bedreiging', omdat die diensten volgens hem 'vervangend zijn' voor uitgevers en nieuwsmedia.
Data van OpenAI en Microsoft bevestigt dat, blijkt uit de documenten. Microsoft noteerde 83 tot 93 procent minder kliks op artikelen van sommige nieuwsmedia, waaronder The New York Times, en 51 tot 94 procent bij andere media. Ook op bronnen binnen ChatGPT wordt weinig geklikt, zo wordt gesteld in de rechtszaakdocumenten.
Satya Nadella zei eerder als getuige in de rechtszaak dat hij zou hebben geëist dat OpenAI modellen opnieuw trainde als hij had geweten dat het bedrijf paywalls omzeilde om de grote taalmodellen te trainen. Hij zei ook onder ede dat chatbots inderdaad 'kliks stelen' van nieuwswebsites door informatie van de oorspronkelijke bron te gebruiken zonder gebruikers door te sturen.
Over de rechtszaak tussen The New York Times en OpenAI
De rechtszaak tussen The New York Times en OpenAI loopt al jaren. Het Amerikaanse dagblad diende de zaak in december 2023 in tegen OpenAI en Microsoft. De twee bedrijven zouden miljoenen artikelen van de krant hebben misbruikt om commerciële AI-modellen te trainen, zonder toestemming.
:strip_exif()/i/2008370676.jpeg?f=imagenormal)
:strip_icc():strip_exif()/u/71967/Grimlock.jpg?f=community)
:strip_icc():strip_exif()/u/1822858/crop63851bcaeea32_cropped.jpg?f=community)
/u/1983/whiteButton.png?f=community)
/u/627287/crop5f8ef98351ddc_cropped.png?f=community)
:strip_icc():strip_exif()/u/6764/cergorach.jpg?f=community)
:strip_exif()/u/84703/borgqueen.gif?f=community)
/u/217852/crop5fe1f46d0191f.png?f=community)
/u/222742/crop58bad2e188940_cropped.png?f=community)
/u/767409/crop62335cccc4f1d_cropped.png?f=community)
:strip_icc():strip_exif()/u/50542/alice.jpg?f=community)
:strip_icc():strip_exif()/u/1746646/crop6883b9344d07f.jpg?f=community)
:strip_icc():strip_exif()/u/66961/crop5c20da5d3451c_cropped.jpeg?f=community)