Microsoft-manager: AI trainen met nieuwsartikelen is 'ongekende diefstal'

Een hooggeplaatste Microsoft-manager noemde het trainen van AI met nieuwsartikelen 'ongekende diefstal'. Dat blijkt uit documenten uit de rechtszaak van The New York Times. Die krant klaagde OpenAI en Microsoft aan wegens het gebruik van zijn verhalen als trainingsdata voor AI.

Dit nieuws in het kort

  • Een Microsoft-directielid noemt het gebruik van nieuwsartikelen om AI te trainen 'ongekende diefstal'.
  • Die uitspraak is relevant in een rechtszaak tegen OpenAI en Microsoft, die worden beschuldigd van het gebruik van miljoenen artikelen van The New York Times voor hun AI-diensten.
  • OpenAI zou ook hebben erkend de paywall van The New York Times bewust te omzeilen.

De uitspraken zijn afkomstig van Brent Hecht, Microsofts hoofd toegepaste wetenschap, zo blijkt uit de documenten. Hij sprak van 'een ongekende diefstal van nooit eerder vertoonde omvang'. Hecht noemde het gebruik van gescrapete artikelen daarnaast 'misschien wel de grootste diefstal van arbeid in de geschiedenis van de mensheid'.

OpenAI en Microsoft gebruiken 'fair use' als verdediging. Zij stellen daarmee dat het gebruik van auteursrechtelijk beschermde werken voor het trainen van AI is toegestaan. Hecht is het daar ook niet mee eens. Als de partijen daarmee winnen, zou die overwinning 'het begrip fair use volledig belachelijk maken', aldus de directeur.

The New York Times vs. OpenAI. Bron: SOPA Images / Getty Images
Bron: SOPA Images / Getty Images

Miljoenen artikelen

Advocaten van The New York Times stellen dat OpenAI 'miljoenen artikelen' van de krant heeft gekopieerd en gebruikt bij het trainen van verschillende taalmodellen. Het gaat daarbij om GPT-3 tot en met GPT-4o en varianten daarvan.

Die modellen werden onder andere gebruikt voor OpenAI's api's voor ontwikkelaars, naast ChatGPT, dat draait op modellen vanaf GPT-3.5. OpenAI zou daarbij ook bewust de paywall van het dagblad hebben omzeild. Toen een OpenAI-medewerker een 'hack' daarvoor deelde met OpenAI-president Greg Brockman, reageerde die laatste: "Ah, nice."

Minder verkeer naar media

De documenten stellen dat OpenAI zich bewust was van de gevolgen daarvan. Het hoofd van ChatGPT zou gezegd hebben dat uitgevers als The New York Times door dat soort AI-diensten worden geconfronteerd met een 'existentiële bedreiging', omdat die diensten volgens hem 'vervangend zijn' voor uitgevers en nieuwsmedia.

Data van OpenAI en Microsoft bevestigt dat, blijkt uit de documenten. Microsoft noteerde 83 tot 93 procent minder kliks op artikelen van sommige nieuwsmedia, waaronder The New York Times, en 51 tot 94 procent bij andere media. Ook op bronnen binnen ChatGPT wordt weinig geklikt, zo wordt gesteld in de rechtszaakdocumenten.

Satya Nadella zei eerder als getuige in de rechtszaak dat hij zou hebben geëist dat OpenAI modellen opnieuw trainde als hij had geweten dat het bedrijf paywalls omzeilde om de grote taalmodellen te trainen. Hij zei ook onder ede dat chatbots inderdaad 'kliks stelen' van nieuwswebsites door informatie van de oorspronkelijke bron te gebruiken zonder gebruikers door te sturen.

Over de rechtszaak tussen The New York Times en OpenAI

De rechtszaak tussen The New York Times en OpenAI loopt al jaren. Het Amerikaanse dagblad diende de zaak in december 2023 in tegen OpenAI en Microsoft. De twee bedrijven zouden miljoenen artikelen van de krant hebben misbruikt om commerciële AI-modellen te trainen, zonder toestemming.

Door Daan van Monsjou

Nieuwsredacteur

18-09-2026 • 15:12

45

Reacties (45)

Sorteer op:

Weergave:

En dat is het natuurlijk ook gewoon. Je beroepen op fair use in deze lijkt mij inderdaad ronduit belachelijk, de artikelen zijn overduidelijk bedoeld voor consumptie door individuen (daar is het hele business model van de NYT natuurlijk gewoon op gestoeld) en niet voor het trainen van een AI model.

En zeker als je dan ook nog eens actief een paywall hebt omzeild, tjah dan zou je er überhaupt al helemaal geen toegang toe moeten hebben gehad en hoef je het eigenlijk ook niet eens meer te hebben over wat wel of niet onder faire use zou vallen lijkt mij.
Puur omdat iets ergens niet voor bedoelt is betekent nog niet dat je het niet daar voor mag gebruiken. Copyright mensen hebben dikke pech maar dit is nooit echt gedekt geweest of iets waar rekening mee gehouden is.
We zien in de toekomst ooit wel wat een rechter met dit soort zaken doet maar een reactionair "dat mag niet" voor alles met een laagje copyright is te simplistisch.
Ik zeg toch ook niet dat je op alles met een copyright niets meer mag doen? Dat is het hele idee van fair use, dat ook als je geen eigenaar bent je het voor bepaalde zaken alsnog mag gebruiken. En de copyright act lijkt mij hier op zich best duidelijk over.

Onderstaande van de website van Harvard: https://ogc.harvard.edu/pages/copyright-and-fair-use
What is the test for fair use?

Fair use is actually an affirmative defense to a claim of copyright infringement, meaning that the alleged infringer has the burden of proving their use was a fair use. It is now codified in Section 107 of the Copyright Act, which provides that fair use of a work “for purposes such as criticism, comment, news reporting, teaching (including multiple copies for classroom use, scholarship, or research)” is not an infringement of copyright. To determine whether a given use is fair use, the statute directs, one must consider the following four factors:

the purpose and character of the use, including whether the use is of a commercial nature or is for nonprofit educational purposes;

the nature of the copyrighted work;

the amount and substantiality of the portion used in relation to the copyrighted work as a whole; and

the effect of the use upon the potential market for or value of the copyrighted work.

These factors are not exclusive but are the primary—and in many cases the only—factors courts examine. The following sections consider each of these four factors in turn.
Het trainen van een model dat de kern vormt van een betaald commercieel product lijkt mij toch vrij duidelijk niet vallen onder kritiek en commentaar, nieuwsverslaggeving, onderwijs en wetenschap of parodie en humor
De Amerikaanse (VS) regels voor fair use zijn een stuk ruimer dan de beperkte uitzonderingen op het auteursrecht die wij in de EU kennen. De uitspraken die tot nu toe zijn gedaan in de VS lijken grotendeels het beroep op fair use te erkennen; in Europa is het een meer gemengde uitkomst, met name omdat modellen soms de complete tekst van werken kunnen reproduceren (met name liedjes), en dat ziet een rechter dan wel als inbreuk.

Merk op dat in de VS ook commercieel gebruik niet automatisch betekend dat het geen fair use is.
Ok cool. En nu? Gaan ze nu alle voortgang weggooien en opnieuw trainen op correct verkregen bronnen of is het wederom een slappe excuses, een "we zullen het nooit meer doen" en binnenkort een nieuw artikel over een nagenoeg gelijke datadiefstal (die natuurlijk nét iets anders verlopen is)?
Ik vermoed eerder dat er een schikking komt van een paar tientallen tot honderden miljoenen dollars waarna OpenAI gewoon verder mag gaan. Dat wordt dan wel interessante jurisprudentie voor rechtszaken a) van de NYT tegen andere AI bedrijven, en b) van andere (nieuws)bedrijven bij wie data illegaal gescraped is tegen OpenAI (en waarschijnlijk andere bedrijven).
Als het tot een schikking komt, vormt het toch juist geen jurisprudentie? Of bedoel je dat anderen dan zullen proberen ook tot dergelijke schikkingen te komen omdat ze weten dat dat erin zit?
Je hebt gelijk, het zal geen jurisprudentie zijn, daarvoor is echt een uitspraak nodig. Maar anderen zullen het wel zien als teken dat er bij OpenAI iets te halen valt als ze maar kunnen aantonen dat die hun data gebruikt heeft.

Eigenlijk is dit een situatie waar OpenAI maar op 1 manier goed uit kan komen: door de rechtzaak te winnen. Of ze verliezen of schikken, als ze niet winnen komen er meer bedrijven op OpenAPI af als dat er haaien op bloed afkomen.
Of ze voeren het verbod uit en verwijzen naar learn bronnen in al hun output.
Wat er waarschijnlijk gaat gebeuren is dat OpenAI wat voor hun een schijntje is betaald voor deze inbreuk terwijl dit tevens als afschrikmiddel dient zodat e.v.t. net beginnende concurrenten dit niet na kunnen doen.
Als dat zo was dan zou het zijn om de ladder omhoog te trekken, zodat kleinere parijen niet in staat gaan zijn hun eigen modellen te trainen. Partijen als Microsoft en Google hebben genoeg cash en mankracht om afspraken te maken met content eigenaren. Nieuwe spelers niet.
Dit is toch wel een onverwachte en verfrissende plottwist waar Microsoft de ethische invalshoek zowaar lijkt te kiezen en zich tegenover de Amerikaanse overheid plaatst. Ik denk dan eerlijk gezegd ook direct: wat denkt Microsoft hiermee te winnen?
MS gooit OpenAI onder de bus, dat kost ze niets. En MS heeft vaker met de EU in de clinch gelegen en de EU is een grotere markt dan de VS. MS dekt zich geheel in.
Behalve de miljarden die ze er al in gestoken hebben.
En die zijn er al in gestoken, waar ze nog steeds van profiteren en van blijven profiteren. Worst case scenario, OpenAI wordt de grond in gelitigeerd en MS koopt OpenAI goedkoop op... En corrigeert de 'misstanden' van OpenAI en dan gaan ze lekker verder.
De uitspraken van een medewerker zijn niet gelijk aan het beleid van Microsoft. Ik krijg juist het idee dat deze persoon tegen zijn werkgever in ging.
Satya Nadella zei eerder als getuige in de rechtszaak dat hij zou hebben geëist dat OpenAI modellen opnieuw trainde als hij had geweten dat het bedrijf paywalls omzeilde om de grote taalmodellen te trainen. Hij zei ook onder ede dat chatbots inderdaad 'kliks stelen' van nieuwswebsites door informatie van de oorspronkelijke bron te gebruiken zonder gebruikers door te sturen.
De CEO is toch niet zomaar een medewerker.
Maar geloven we Satya hier? Voor de bühne, mijns inziens... Achteraf "als ik had geweten" roepen en "zou hebben geëist" is natuurlijk lekker makkelijk.

[Reactie gewijzigd door vickypollard op 18 september 2026 15:22]

Maakt dat uit? Dit is het standpunt dat Microsoft in een rechstzaak inneemt, wat in het voordeel van New York Times en in het nadeel van OpenAI werkt. Misschien dat Microsoft eieren voor z'n geld kiest om niet meegetrokken te worden in de claims hier mogelijk uit gaan volgen.
Misschien is dit artikel dan onduidelijk, maar ik lees toch ook echt:
OpenAI en Microsoft gebruiken 'fair use' als verdediging. Zij stellen daarmee dat het gebruik van auteursrechtelijk beschermde werken voor het trainen van AI is toegestaan.
Dát lijkt me het standpunt van Microsoft... Dat Satya nu roept dat "als hij had geweten dat"... ja, sure :) En dat gaat ook specifiek over het omzeilen van de paywall, niet per se over het trainen op beschermd materiaal.

[Reactie gewijzigd door vickypollard op 18 september 2026 15:27]

Dat is inderdaad verwarrend. Ik vind het ook meer 'in character' dat Microsoft schouder aan schouder met OpenAI staat, maar de genoemde uitlating van Satya valt daar lastig mee te rijmen. Dan zegt 'ie eigenlijk "ik wilde het niet, het is stelen, maar het is fair use' en dat lijkt me behoorlijk lastig recht te praten. Maar goed, dat wil inderdaad niet zeggen dat ze het niet gaan proberen.
Inderdaad, waarom deze draai tegen een niet MS-product :+
Maar geloven we Satya hier? Voor de bühne, mijns inziens... Achteraf "als ik had geweten" roepen en "zou hebben geëist" is natuurlijk lekker makkelijk.
Ja, ik geloof Nadella hier, maar niet omdat ik hem op zijn blauwe ogen vertrouw.

Zijn verklaringen zijn behoorlijk ondubbelzinnig; lees het document zelf maar. Als later zou blijken dat hij aantoonbaar meer wist dan hij nu verklaart, heeft hij daarmee niet alleen een PR-probleem, maar potentieel ook een serieus juridisch en bestuurlijk probleem. Voor iemand in zijn positie is dat een nogal groot risico om te nemen voor een paar mooie woorden voor de bühne.

Daar komt bij dat de belangen van Microsoft en OpenAI weliswaar nauw met elkaar verweven zijn, maar bepaald niet identiek. Microsoft heeft miljarden in OpenAI geïnvesteerd, maar dat betekent niet dat Nadella Microsoft mee zal laten slepen als zou blijken dat OpenAI bijvoorbeeld onrechtmatig data heeft verkregen. Op dat moment is zijn eerste verantwoordelijkheid Microsoft. Dan wordt die investering ineens secundair aan het beperken van juridische, financiële en reputatieschade. Nadella is gewoon bang en dat is terecht!

Sterker nog: juist omdat Microsoft zoveel geld in OpenAI heeft zitten, zal Microsoft buitengewoon voorzichtig zijn met wat het hierover formeel verklaart. Een CEO van een beursgenoteerd bedrijf kan zich niet zomaar permitteren om in een juridische kwestie stellige uitspraken te doen die later aantoonbaar onjuist blijken.

Mijn eigen ervaring met Microsoft sluit daar ook bij aan. Ik doe al decennia zaken met het bedrijf en werkelijk alles wat ook maar enig juridisch risico kan hebben, gaat langs Legal. Zelfs relatief kleine zaken worden soms tot vervelens toe gecontroleerd. Dat bewijst natuurlijk niet dat Nadella gelijk heeft, maar het maakt het wel erg onwaarschijnlijk dat dit soort verklaringen achteloos worden afgegeven.

En nogmaals: lees vooral het document voordat je er hele stellige conclusies aan verbindt. De zaak is aanzienlijk ingewikkelder dan sommige reacties doen vermoeden.
Wat @vickypollard al zei, dit is de mening van 1 medewerker. Dat staat ook in het artikel:
OpenAI en Microsoft gebruiken 'fair use' als verdediging. Zij stellen daarmee dat het gebruik van auteursrechtelijk beschermde werken voor het trainen van AI is toegestaan. Hecht is het daar ook niet mee eens.
Microsoft als bedrijf vindt het maar prima, hun eigen hoofd toegepaste wetenschap vindt het diefstal. Ik vraag me af hoe lang deze man daar nog mag werken.
Dat lijkt haaks te staan op de genoemde opmerking in dit Tweakers artikel, dat Satya het zou afkeuren?
Nee, Satya beweert dat hij het omzeilen van de paywall zou hebben afgekeurd, "als hij had geweten dat het gebeurde." Het trainen op beschermd materiaal lijkt verder geen probleem te zijn voor hem, op basis van het 'fair use' standpunt van Microsoft. Zo interpreteer ik hem nu tenminste...

[Reactie gewijzigd door vickypollard op 18 september 2026 15:29]

Die zijn nog steeds zuur dat ze openai niet vast hebben kunnen houden dus dan slopen ze het maar 🤣
Dit is niet heel verrassend. Wat mij verbaasde is waarom de entertainment sector nog niet is komen huilie huilie en dat agents niet direct films en muziek eruit pompen.
Satya Nadella zei eerder als getuige in de rechtszaak dat hij zou hebben geëist dat OpenAI modellen opnieuw trainde als hij had geweten dat het bedrijf paywalls omzeilde om de grote taalmodellen te trainen.
Ik geloof dit meteen...
Ja natuurlijk, maar daar had hij geen actieve herinnering meer aan..
Ik wilde pas een handleiding vertalen en kreeg toen te horen dat Claude dat niet mocht, want copyright. Vond ik toch wel een uitermate ironische uitspraak.
Ik vind het gewoon bijdehand dat een ander, bedrijf en een rechter bepaald dat het gebruiken van artikelen die iemand geschreven heeft, maar onder fair use moet vallen zodat het gebruikt kan worden om de ander (ai) zich daarmee te verrijken... fair betekend eerlijk, het is natuurlijk helemaal niet eerlijk.
Goh, nieuws artikelen zijn vluchtig.
Het duurt niet lang voor ze niet meer actueel zijn.

Dan vind ik het stelen van boeken en wetenschappelijke artikels toch een pak erger.
Nieuwsartikelen zijn zeker niet vluchtig; ze vormen een goede inkijk in wat er in het verleden is gebeurd. Het is dan ook een waardevolle bron voor geschiedkundigen en journalisten; zeker als het een gerenommeerde journalistieke bron als NYT is. En dat is dan ook het verdienmodel. Als die journalistieke bronnen gewoon leeggetrokken worden zonder te betalen en vervolgens inclusief hallucinaties door AI kunnen worden opgelepeld, is de bron (NYT) dubbel genaaid - ze worden nog wel genoemd, maar ze krijgen er niet voor betaald en mogelijk wordt hun werk verdraaid.
Om een taalmodel te trainen zijn nieuws artikelen juist heel goed, de taal is for de band genomen van hogere kwaliteit dan op sociale media. Het gaat niet enkel om kennis
Of iets vluchtig is of niet maakt natuurlijk niets uit. Ook een nieuws artikel kost geld om te maken en als iemand anders dit gebruikt (steelt) moet er gewoon geld voor worden betaald. Als je daar geen grenzen aan stelt is het einde zoek.

Ik mag ook geen groente uit de supermarkt gratis meenemen als deze over de datum is, ook niet als ik als reden aangeeft dat de hoedbaarheids datum verstreken is……
Ik heb grote moeite met het woord "steelt". Stelen is volgens mij uitsluitend iets onrechtmatig wegnemen zodat de rechtmatige eigenaar er geen gebruik meer van kan maken en daar is hier absoluut geen sprake van. Maar natuurlijk bekt het beter....
Het is geen stelen in de juridische zin des woords, maar een schending van de auteursrechtbescherming. Dat hierdoor de eigenaar van de rechten inkomstenderving ondervindt, is natuurlijk evident in dit geval. Ander woord, zelfde impact voor het slachtoffer.
Als je iets steelt, ontneem je iemand zijn eigendom. In dit geval gaat het om iets creatiefs wat iemand heeft gemaakt en daar zit auteursrecht op. Is het stelen, wellicht niet in de zin van fysiek ontnemen, maar je ontneemt wel iets waar iemand normaal gesproken voor betaald zou worden. In die zin is het voor mij hetzelfde als diefstal, want je ontneemt iemand inkomsten.
Goh, nieuws artikelen zijn vluchtig.
De NYT bevat natuurlijk veel meer dan vluchtig nieuws. De grootste schrijvers publiceren artikelen, de essays zijn beroemd en berucht. Hun researchafdeling is enorm kundig en haalt verborgen zaken boven water die decennia later nog van groot belang blijken.
Tja, ik zag AI eerst als een soort van geavanceerde zoek functie die het hele internet afstruint naar alle informatie die openbaar is en dat dan samenvat voor je, maar als je er meer mee gaat doen zoals zogenaamd nieuwe dingen creëren, dan wordt het inderdaad mogelijk wel dubieus.. Zeker als je bedenkt hoeveel geld er nu mee verdient wordt.. Ik weet verder niet hoe het juridisch allemaal zit dus kan er verder ook weinig over zeggen..
Dat het kopiëren en opslaan van complete artikelen botst met het auteursrecht, is juridisch gezien precies waar het om draait. Een AI leest natuurlijk niet even een krant zoals een mens dat doet; een AI moet de boel keihard kopiëren, opslaan en omzetten in wiskundige data om ermee te kunnen trainen. Dat hele proces van data opslaan en gebruiken is in de basis gewoon een inbreuk op het copyright, tenzij een rechter oordeelt dat het onder fair use valt.


Tegelijkertijd is het wel erg kort door de bocht om te roepen dat dalende klikcijfers automatisch door AI komen. Dat correlatie geen causaal verband is, zie je ook aan andere ontwikkelingen: TikTok en korte videoplatforms hebben de manier waarop mensen informatie consumeren gigantisch veranderd, en dat is minstens zo'n grote boosdoener voor het mislopen van websitebezoek. Maar goed, het punt blijft natuurlijk dat die techbedrijven content grissen zonder te betalen, en dat wringt.
Wat een zak hooi ben je dan… Microsoft Copilot draait op OpenAI modellen, díé getraind zijn op legio bronnen die daar nooit toestemming voor hebben gegeven.

Om te kunnen reageren moet je ingelogd zijn