← Terug naar kennisbank

AI Nieuws

Grote zorgen over AI: nieuwsinhoud schrapen als 'diefstal van arbeid'

Grote zorgen over AI: nieuwsinhoud schrapen als 'diefstal van arbeid'

·

Leestijd: 4 min

De onlangs opengelegde stukken uit de rechtszaak van The New York Times tegen OpenAI en Microsoft geven nieuwe, zorgwekkende details prijs over hoe bedrijven tekst van nieuwsuitgevers verzamelden en gebruikten om AI‑modellen te trainen. De documenten laten interne discussies zien waarin medewerkers en leidinggevenden erkennen dat het schrapen van artikelen grote schade kan toebrengen aan uitgevers en journalisten.

Wat de stukken onthullen

  • Bedrijven haalden grote aantallen artikelen binnen en voegden die samen in trainingsdatasets voor hun AI‑modellen. Een dataset afkomstig uit Common Crawl bevatte meer dan 2 miljoen documenten afkomstig van nytimes.com.

  • Interne tellingen tonen dat onderzoeks‑ en tussenliggende trainingsdatasets alleen al tienduizenden kopieën bevatten van artikelen van The New York Times en andere uitgevers — in totaal naar schatting meer dan 91.000 kopieën van werk van meerdere kranten en onderzoeksredacties.

  • Medewerkers bedachten methodes om betaalmuren te omzeilen. In interne berichten werd gesproken over een ‘hack’ om de betaalmuur van The New York Times te omzeilen.

  • Er zijn aanwijzingen dat copyright‑vermeldingen vooraf werden verwijderd uit de trainingsdata, om te voorkomen dat het model later die meldingen zou reproduceren.

Hoe dit werkte en waarom het opviel

De stukken beschrijven dat OpenAI en Microsoft gegevens met elkaar deelden en gebruikten voor productontwikkeling. Projectnamen zoals Project Mango en Project Taxi kwamen naar voren als initiatieven waarmee data van nieuwsuitgevers in trainingssets belandde. Daarbij kreeg Microsoft volgens de documenten de volledige GPT‑3 trainingsset van OpenAI, die werd gebruikt om dezelfde technologie in commerciële producten te verwerken.

Microsofts eigen meetgegevens lieten een sterke daling zien in het aantal gebruikerskliks naar de website van The New York Times wanneer antwoorden van de AI‑assistenten (zoals Copilot) werden gebruikt. In sommige tests viel het aantal kliks met maximaal 93% terug vergeleken met zoekresultaten uit de gewone zoekmachine. Intern werd dit beschreven als een gevaarlijke neerwaartse spiraal voor zowel de modellen als voor het web als informatiebron.

Wat leidinggevenden zelf zeiden

In de documenten staat dat sommige leiders en onderzoekers het gebruik van nieuwsinhoud als problematisch zagen. Een intern memo noemde het schrapen van inhoud een diefstal van arbeid van ongekende omvang. Een andere leidinggevende sprak van een ‘existentiële bedreiging’ voor uitgevers omdat AI‑producten in veel gevallen het oorspronkelijke artikel kunnen vervangen in plaats van erop te wijzen waar de informatie vandaan komt.

Microsoft‑topman Satya Nadella verklaarde onder ede dat alles wat achter een betaalmuur staat gelicenseerd zou moeten worden als het gebruikt wordt voor trainen of als ‘grondslag’ voor AI. Hij zei ook dat hij OpenAI verplicht zou hebben om modellen opnieuw te trainen als hij had geweten dat er op grote schaal achter betaalmuren gehaalde inhoud was gebruikt.

OpenAI‑leiders noemden de modellen ‘zeer goed in nieuws’, en erkenden dat chatproducten steeds vaker het bezoek aan oorspronkelijke bronnen kunnen vervangen. Dat raakt precies aan een van de belangrijke juridische toetspunten: als het gebruik van materiaal het marktpotentieel van het origineel schaadt of vervangt, kan dat het rechtvaardigen als vrij gebruik (fair use) ondermijnen.

Juridische context en gevolgen

De centrale vraag in de zaak is of het trainen van AI op auteursrechtelijk beschermde teksten zonder toestemming is toegestaan. Tot nu toe hebben rechtbanken vaak meeging met argumenten van AI‑bedrijven dat trainen onder bepaalde omstandigheden onder ‘fair use’ valt. De Amerikaanse overheid heeft zich in recente stukken ook in het voordeel van OpenAI uitgesproken.

Toch brengen de nieuwe, niet‑gecensureerde verklaringen uitdagingen voor dat standpunt: als intern zelf wordt erkend dat de producten werkelijke vervanging van nieuws kunnen zijn en dat gebruik de inkomsten van uitgevers aantast, dan ondermijnt dat het argument dat er geen marktschade is.

Conclusie

De recent vrijgegeven stukken geven een uitgebreider beeld van hoe grote AI‑bedrijven nieuwsinhoud verzamelden en gebruikten. Ze laten zien dat er zowel praktische stappen werden gezet — zoals het omzeilen van betaalmuren en het weghalen van copyright‑vermeldingen — als dat leidinggevenden zich bewust waren van de mogelijke economische schade voor uitgevers en journalisten. Die feiten kunnen van invloed zijn op hoe rechters en wetgevers in de toekomst beoordelen wat wel en niet mag bij het trainen van AI‑modellen met beschermde content.