Een vierde krant sluit zich aan bij dezelfde zaak

Seattle Times en Newsday spanden op 4 september 2026 een rechtszaak aan tegen OpenAI en Microsoft bij de Amerikaanse federale rechtbank voor het zuidelijke district van New York. Beide kranten beweren dat de bedrijven hun websites doorzochten, inclusief content achter een betaalmuur, en die berichtgeving verwerkten in de datasets waarmee ChatGPT, Microsoft Copilot en de AI-functies van Bing worden getraind en uitgevoerd. Ze vragen niet alleen schadevergoeding. Hun klacht vraagt de rechtbank te gelasten dat elk AI-model of elke trainingsdataset die hun werk bevat, wordt vernietigd, dezelfde remedie die de New York Times eiste toen die deze golf van rechtszaken in december 2023 opende.

De zaak voegt zich bij een dossier dat al tientallen uitgevers, auteurs en beeldbanken omvat die dezelfde handvol AI-bedrijven aanklagen wegens hetzelfde onderliggende verwijt: trainen op auteursrechtelijk beschermd materiaal zonder licentie is inbreuk, geen redelijk gebruik. Seattle Times en Newsday brengen minder iets nieuws in dan gewicht toe aan een zaak die al bijna drie jaar groeit en nu gebundeld is als NYT tegen Microsoft en anderen.

Het cijfer dat Microsoft op papier zette

In de bewijsfase van die gebundelde zaak overhandigde Microsoft de deskundige van de krantenaanklagers ongeveer 8,2 miljoen Copilot-gespreksslogs. Het bedrijf stelt dat die logs geen willekeurige steekproef van Copilot-gebruik waren, maar specifiek gefilterd waren omdat ze trefwoorden bevatten die verbonden waren aan de websites van de eisende kranten, oftewel precies de gesprekken waarin een treffer het meest waarschijnlijk was. Zelfs binnen die al bevooroordeelde steekproef vond de deskundige slechts 59.545 gesprekken, minder dan één procent van het totaal, die 16 of meer opeenvolgende woorden uit een artikel van een eiser reproduceerden. Een parallelle controle op dezelfde logs vond 24 overeenkomende antwoorden voor boekinhoud, een percentage dat Microsofts stuk op 0,00029 procent stelt.

Microsofts argument volgt rechtstreeks uit de cijfers: als een hulpmiddel dat specifiek is gebouwd om waarschijnlijke inbreuk aan het licht te brengen, die toch in minder dan één op de honderd gevallen vindt, is reproductie niet het systemische gedrag dat de eisers beschrijven, en zouden rechtbanken die redelijk gebruik afwegen, dit als een zeldzame uitzondering moeten behandelen, niet als representatief.

Waarom hetzelfde cijfer de zaak niet beslecht

Het rechtbankstuk levert een echt datapunt in een strijd die meestal met retoriek wordt gevoerd, en dat verdient op zich serieuze aandacht. Maar een vooraf gefilterde steekproef, opgezet om treffers te vinden, zet een ondergrens voor hoe vaak reproductie voorkomt, geen bovengrens; een bredere, ongefilterde steekproef van al het Copilot-verkeer zou een nog lager werkelijk percentage kunnen tonen, of het filter zou geparafraseerde reproducties gemist kunnen hebben die nooit de drempel van 16 woorden haalden die Microsofts deskundige gebruikte. De kranten beweren niet alleen woordelijk kopiëren. Ze stellen ook dat Copilot en ChatGPT hun berichtgeving op de voet kunnen parafraseren en lezersvragen zo kunnen beantwoorden dat elke reden vervalt om het oorspronkelijke artikel te bezoeken of voor een abonnement te betalen, een schade die een woordentelling helemaal niet meet.

Het praktische geschil gaat niet zozeer over hoe vaak reproductie voorkomt. Het gaat erom of een klein, aantoonbaar percentage woordelijk kopiëren genoeg is om een zo absolute remedie te rechtvaardigen als het bevelen van de vernietiging van een getraind model, terwijl het isoleren van de tekst van een enkele eiser binnen een model met honderden miljarden parameters niet eenvoudig is, zelfs als een rechtbank het bevel toewijst.

Het deel dat telt buiten de Amerikaanse rechtszaal

Europese lezers moeten het antwoord op de reproductievraag waarover deze zaak strijdt niet in Brussel zoeken. De transparantieplicht van artikel 53 van de EU AI-verordening, al van kracht voor aanbieders van AI-modellen voor algemene doeleinden, vereist een samenvatting van de contentcategorieën die bij het trainen zijn gebruikt. Ze vereist niet, en zal niet leiden tot, een audit van het reproductiepercentage zoals die waartoe Microsoft door een Amerikaanse rechtbank werd gedwongen. Dat betekent dat de praktische norm voor hoeveel woordelijk kopiëren een licentieovereenkomst of vrijwaringsclausule moet dekken, geval per geval wordt vastgesteld in Amerikaanse rechtszaken, niet door EU-regelgeving.

Elk Europees bedrijf dat Copilot, ChatGPT Enterprise of een vergelijkbaar getraind hulpmiddel koopt voor een activiteit die zelf auteursrechtelijk beschermde content produceert, journalistiek, technische documentatie of code, moet verwachten dat leverancierscontracten binnenkort rechtstreeks cijfers als Microsofts 59.545 van 8,2 miljoen gaan citeren, want dat is nu het dichtste wat de sector heeft bij een bewezen antwoord in plaats van een louter beweerd antwoord.

Servola Journal

We doen dit voor iedereen die probeert bij te blijven met wat technologie met ons leven doet. De mensen die het bouwen, en de mensen die het overkomt. Servola Journal bestaat zodat wat we leren van hen allemaal is.

Niemand betaalt ons hiervoor. Geen advertenties, geen betaalmuur, gratis voor iedereen. We geloven gewoon dat begrijpen wat er met ons allemaal gebeurt niet zou moeten afhangen van wie het zich kan veroorloven ervoor te betalen.

Als dit je vandaag iets heeft gegeven, zeg ons dan om door te gaan. Volg ons, laat een like achter, of schrijf een positieve reactie. We lezen ze allemaal, en ze zijn wat ons op de been houdt.