Co pokazują odtajnione dokumenty

Pismo procesowe odtajnione 17 września 2026 roku w sprawie o naruszenie praw autorskich wytoczonej przez New York Timesa Microsoftowi i OpenAI cytuje dyrektora Microsoftu, który własnymi słowami określa praktykę treningu AI obu firm jako kradzież. Brent Hecht, Director of Applied Science w Microsofcie, napisał w wewnętrznej wiadomości ze stycznia 2024 roku, że zbieranie chronionych prawem autorskim treści do treningu AI było zdumiewającą kradzieżą o niespotykanej skali i być może największą kradzieżą pracy w historii ludzkości. To samo pismo cytuje szefa ChatGPT w OpenAI, Nicka Turleya, który określa produkty AI jako egzystencjalne zagrożenie dla wydawców, ponieważ w dużej mierze zastępują oryginalne dziennikarstwo.

Również własne zeznania złożone pod przysięgą przez dyrektora generalnego Microsoftu, Satyę Nadellę, wspomniane w tym samym piśmie, stwierdzają, że treści zza paywalla powinny być licencjonowane każdemu, kto chce ich użyć do kontekstu lub treningu, oraz że zażądałby ponownego treningu modeli, gdyby wiedział, że płatny materiał został zebrany bez licencji.

Dlaczego to ma znaczenie: słaby punkt obrony fair use

Amerykańskie prawo fair use zadaje dwa pytania, na które te dokumenty odpowiadają wprost: czy firma wiedziała, że jej wykorzystanie może wyrządzić szkodę, oraz czy powstały produkt zastępuje oryginał na rynku. Wewnętrzne przyznanie własnego dyrektora nauk stosowanych, że praktyka była kradzieżą o niespotykanej skali, odpowiada na pierwsze pytanie na korzyść strony powodowej, jeszcze zanim ława przysięgłych wysłucha biegłego. Sformułowanie Turleya o egzystencjalnym zagrożeniu odpowiada na drugie. Żadne z tych dwóch stwierdzeń nie zostało napisane z myślą o procesie sądowym. Oba zostały napisane dla siebie nawzajem, i właśnie dlatego prawnicy strony powodowej chcieli, aby je odtajniono.

To nie ogranicza się do Microsoftu i OpenAI. Każda firma AI broniąca się w sporze o dane treningowe powołaniem się na fair use musi teraz zakładać, że jej własne wewnętrzne wiadomości Slack, e-maile i notatki ze spotkań niosą to samo ryzyko, a prywatne oceny własnych kadry kierowniczej na temat własnych produktów mogą stać się najlepszym dowodem strony przeciwnej.

Skala, we własnych liczbach firm

WskaźnikLiczba
Spadek wskaźnika klikalności do nytimes.com po uruchomieniu CopilotaNawet 93 procent
Kopie utworów New York Timesa, Daily News i Center for Investigative Reporting w danych treningowych OpenAIPonad 91 692
Unikalne utwory wydawców w zbiorze treningowym Project MangoPonad 160 903
Dokumenty z samego nytimes.com w zbiorze Common CrawlPonad 2 000 000

To nie są szacunki strony powodowej. Te liczby pochodzą z własnych dzienników danych treningowych i analiz ruchu obu firm, włączonych do akt sprawy, ponieważ firmy same je już wcześniej policzyły wewnętrznie.

Co to oznacza, jeśli licencjonujesz lub publikujesz treści

Jeśli twoja firma czerpie przychody z treści zza paywalla, subskrypcji lub licencji, te akta zmieniają twoją pozycję negocjacyjną wobec każdego dostawcy AI, który zebrał lub mógłby zebrać twoje materiały. Nie musisz już udowadniać, że dostawca wiedział, że zbieranie płatnych treści było ryzykowne. O firmie trenującej modele na twojej pracy można założyć, że posiada wewnętrzną dokumentację tej decyzji, a sądy są teraz skłonne ją odtajnić. Praktycznym krokiem jest potraktowanie każdej obecnej lub przeszłej ekspozycji na trening AI jako rozmowy licencyjnej do otwarcia już teraz, a nie jako pozwu składanego dopiero po udowodnieniu szkody.