
Prawo autorskie a dane treningowe: na czym polega spór
Redakcja Doba AIOpublikowano 13 sierpnia 2026Sprawdzone 6 września 202612 min czytania
Spór o dane treningowe wygląda na jeden, a jest co najmniej trzema — i każdy z nich toczy się przed innym forum, na innych przepisach i z innym wynikiem. Osobno rozstrzyga się, czy wolno trenować na cudzych utworach, osobno, skąd wzięto materiał, a osobno, czyje jest to, co model wygeneruje.
To rozróżnienie nie jest akademickie. Od niego zależy, czy amerykański wyrok cokolwiek mówi o Twojej sytuacji w Polsce — a najczęściej nie mówi nic.
Trzy pytania, a nie jeden spór
Zanim wejdziemy w przepisy, warto rozdzielić rzeczy, które w publicystyce zlewają się w jedno zdanie „AI kradnie twórcom”.
- Wejście. Czy zwielokrotnienie cudzych utworów po to, żeby wytrenować model, wymaga zgody uprawnionego?
- Sposób pozyskania. Skąd wzięto egzemplarze — z licencji, z otwartej sieci, czy z serwisu z pirackimi kopiami? To dziś oddzielne pytanie od poprzedniego.
- Wyjście. Czy to, co model wygenerował, narusza czyjeś prawa — i czy samo w sobie jest utworem, do którego ktokolwiek ma prawa.
Te trzy pytania mają różne odpowiedzi w różnych systemach prawnych i, co ważniejsze, rozstrzygają się w różnym tempie. Pierwsze jest najdalej posunięte w Stanach Zjednoczonych, drugie okazało się w praktyce najkosztowniejsze, trzecie pozostaje najbardziej otwarte.
Wejście: czy wolno trenować na cudzych utworach
W Stanach Zjednoczonych pytanie rozstrzyga się przez doktrynę dozwolonego użytku (fair use) z § 107 ustawy o prawie autorskim — czteroczynnikowy test, który sąd stosuje do konkretnego stanu faktycznego. Nie ma tam zamkniętej listy dozwolonych sposobów korzystania; jest ocena.
Najdalej idące jak dotąd rozstrzygnięcie zapadło 23 czerwca 2025 r. w sprawie Bartz v. Anthropic przed sądem federalnym w Kalifornii. Sędzia William Alsup napisał wprost, że wykorzystanie spornych książek do trenowania modelu było „w wyjątkowym stopniu przekształcające i stanowiło dozwolony użytek w rozumieniu § 107”. Zdigitalizowanie kupionych egzemplarzy papierowych również uznał za dozwolone — ale z innego powodu: firma jedynie zastąpiła kupione egzemplarze wygodniejszymi kopiami cyfrowymi, nie tworząc nowych egzemplarzy ani ich nie rozpowszechniając. [5]
To jest ta część orzeczenia, którą cytuje się najczęściej. Znacznie ciekawsza jest druga.
Sposób pozyskania stał się osobną osią sporu
W tym samym orzeczeniu sąd rozdzielił dwie rzeczy, które przez lata traktowano łącznie: cel wykorzystania i pochodzenie egzemplarzy. Anthropic pobrał ponad siedem milionów książek z serwisów udostępniających kopie bez zgody uprawnionych, między innymi z Library Genesis i Pirate Library Mirror. Sąd napisał, że firmie „nie przysługiwało uprawnienie do wykorzystania pirackich kopii w swojej centralnej bibliotece”, a zbudowanie trwałego zbioru ogólnego przeznaczenia nie było samo w sobie dozwolonym użytkiem usprawiedliwiającym to pobranie. [5]
Rachunek za tę część okazał się realny. Sprawa zakończyła się ugodą na 1,5 mld dolarów, którą sąd zatwierdził ostatecznie 20 lipca 2026 r. — to najwyższa znana ugoda w amerykańskiej sprawie o prawa autorskie. Przy szacunkowo pół miliona utworów objętych porozumieniem daje to około trzech tysięcy dolarów na utwór. [6]
Wniosek jest niewygodny dla obu stron sporu. Trenowanie samo w sobie może być legalne, a mimo to firma zapłaci — nie za trenowanie, tylko za sposób, w jaki weszła w posiadanie materiału. Prawnicza oś przesunęła się z pytania „po co skopiowano” na pytanie „skąd wzięto”.
Europa poszła inną drogą niż Ameryka
W Unii Europejskiej nie ma odpowiednika fair use. Zamiast otwartego testu obowiązuje zamknięta lista wyjątków, a interesujące nas dwa wprowadziła dyrektywa 2019/790 o prawie autorskim na jednolitym rynku cyfrowym. Art. 3 pozwala na eksplorację tekstów i danych instytucjom badawczym i instytucjom dziedzictwa kulturowego do celów badań naukowych. Art. 4 idzie szerzej — pozwala każdemu — ale pod warunkiem, którego w prawie amerykańskim nie ma: uprawniony może korzystanie zastrzec. [1]
To jest fundamentalna różnica konstrukcyjna. Amerykański sąd pyta, czy dane wykorzystanie było przekształcające i jak wpłynęło na rynek utworu. Europejski ustawodawca postawił sprawę odwrotnie: eksplorować wolno domyślnie, dopóki uprawniony nie powie „nie”. Wyrok z Kalifornii nie odpowiada więc na żadne pytanie zadane po tej stronie Atlantyku — bo tu nikt nie pyta o przekształcający charakter.
Do tego doszła warstwa, której w 2019 r. jeszcze nie było. Akt o sztucznej inteligencji nakłada na dostawców modeli ogólnego przeznaczenia dwa obowiązki: wdrożenie polityki zgodności z unijnym prawem autorskim, w tym rozpoznawania zastrzeżeń złożonych na podstawie art. 4 ust. 3 dyrektywy, oraz opublikowanie „wystarczająco szczegółowego podsumowania” treści użytych do trenowania, według wzoru przygotowanego przez Urząd ds. AI. [3] Komisja opublikowała ten wzór 24 lipca 2025 r., a obowiązki dla modeli ogólnego przeznaczenia stosuje się od 2 sierpnia 2025 r. [4]
Innymi słowy: w Europie zastrzeżenie praw przestało być deklaracją bez adresata. Ktoś ma obowiązek go szukać.
Polska: art. 26² i 26³, i co znaczy „zastrzegł inaczej”
Polska wdrożyła te wyjątki nowelizacją, która weszła w życie 20 września 2024 r. W ustawie o prawie autorskim i prawach pokrewnych pojawiły się dwa przepisy. Art. 26² pozwala instytucjom dziedzictwa kulturowego oraz uczelniom i instytutom zwielokrotniać utwory w celu eksploracji tekstów i danych do celów badań naukowych, jeżeli nie robią tego dla bezpośredniej lub pośredniej korzyści majątkowej. [2]
Art. 26³ ust. 1 jest krótki i to on dotyczy komercyjnego trenowania modeli: „Wolno zwielokrotniać rozpowszechnione utwory w celu eksploracji tekstów i danych, chyba że uprawniony zastrzegł inaczej”. [2]
Cała praktyczna waga leży w ostatnich trzech słowach — i w ustępie drugim, który mówi, jak takie zastrzeżenie zrobić. Ma być wyraźne i odpowiednie do sposobu udostępnienia utworu. Dla materiałów opublikowanych w internecie ustawa wymaga formatu przeznaczonego do odczytu maszynowego wraz z metadanymi. [2]
Ma to dwie konsekwencje, o których rzadko się mówi razem. Po pierwsze, zdanie „zastrzegam wszelkie prawa” w stopce strony albo w opisie profilu prawdopodobnie nie spełnia tego wymogu — nie jest przeznaczone do odczytu maszynowego. Po drugie, twórca, który niczego nie zastrzegł, nie stoi na tym samym gruncie co twórca amerykański: w Polsce eksploracja jego materiału mieści się w wyjątku ustawowym, a nie jest przedmiotem sporu o dozwolony użytek.
Co już rozstrzygnięto, a co nadal wisi
Poza sprawą Anthropic warto znać dwa punkty odniesienia, bo dotyczą zupełnie innych fragmentów problemu.
Getty Images przeciwko Stability AI. Wysoki Trybunał w Londynie wydał wyrok 4 listopada 2025 r. Sąd oddalił główne roszczenie o wtórne naruszenie prawa autorskiego, przyjmując, że model nie zawiera reprodukcji spornych utworów — same wagi modelu nie są więc „egzemplarzem naruszającym”. Getty wygrało jedynie w ograniczonym zakresie roszczenia znakowe, dotyczące odtwarzania znaków wodnych. [7] Jeżeli zastanawiasz się, czym w ogóle są „wagi modelu”, tłumaczymy to przy okazji różnicy między otwartymi wagami a zamkniętym API.
The New York Times przeciwko OpenAI i Microsoftowi. Sprawa nadal się toczy przed sądem federalnym w Nowym Jorku i to ona jest obserwowana najuważniej. We wrześniu 2026 r. amerykański Departament Sprawiedliwości złożył stanowisko popierające tezę, że trenowanie modeli językowych na chronionych tekstach mieści się w dozwolonym użytku. [8] Stanowisko rządu nie jest wyrokiem i sądu nie wiąże, ale pokazuje, jak wysoką stawkę widzą w tej sprawie strony trzecie.
Trzy sprawy, trzy różne przedmioty: pochodzenie korpusu, zawartość wag modelu i status samego trenowania. Wyrok w jednej nie przesądza pozostałych — i to jest najkrótsza odpowiedź na pytanie, dlaczego „spór o dane treningowe” tak długo się nie kończy.
Wyjście: czyje jest to, co model wygeneruje
To osobne pytanie i ma osobną odpowiedź. Polska ustawa definiuje utwór jako „każdy przejaw działalności twórczej o indywidualnym charakterze, ustalony w jakiejkolwiek postaci”. [2] Punktem wyjścia jest działalność twórcza, a ta w polskiej tradycji prawnej przypisywana jest człowiekowi. Ustawa nie zawiera przepisu, który przyznawałby prawa do materiału wygenerowanego przez maszynę, i nie ma orzecznictwa, które by tę lukę zamykało.
Kierunek jest podobny po drugiej stronie Atlantyku. Amerykański Urząd ds. Praw Autorskich w drugiej części raportu o sztucznej inteligencji, opublikowanej 29 stycznia 2025 r., podtrzymał wymóg ludzkiego autorstwa jako warunek ochrony i analizował, ile ludzkiego wkładu w materiał wygenerowany maszynowo wystarcza, by ochrona powstała. [9]
Praktyczny skutek bywa zaskakujący dla osób, które pierwszy raz się nad tym zastanawiają. Grafika wygenerowana samym poleceniem tekstowym może nie mieć autora w rozumieniu prawa autorskiego — a to znaczy nie tyle, że jest Twoja, ile że nikt nie ma do niej praw wyłącznych i nikt nie może zabronić jej użycia komuś innemu.
Co to znaczy dla kogoś, kto używa tych narzędzi w pracy
Z tego wszystkiego wynikają cztery praktyczne rzeczy, niezależne od tego, jak skończy się sprawa w Nowym Jorku.
- Jeśli publikujesz własną twórczość: zastrzeżenie z art. 26³ ust. 2 działa tylko wtedy, gdy jest w formacie do odczytu maszynowego. Deklaracja w stopce to za mało — trzeba użyć mechanizmu, który maszyna przeczyta.
- Jeśli zamawiasz materiały: pytanie „czy to zrobiła AI” jest mniej istotne niż pytanie, kto ma do tego prawa. Przy czysto maszynowym wyniku odpowiedź może brzmieć „nikt”, a wtedy klauzula o przeniesieniu praw autorskich nie przenosi niczego.
- Jeśli używasz generatora obrazów: spór o wejście toczy się między dostawcą a uprawnionymi, ale za wynik podobny do cudzego znaku albo postaci odpowiadasz Ty, jako publikujący. Znak wodny w wyniku to sygnał ostrzegawczy, nie ciekawostka.
- Jeśli wybierasz dostawcę do zastosowania firmowego: podsumowanie danych treningowych z art. 53 aktu o AI jest publiczne. To dziś jedyny dokument, w którym dostawca sam opisuje, na czym trenował.
Warto też uczciwie zaznaczyć granicę tego tekstu. Opisuje on stan na wrzesień 2026 r., a najważniejsza amerykańska sprawa nie ma jeszcze rozstrzygnięcia co do istoty. Jeśli chcesz od strony praktycznej podejść do samych narzędzi, zaczynamy od podstaw w tekście o generatorach obrazów AI.
FAQ: prawo autorskie a dane treningowe
Czy trenowanie modelu na moich tekstach jest w Polsce legalne?
Co do zasady tak, na podstawie art. 26³ ust. 1 ustawy o prawie autorskim — wolno zwielokrotniać rozpowszechnione utwory w celu eksploracji tekstów i danych, chyba że uprawniony zastrzegł inaczej. Kluczowe jest to zastrzeżenie: dla materiałów udostępnionych w internecie musi być w formacie przeznaczonym do odczytu maszynowego wraz z metadanymi.
Jak skutecznie zastrzec, żeby nie trenowano na moich materiałach?
Ustawa wymaga zastrzeżenia wyraźnego i odpowiedniego do sposobu udostępnienia utworu, a dla publikacji internetowych — odczytywalnego maszynowo, z metadanymi. Samo zdanie w regulaminie lub w stopce prawdopodobnie tego warunku nie spełnia. Przepis nie wskazuje jednej konkretnej technologii, więc wybór mechanizmu należy do uprawnionego.
Czy amerykańskie wyroki mają znaczenie dla polskiego twórcy?
Pośrednie. Amerykańskie sądy stosują otwarty test dozwolonego użytku, którego w prawie polskim i unijnym nie ma — u nas obowiązuje zamknięty wyjątek na eksplorację tekstów i danych z możliwością zastrzeżenia. Wyroki wpływają natomiast na praktykę dostawców i na to, jak budują korpusy treningowe.
Czy mam prawa autorskie do obrazu wygenerowanego z mojego polecenia?
Prawdopodobnie nie do samego wyniku, jeżeli powstał wyłącznie z polecenia tekstowego. Polska ustawa chroni przejaw działalności twórczej o indywidualnym charakterze, a nie każdy rezultat pracy narzędzia. Praktyczny skutek jest taki, że materiał może nie mieć wyłącznego uprawnionego — regulamin dostawcy określa warunki korzystania, ale nie tworzy praw autorskich tam, gdzie ustawa ich nie przyznaje.
Dlaczego Anthropic zapłacił 1,5 mld dolarów, skoro sąd uznał trenowanie za dozwolone?
Bo to dwie różne kwestie. Sąd uznał samo trenowanie za dozwolony użytek, ale odmówił tej oceny pobraniu i przechowywaniu pirackich kopii w wewnętrznej bibliotece. Ugoda dotyczyła tej drugiej części; sąd zatwierdził ją ostatecznie 20 lipca 2026 r.
Czy mogę sprawdzić, na czym trenowano dany model?
Częściowo. Dostawcy modeli ogólnego przeznaczenia mają obowiązek opublikować wystarczająco szczegółowe podsumowanie treści treningowych według wzoru przygotowanego przez Urząd ds. AI; wzór opublikowano 24 lipca 2025 r. To podsumowanie, a nie wykaz pojedynczych utworów — pozwala ocenić główne źródła, nie sprawdzić konkretnego tekstu.
Źródła
- Dyrektywa (UE) 2019/790 o prawie autorskim na jednolitym rynku cyfrowym — Art. 3 i 4 (eksploracja tekstów i danych, zastrzeżenie praw z art. 4 ust. 3).
- Ustawa o prawie autorskim i prawach pokrewnych — Art. 1 (pojęcie utworu) oraz art. 26² i 26³ (eksploracja tekstów i danych, forma zastrzeżenia).
- Akt o sztucznej inteligencji — art. 53 — Polityka zgodności z prawem autorskim i publiczne podsumowanie treści treningowych.
- Komisja Europejska — wzór publicznego podsumowania treści treningowych — Dokument opublikowany 24 lipca 2025 r. wraz z notą wyjaśniającą.
- Bartz v. Anthropic PBC — Order on Fair Use (23 czerwca 2025 r.) — Rozdzielenie oceny trenowania od oceny pochodzenia egzemplarzy.
- JURIST — zatwierdzenie ugody na 1,5 mld dolarów (20 lipca 2026 r.) — Ostateczne zatwierdzenie i skala wypłat dla uprawnionych.
- Getty Images (US) Inc i inni przeciwko Stability AI Ltd [2025] EWHC 2863 (Ch) — Wyrok z 4 listopada 2025 r.: wagi modelu a pojęcie egzemplarza naruszającego.
- IPWatchdog — stanowisko Departamentu Sprawiedliwości w sprawie NYT przeciwko OpenAI — Opis pisma złożonego 1 września 2026 r. i jego argumentacji.
- U.S. Copyright Office — Copyright and Artificial Intelligence, Part 2: Copyrightability — Raport z 29 stycznia 2025 r. o wymogu ludzkiego autorstwa.
Źródła sprawdzono 6 września 2026 r. Tekst opisuje stan na ten dzień i nie jest poradą prawną. Sprawa The New York Times przeciwko OpenAI i Microsoftowi nie została rozstrzygnięta co do istoty.