EasyxLab
Język: PL Polski

Tłumaczenie wykonane przez AI z angielskiego oryginału, który jest wersją referencyjną. Czytaj po angielsku

Badania / S16

Zastrzeżenia dotyczące eksploracji tekstów i danych w prasie UE-27, kanał po kanale

Czy wydawcy prasy w UE wyrażają zastrzeżenia dotyczące eksploracji tekstów i danych, które crawler AI może odczytać niezależnie od swojej nazwy?

Wersja roboczaOpublikowano 2026-10-03

Streszczenie

Od 2 sierpnia 2025 r. akt w sprawie sztucznej inteligencji (Art. 53(1)(c)) wymaga od dostawców modeli AI ogólnego przeznaczenia identyfikowania zastrzeżeń dotyczących eksploracji tekstów i danych wyrażonych na podstawie Art. 4(3) dyrektywy (UE) 2019/790 i stosowania się do nich, „na przykład za pomocą środków nadających się do odczytu maszynowego” w przypadku treści online. Modele wprowadzone do obrotu przed tą datą mają czas do 2 sierpnia 2027 r. (Art. 111(3)). Komisja może nakładać na dostawców kary pieniężne od 2 sierpnia 2026 r.

Odczytaliśmy to, co crawler może odczytać w 1 511 serwisach informacyjnych w 27 państwach członkowskich: gazetach i serwisach informacyjnych z Wikidata, których host znajduje się w pierwszych 100 000 na liście Chrome UX Report danego kraju, z wyłączeniem dzienników urzędowych. Kanałami były robots.txt (RFC 9309), TDMRep (plik, nagłówek HTTP, <meta>), Content-Signal, reguła IETF Content-Usage, noai i llms.txt. Żądanie danego URL wysyłaliśmy tylko wtedy, gdy robots.txt na to pozwalał.

W 1 356 serwisach, które udało się odczytać w całości, 99 z 1 356 (7,3%), 95% CI 6,0–8,8%, wyraża zastrzeżenie wiążące dla crawlera niezależnie od jego nazwy.

  • 558 z 1 356 (41,2%) blokuje w katalogu głównym co najmniej jednego crawlera AI wymienionego z nazwy. Spośród nich 480 z 558 (86,0%), CI 82,9–88,7%, nie wyraża niczego, co odczytałby crawler o nowej nazwie.
  • 777 z 1 356 (57,3%) nie wyraża żadnego zastrzeżenia w żadnym z odczytanych przez nas kanałów.
  • We wszystkich 1 510 serwisach, które odpowiedziały w zakresie robots.txt, liczba zastrzeżeń niezależnych od nazwy wynosi co najmniej 110 z 1 510 (7,3%). Serwisów blokujących crawlery wymienione z nazwy bez zastrzeżenia niezależnego od nazwy jest najwyżej 621 z 699 (88,8%).
  • Według grup wielkości krajów, zastrzeżenia niezależne od nazwy wśród serwisów odczytanych w całości: kraje duże 74 z 800 (9,2%), średnie 15 z 431 (3,5%), małe 10 z 125 (8,0%).
  • Wrażliwość na naszą własną zmianę reguły (D5). Według reguły dostępu zamrożonej przed zbieraniem danych, bez ponownego skanowania D5, wynik wynosi 93 z 1 282 (7,3%), CI 6,0–8,8%, serwisów odczytanych w całości z zastrzeżeniem niezależnym od nazwy oraz 0 sprzeczności.

Kanały.

  • TDMRep występuje w 71 z 1 356 (5,2%), CI 4,2–6,6%. W 58 z 71 przypadków jest tylko w nagłówku lub w elemencie <meta> (meta 41, nagłówek 22, plik 13). Używa go 53 z 192 francuskich serwisów odczytanych w całości (27,6%).
  • Content-Signal ai-train=no pojawia się w 18 serwisach. IETF train-ai=n – w 0.
  • 17 serwisów wysyła Content-Usage: ai=n. Jest to etykieta trenowania AI z draft-ietf-aipref-vocab-01; obecna wersja projektu ją usunęła, więc parsery muszą ją ignorować. Odczytana jako zastrzeżenie dotyczące trenowania podniosłaby udział zastrzeżeń niezależnych od nazwy do 116 z 1 356 (8,6%).
  • Sprzeczności: 2 sprzeczności wśród 1 356 według obecnej reguły, 0 według reguły zamrożonej. Oba przypadki to serwisy Corriere della Sera, które odczytano wyłącznie w ponownym skanowaniu D5. Każdy z nich wysyła Content-Signal ai-train=yes razem z zastrzeżeniem TDMRep w <meta>.
  • 218 z 1 510 (14,4%) zapisuje zastrzeżenie lub ogólny zakaz w komentarzach robots.txt, które parser zgodny z RFC 9309 pomija.

Dostęp i nasze błędy. W przypadku 154 serwisów odczytaliśmy tylko robots.txt, ponieważ celowo zachowawczy detektor oznacza ich komentarze jako ogólny zakaz automatycznego dostępu. Badanie pięć razy naruszyło własną regułę dostępu; każde naruszenie zostało ujawnione, a jego dane usunięte:

  • D0: pilotaż rozpoznawczy.
  • D1: 7 żądań do hosta przed pobraniem jego robots.txt.
  • D2: 245 żądań do 92 serwisów.
  • D4: 3 żądania do jednego serwisu.
  • D7: 72 żądania do 24 serwisów.

Żądania D7 wysłano w ponownym skanowaniu (D5) przeprowadzonym po zebraniu danych, po tym jak koordynujący badanie agent AI zmienił regułę określającą, co liczy się jako zakaz. Instrukcje badania błędnie zaklasyfikowały informację 23 serwisów Mediahuis jako dotyczącą określonego celu. Ogólna reguła EasyxLab (z 3 października 2026 r.) traktuje robots.txt jako wiążący w minimalnym zakresie wymaganym przez prawo. S16 celowo stosuje surowszą regułę, ponieważ przedmiotem badania są właśnie te zastrzeżenia.

Audyty detektorów (wszystkie przeprowadzone przez agentów AI).

  • Próba własna autora, detektory v1/v2: detektor zastrzeżeń był trafny w 54 z 54 oznaczeń; detektor zakazów v2 – w 35 z 62.
  • Pierwszy niezależny recenzent, v1/v2, 44 inne serwisy: zakazy – trafne 15 z 21 oznaczeń i wykryte 15 z 15; zastrzeżenia – trafne 20 z 20 oznaczeń i wykryte 20 z 21.
  • Ponowny recenzent, v3, 43 kolejne serwisy: zakazy 15 z 15 w próbie, ale czułość (recall) około 84% (130 z 154) po uwzględnieniu 24 pominięć D7; zastrzeżenia 15 z 16.
  • v4 zmienia dokładnie te dwa rodzaje błędów. Nie deklarujemy żadnego audytu v4.

Dostawcy. W dniu 2026-10-03 mogliśmy odczytać dokumentację crawlerów 8 z 14 dostawców; każda z tych 8 wymienia robots.txt. Żadna nie wymienia TDMRep, Content-Signal, Content-Usage ani noai.

Wyniki dla poszczególnych serwisów opisują to, co mówią pliki danego serwisu. Nie są oceną serwisu: obowiązek spoczywa na dostawcach AI. Narzędziem do sprawdzania jest scripts/optout_check.py <domain>, który może stać się bezpłatnym narzędziem optout-lint.

Jak cytować to badanie

Cytowanie
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations
BibTeX
@techreport{easyxlab_s16,
  title       = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S16},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}