Studie / S16
Výhrady vytěžování textů a dat v tisku EU-27, kanál po kanálu
Uvádějí zpravodajští vydavatelé v EU výhrady vytěžování textů a dat, které crawler AI dokáže přečíst bez ohledu na svůj název?
Abstrakt
Od 2. srpna 2025 akt o umělé inteligenci (Art. 53(1)(c)) vyžaduje, aby poskytovatelé obecných modelů AI určovali a dodržovali výhrady vytěžování textů a dat vyjádřené podle Art. 4(3) směrnice (EU) 2019/790, „jako jsou strojově čitelné prostředky“ v případě obsahu online. Modely uvedené na trh před tímto datem mají lhůtu do 2. srpna 2027 (Art. 111(3)). Komise může poskytovatelům ukládat pokuty od 2. srpna 2026.
Přečetli jsme, co může crawler přečíst na 1 511 zpravodajských webech ve 27 členských státech: noviny a zpravodajské weby z Wikidata, jejichž host je v prvních 100 000 seznamu Chrome UX Report dané země, s vyloučením úředních věstníků. Kanály byly robots.txt (RFC 9309), TDMRep (soubor, hlavička HTTP, <meta>), Content-Signal, pravidlo IETF Content-Usage, noai a llms.txt. URL jsme požadovali jen tam, kde to robots.txt povoloval.
Na 1 356 webech, které jsme mohli přečíst celé, uvádí 99 z 1 356 (7,3 %), 95% IS 6,0–8,8 %, výhradu, která je závazná pro crawler bez ohledu na jeho název.
- 558 z 1 356 (41,2 %) blokuje v kořeni alespoň jeden jmenovitě uvedený crawler AI. Z nich 480 z 558 (86,0 %), IS 82,9–88,7 %, neuvádí nic, co by přečetl crawler s novým názvem.
- 777 z 1 356 (57,3 %) neuvádí žádnou výhradu v žádném kanálu, který jsme četli.
- Napříč všemi 1 510 weby, které odpověděly na
robots.txt, je počet výhrad nezávislých na názvu nejméně 110 z 1 510 (7,3 %). Webů blokujících jmenovitě uvedené crawlery bez výhrady nezávislé na názvu je nejvýše 621 ze 699 (88,8 %). - Podle velikostní skupiny zemí, výhrady nezávislé na názvu mezi plně přečtenými weby: velké země 74 z 800 (9,2 %), střední 15 ze 431 (3,5 %), malé 10 ze 125 (8,0 %).
- Citlivost na naši vlastní změnu pravidla (D5). Podle pravidla přístupu zmrazeného před sběrem dat, bez opakovaného skenování D5, je výsledek 93 z 1 282 (7,3 %), IS 6,0–8,8 %, plně přečtených webů s výhradou nezávislou na názvu a 0 rozporů.
Kanály.
- TDMRep je na 71 z 1 356 (5,2 %), IS 4,2–6,6 %. U 58 ze 71 je jen v hlavičce nebo v elementu
<meta>(meta 41, hlavička 22, soubor 13). Používá ho 53 ze 192 plně přečtených francouzských webů (27,6 %). - Content-Signal
ai-train=nose objevuje na 18 webech. IETFtrain-ai=nna 0. - 17 webů posílá
Content-Usage: ai=n. To je označení pro trénování AI z draft-ietf-aipref-vocab-01; aktuální verze návrhu ho vypustila, takže parsery ho musí ignorovat. Pokud by se četlo jako výhrada trénování, zvýšilo by podíl výhrad nezávislých na názvu na 116 z 1 356 (8,6 %). - Rozpory: 2 rozpory mezi 1 356 weby podle současného pravidla, 0 podle zmrazeného pravidla. Oba jsou weby Corriere della Sera, které byly přečteny jen při opakovaném skenování D5. Každý z nich posílá Content-Signal
ai-train=yesspolu s výhradou TDMRep v<meta>. - 218 z 1 510 (14,4 %) zapisuje výhradu nebo obecný zákaz do komentářů v
robots.txt, které parser podle RFC 9309 zahazuje.
Přístup a co jsme udělali špatně. U 154 webů jsme četli jen robots.txt, protože záměrně konzervativní detektor označuje jejich komentáře jako obecný zákaz automatizovaného přístupu. Studie pětkrát porušila vlastní pravidlo přístupu; každé porušení je přiznáno a jeho data smazána:
- D0: průzkumný pilot.
- D1: 7 požadavků na host před jeho
robots.txt. - D2: 245 požadavků na 92 webů.
- D4: 3 požadavky na jeden web.
- D7: 72 požadavků na 24 webů.
Požadavky D7 byly odeslány při opakovaném skenování (D5) provedeném po sběru dat, poté co koordinující agent AI studie změnil pravidlo pro to, co se počítá jako zákaz. Pokyny studie chybně klasifikovaly upozornění 23 webů Mediahuis jako účelově specifické. Celolaboratorní pravidlo EasyxLab (3. října 2026) považuje robots.txt za závazný v zákonném minimu. Studie S16 záměrně zachovává přísnější pravidlo, protože jejím předmětem jsou právě tyto výhrady.
Audity detektorů (všechny provedli agenti AI).
- Vlastní vzorek autora, detektory v1/v2: detektor výhrad byl správný u 54 z 54 označení; detektor zákazů v2 u 35 ze 62.
- První nezávislý recenzent, v1/v2, 44 jiných webů: zákaz správně u 15 z 21 označení a nalezeno 15 z 15; výhrada správně u 20 z 20 označení a nalezeno 20 z 21.
- Opakovaný recenzent, v3, 43 dalších webů: zákaz 15 z 15 ve vzorku, ale úplnost (recall) přibližně 84 % (130 ze 154) po započtení 24 přehlédnutí D7; výhrada 15 ze 16.
- v4 mění přesně tyto dva typy selhání. Žádný audit v4 neuvádíme.
Poskytovatelé. Dne 2026-10-03 jsme mohli přečíst dokumentaci crawlerů 8 ze 14 poskytovatelů; všech 8 uvádí robots.txt. Žádný neuvádí TDMRep, Content-Signal, Content-Usage ani noai.
Výsledky pro jednotlivé weby uvádějí, co říkají soubory daného webu. Nejsou hodnocením webu: povinnost mají poskytovatelé AI. Nástrojem pro kontrolu je scripts/optout_check.py <domain>, z něhož se může stát bezplatný nástroj optout-lint.
Citovat tuto studii
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}