EasyxLab
Jazyk: SK Slovenčina

Preklad anglického originálu pomocou AI; referenčnou verziou je originál. Čítať v angličtine

Štúdie / S16

Výhrady vyťažovania textov a dát v tlači EÚ-27, kanál po kanáli

Uvádzajú spravodajskí vydavatelia v EÚ výhrady vyťažovania textov a dát, ktoré crawler AI dokáže prečítať bez ohľadu na svoj názov?

Pracovná verziaZverejnené 2026-10-03

Abstrakt

Od 2. augusta 2025 akt o umelej inteligencii (Art. 53(1)(c)) vyžaduje, aby poskytovatelia modelov AI na všeobecné účely identifikovali a dodržiavali výhrady vyťažovania textov a dát vyjadrené podľa Art. 4(3) smernice (EÚ) 2019/790, „ako napríklad strojovo čitateľnými prostriedkami“ pre obsah online. Modely uvedené na trh pred týmto dátumom majú lehotu do 2. augusta 2027 (Art. 111(3)). Komisia môže poskytovateľom ukladať pokuty od 2. augusta 2026.

Prečítali sme, čo môže crawler prečítať na 1 511 spravodajských weboch v 27 členských štátoch: noviny a spravodajské weby z Wikidata, ktorých host je v prvých 100 000 zoznamu Chrome UX Report danej krajiny, s vylúčením úradných vestníkov. Kanálmi boli robots.txt (RFC 9309), TDMRep (súbor, hlavička HTTP, <meta>), Content-Signal, pravidlo IETF Content-Usage, noai a llms.txt. URL sme požadovali len tam, kde to robots.txt povoľoval.

Na 1 356 weboch, ktoré sme mohli prečítať celé, uvádza 99 z 1 356 (7,3 %), 95% IS 6,0–8,8 %, výhradu, ktorá je záväzná pre crawler bez ohľadu na jeho názov.

  • 558 z 1 356 (41,2 %) blokuje v koreni aspoň jeden menovite uvedený crawler AI. Z nich 480 z 558 (86,0 %), IS 82,9–88,7 %, neuvádza nič, čo by prečítal crawler s novým názvom.
  • 777 z 1 356 (57,3 %) neuvádza žiadnu výhradu v žiadnom kanáli, ktorý sme čítali.
  • Vo všetkých 1 510 weboch, ktoré odpovedali na robots.txt, je počet výhrad nezávislých od názvu najmenej 110 z 1 510 (7,3 %). Webov blokujúcich menovite uvedené crawlery bez výhrady nezávislej od názvu je najviac 621 zo 699 (88,8 %).
  • Podľa veľkostnej skupiny krajín, výhrady nezávislé od názvu medzi úplne prečítanými webmi: veľké krajiny 74 z 800 (9,2 %), stredné 15 zo 431 (3,5 %), malé 10 zo 125 (8,0 %).
  • Citlivosť na našu vlastnú zmenu pravidla (D5). Podľa pravidla prístupu zmrazeného pred zberom údajov, bez opakovaného skenovania D5, je výsledok 93 z 1 282 (7,3 %), IS 6,0–8,8 %, úplne prečítaných webov s výhradou nezávislou od názvu a 0 rozporov.

Kanály.

  • TDMRep je na 71 z 1 356 (5,2 %), IS 4,2–6,6 %. Pri 58 zo 71 je iba v hlavičke alebo v elemente <meta> (meta 41, hlavička 22, súbor 13). Používa ho 53 zo 192 úplne prečítaných francúzskych webov (27,6 %).
  • Content-Signal ai-train=no sa objavuje na 18 weboch. IETF train-ai=n na 0.
  • 17 webov posiela Content-Usage: ai=n. To je označenie pre trénovanie AI z draft-ietf-aipref-vocab-01; aktuálna verzia návrhu ho vypustila, takže parsery ho musia ignorovať. Ak by sa čítalo ako výhrada trénovania, zvýšilo by podiel výhrad nezávislých od názvu na 116 z 1 356 (8,6 %).
  • Rozpory: 2 rozpory medzi 1 356 webmi podľa súčasného pravidla, 0 podľa zmrazeného pravidla. Oba sú weby Corriere della Sera, ktoré boli prečítané iba pri opakovanom skenovaní D5. Každý z nich posiela Content-Signal ai-train=yes spolu s výhradou TDMRep v <meta>.
  • 218 z 1 510 (14,4 %) zapisuje výhradu alebo všeobecný zákaz do komentárov v robots.txt, ktoré parser podľa RFC 9309 zahadzuje.

Prístup a čo sme urobili zle. Pri 154 weboch sme čítali iba robots.txt, pretože zámerne konzervatívny detektor označuje ich komentáre ako všeobecný zákaz automatizovaného prístupu. Štúdia päťkrát porušila vlastné pravidlo prístupu; každé porušenie je priznané a jeho údaje vymazané:

  • D0: prieskumný pilot.
  • D1: 7 požiadaviek na host pred jeho robots.txt.
  • D2: 245 požiadaviek na 92 webov.
  • D4: 3 požiadavky na jeden web.
  • D7: 72 požiadaviek na 24 webov.

Požiadavky D7 boli odoslané pri opakovanom skenovaní (D5) vykonanom po zbere údajov, potom ako koordinujúci agent AI štúdie zmenil pravidlo pre to, čo sa počíta ako zákaz. Pokyny štúdie nesprávne klasifikovali upozornenie 23 webov Mediahuis ako účelovo špecifické. Celolaboratórne pravidlo EasyxLab (3. októbra 2026) považuje robots.txt za záväzný v zákonnom minime. Štúdia S16 zámerne ponecháva prísnejšie pravidlo, pretože jej predmetom sú práve tieto výhrady.

Audity detektorov (všetky vykonali agenti AI).

  • Vlastná vzorka autora, detektory v1/v2: detektor výhrad bol správny pri 54 z 54 označení; detektor zákazov v2 pri 35 zo 62.
  • Prvý nezávislý recenzent, v1/v2, 44 iných webov: zákaz správne pri 15 z 21 označení a nájdených 15 z 15; výhrada správne pri 20 z 20 označení a nájdených 20 z 21.
  • Opakovaný recenzent, v3, 43 ďalších webov: zákaz 15 z 15 vo vzorke, ale úplnosť (recall) približne 84 % (130 zo 154) po započítaní 24 prehliadnutí D7; výhrada 15 zo 16.
  • v4 mení presne tieto dva typy zlyhaní. Žiadny audit v4 neuvádzame.

Poskytovatelia. Dňa 2026-10-03 sme mohli prečítať dokumentáciu crawlerov 8 zo 14 poskytovateľov; všetkých 8 uvádza robots.txt. Žiadny neuvádza TDMRep, Content-Signal, Content-Usage ani noai.

Výsledky pre jednotlivé weby uvádzajú, čo hovoria súbory daného webu. Nie sú hodnotením webu: povinnosť majú poskytovatelia AI. Nástrojom na kontrolu je scripts/optout_check.py <domain>, z ktorého sa môže stať bezplatný nástroj optout-lint.

Citovať túto štúdiu

Citácia
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations
BibTeX
@techreport{easyxlab_s16,
  title       = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S16},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}