Študije / S16
Pridržki za besedilno in podatkovno rudarjenje v tisku EU-27, kanal za kanalom
Ali novičarski založniki v EU izražajo pridržke za besedilno in podatkovno rudarjenje, ki jih pajek UI lahko prebere ne glede na svoje ime?
Povzetek
Od 2. avgusta 2025 Akt o umetni inteligenci (Art. 53(1)(c)) od ponudnikov modelov UI za splošne namene zahteva, da opredelijo in spoštujejo pridržke za besedilno in podatkovno rudarjenje, izražene na podlagi Art. 4(3) Direktive (EU) 2019/790, „kot so strojno berljiva sredstva“ pri vsebinah na spletu. Modeli, dani na trg pred tem datumom, imajo čas do 2. avgusta 2027 (Art. 111(3)). Komisija lahko ponudnikom nalaga globe od 2. avgusta 2026.
Prebrali smo, kar lahko pajek prebere na 1.511 novičarskih spletnih mestih v 27 državah članicah: časopisi in novičarska spletna mesta iz Wikidata, katerih gostitelj je med prvimi 100.000 na seznamu Chrome UX Report svoje države, brez uradnih listov. Kanali so bili robots.txt (RFC 9309), TDMRep (datoteka, glava HTTP, <meta>), Content-Signal, pravilo IETF Content-Usage, noai in llms.txt. URL smo zahtevali le, kjer je robots.txt to dovoljeval.
Na 1.356 spletnih mestih, ki smo jih lahko prebrali v celoti, jih 99 od 1.356 (7,3 %), 95 % IZ 6,0–8,8 %, izraža pridržek, ki zavezuje pajka ne glede na njegovo ime.
- 558 od 1.356 (41,2 %) v korenu blokira vsaj enega poimensko navedenega pajka UI. Od teh jih 480 od 558 (86,0 %), IZ 82,9–88,7 %, ne izraža ničesar, kar bi prebral pajek z novim imenom.
- 777 od 1.356 (57,3 %) ne izraža nobenega pridržka v nobenem kanalu, ki smo ga prebrali.
- Na vseh 1.510 spletnih mestih, ki so odgovorila za
robots.txt, je pridržkov, neodvisnih od imena, vsaj 110 od 1.510 (7,3 %). Mest, ki blokirajo poimensko navedene pajke brez pridržka, neodvisnega od imena, je največ 621 od 699 (88,8 %). - Po velikostnih skupinah držav, pridržki, neodvisni od imena, med v celoti prebranimi mesti: velike države 74 od 800 (9,2 %), srednje 15 od 431 (3,5 %), majhne 10 od 125 (8,0 %).
- Občutljivost na našo lastno spremembo pravila (D5). Po pravilu dostopa, zamrznjenem pred zbiranjem podatkov, brez ponovnega skeniranja D5, je rezultat 93 od 1.282 (7,3 %), IZ 6,0–8,8 %, v celoti prebranih mest s pridržkom, neodvisnim od imena, in 0 protislovij.
Kanali.
- TDMRep je na 71 od 1.356 (5,2 %), IZ 4,2–6,6 %. Pri 58 od 71 je le v glavi ali v elementu
<meta>(meta 41, glava 22, datoteka 13). Uporablja ga 53 od 192 v celoti prebranih francoskih mest (27,6 %). - Content-Signal
ai-train=nose pojavi na 18 mestih. IETFtrain-ai=nna 0. - 17 mest pošilja
Content-Usage: ai=n. To je oznaka za učenje UI iz draft-ietf-aipref-vocab-01; trenutni osnutek jo je opustil, zato jo morajo razčlenjevalniki prezreti. Če bi jo brali kot pridržek za učenje, bi se delež pridržkov, neodvisnih od imena, zvišal na 116 od 1.356 (8,6 %). - Protislovja: 2 protislovji med 1.356 mesti po trenutnem pravilu, 0 po zamrznjenem pravilu. Obe sta spletni mesti Corriere della Sera, ki sta bili prebrani le pri ponovnem skeniranju D5. Vsako pošilja Content-Signal
ai-train=yesskupaj s pridržkom TDMRep v<meta>. - 218 od 1.510 (14,4 %) zapiše pridržek ali splošno prepoved v komentarje
robots.txt, ki jih razčlenjevalnik po RFC 9309 zavrže.
Dostop in kaj smo storili narobe. Pri 154 mestih smo prebrali le robots.txt, ker namerno konzervativen detektor njihove komentarje označi kot splošno prepoved avtomatiziranega dostopa. Študija je petkrat kršila lastno pravilo dostopa; vsaka kršitev je prijavljena, njeni podatki pa izbrisani:
- D0: izvidniški pilot.
- D1: 7 zahtevkov gostitelju pred njegovim
robots.txt. - D2: 245 zahtevkov na 92 mest.
- D4: 3 zahtevki na eno mesto.
- D7: 72 zahtevkov na 24 mest.
Zahtevki D7 so bili poslani pri ponovnem skeniranju (D5), opravljenem po zbiranju podatkov, potem ko je koordinacijski agent UI študije spremenil pravilo o tem, kaj šteje kot prepoved. Navodila študije so obvestilo 23 mest Mediahuis napačno razvrstila kot vezano na določen namen. Pravilo EasyxLab, ki velja za ves laboratorij (3. oktobra 2026), obravnava robots.txt kot zavezujoč v zakonskem minimumu. Študija S16 namerno ohranja strožje pravilo, ker so njen predmet prav ti pridržki.
Revizije detektorjev (vse so opravili agenti UI).
- Avtorjev lastni vzorec, detektorji v1/v2: detektor pridržkov je bil pravilen pri 54 od 54 oznak; detektor prepovedi v2 pri 35 od 62.
- Prvi neodvisni pregledovalec, v1/v2, 44 drugih mest: prepoved pravilna pri 15 od 21 oznak in najdenih 15 od 15; pridržek pravilen pri 20 od 20 oznak in najdenih 20 od 21.
- Ponovni pregledovalec, v3, 43 nadaljnjih mest: prepoved 15 od 15 v vzorcu, a priklic (recall) približno 84 % (130 od 154), ko se upošteva 24 zgrešenih primerov D7; pridržek 15 od 16.
- v4 spreminja natanko ta dva načina odpovedi. Nobene revizije v4 ne navajamo.
Ponudniki. Dne 2026-10-03 smo lahko prebrali dokumentacijo o pajkih 8 od 14 ponudnikov; vseh 8 navaja robots.txt. Noben ne navaja TDMRep, Content-Signal, Content-Usage ali noai.
Rezultati po spletnih mestih navajajo, kaj pravijo datoteke posameznega mesta. Niso ocena mesta: obveznost imajo ponudniki UI. Orodje za preverjanje je scripts/optout_check.py <domain>, ki lahko postane brezplačno orodje optout-lint.
Citirajte to študijo
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}