Studije / S16
Pridržaji prava na rudarenje teksta i podataka u tisku EU-27, kanal po kanal
Izriču li izdavači vijesti u EU-u pridržaje prava na rudarenje teksta i podataka koje crawler UI-ja može pročitati, kako god se zvao?
Sažetak
Od 2. kolovoza 2025. Akt o umjetnoj inteligenciji (Art. 53(1)(c)) zahtijeva od dobavljača UI modela opće namjene da utvrde i poštuju pridržaje prava na rudarenje teksta i podataka izražene u skladu s Art. 4(3) Direktive (EU) 2019/790, „kao što je alat za strojno čitanje“ u slučaju sadržaja na internetu. Modeli stavljeni na tržište prije tog datuma imaju rok do 2. kolovoza 2027. (Art. 111(3)). Komisija može dobavljačima izricati novčane kazne od 2. kolovoza 2026.
Pročitali smo ono što crawler može pročitati na 1.511 mrežnih mjesta s vijestima u 27 država članica: novine i mrežna mjesta s vijestima iz Wikidata čiji je host među prvih 100.000 na popisu Chrome UX Report za njihovu zemlju, bez službenih glasila. Kanali su bili robots.txt (RFC 9309), TDMRep (datoteka, zaglavlje HTTP, <meta>), Content-Signal, pravilo IETF-a Content-Usage, noai i llms.txt. URL smo zatražili samo ondje gdje je robots.txt to dopuštao.
Na 1.356 mrežnih mjesta koja smo mogli pročitati u cijelosti, 99 od 1.356 (7,3 %), 95 % CI 6,0–8,8 %, izriče pridržaj prava koji obvezuje crawler kako god se on zvao.
- 558 od 1.356 (41,2 %) blokira barem jedan imenovani crawler UI-ja na korijenu mrežnog mjesta. Od njih 480 od 558 (86,0 %), CI 82,9–88,7 %, ne izriče ništa što bi pročitao crawler s novim imenom.
- 777 od 1.356 (57,3 %) ne izriče nikakav pridržaj ni u jednom kanalu koji smo pročitali.
- Na svih 1.510 mrežnih mjesta koja su odgovorila za
robots.txtbroj agnostičnih (neovisnih o imenu crawlera) iznosi najmanje 110 od 1.510 (7,3 %). Imenovanih blokatora bez agnostičnog pridržaja ima najviše 621 od 699 (88,8 %). - Po skupinama zemalja, agnostični među mrežnim mjestima pročitanima u cijelosti: velike zemlje 74 od 800 (9,2 %), srednje 15 od 431 (3,5 %), male 10 od 125 (8,0 %).
- Osjetljivost na našu vlastitu promjenu pravila (D5). Prema pravilu pristupa zamrznutom prije prikupljanja, bez ponovnog skeniranja D5, rezultat je 93 od 1.282 (7,3 %), CI 6,0–8,8 %, mrežnih mjesta pročitanih u cijelosti s agnostičnim pridržajem, i 0 proturječja.
Kanali.
- TDMRep je prisutan na 71 od 1.356 (5,2 %), CI 4,2–6,6 %. Na 58 od tih 71 nalazi se samo u zaglavlju ili u elementu
<meta>(meta 41, zaglavlje 22, datoteka 13). Upotrebljava ga 53 od 192 francuska mrežna mjesta pročitana u cijelosti (27,6 %). - Content-Signal
ai-train=nopojavljuje se na 18 mrežnih mjesta. IETF-ovtrain-ai=npojavljuje se na 0. - 17 mrežnih mjesta šalje
Content-Usage: ai=n. To je oznaka za treniranje UI-ja iz draft-ietf-aipref-vocab-01; aktualni nacrt ju je izbacio, pa je parseri moraju zanemariti. Ako bi se čitala kao pridržaj za treniranje, agnostični udio porastao bi na 116 od 1.356 (8,6 %). - Proturječja: 2 proturječja među 1.356 prema aktualnom pravilu, 0 prema zamrznutom pravilu. Oba su mrežna mjesta Corriere della Sera, koja su pročitana samo u ponovnom skeniranju D5. Svako šalje Content-Signal
ai-train=yeszajedno s pridržajem TDMRep u<meta>. - 218 od 1.510 (14,4 %) piše pridržaj ili opću zabranu u komentarima datoteke
robots.txt, koje parser prema RFC 9309 odbacuje.
Pristup i u čemu smo pogriješili. Za 154 mrežna mjesta pročitali smo samo robots.txt jer namjerno konzervativan detektor njihove komentare označava kao opću zabranu automatiziranog pristupa. Studija je pet puta prekršila vlastito pravilo pristupa; svako je kršenje prijavljeno, a njegovi podaci izbrisani:
- D0: izviđački pilot.
- D1: 7 zahtjeva prema hostu prije njegova
robots.txt. - D2: 245 zahtjeva prema 92 mrežna mjesta.
- D4: 3 zahtjeva prema jednom mrežnom mjestu.
- D7: 72 zahtjeva prema 24 mrežna mjesta.
Zahtjevi D7 poslani su u ponovnom skeniranju (D5) provedenom nakon prikupljanja, nakon što je koordinirajući agent UI-ja studije promijenio pravilo o tome što se smatra zabranom. Upute studije pogrešno su klasificirale obavijest na 23 mrežna mjesta Mediahuisa kao obavijest ograničenu na određenu svrhu. Pravilo koje vrijedi za cijeli EasyxLab (3. listopada 2026.) tretira robots.txt kao obvezujući na zakonskom minimumu. S16 namjerno zadržava strože pravilo jer su njegova tema upravo ti pridržaji.
Revizije detektora (sve su proveli agenti UI-ja).
- Autorov vlastiti uzorak, detektori v1/v2: detektor pridržaja bio je točan za 54 od 54 oznake; detektor zabrane v2 bio je točan za 35 od 62.
- Prvi neovisni recenzent, v1/v2, 44 druga mrežna mjesta: zabrana točna za 15 od 21 oznake i pronađeno 15 od 15; pridržaj točan za 20 od 20 oznaka i pronađeno 20 od 21.
- Ponovni recenzent, v3, 43 daljnja mrežna mjesta: zabrana 15 od 15 u uzorku, ali odziv oko 84 % (130 od 154) kad se ubroje 24 promašaja D7; pridržaj 15 od 16.
- v4 mijenja upravo ta dva načina pogreške. Ne tvrdi se da je v4 revidiran.
Dobavljači. Na dan 2026-10-03 mogli smo pročitati dokumentaciju o crawlerima za 8 od 14 dobavljača; svih 8 navodi robots.txt. Nijedan ne navodi TDMRep, Content-Signal, Content-Usage ni noai.
Rezultati po mrežnom mjestu navode što govore datoteke pojedinog mrežnog mjesta. Nisu ocjena mrežnog mjesta: obveza je na dobavljačima UI-ja. Alat za provjeru je scripts/optout_check.py <domain>, koji bi mogao postati besplatni alat optout-lint.
Citirajte ovu studiju
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}