Studii / S16
Rezervarea drepturilor privind extragerea textului și a datelor în presa din UE-27, canal cu canal
Exprimă editorii de presă din UE rezervări ale drepturilor privind extragerea textului și a datelor pe care un crawler de IA le poate citi, indiferent de numele său?
Rezumat
Din 2 august 2025, Regulamentul privind inteligența artificială (Art. 53(1)(c)) impune furnizorilor de modele de IA de uz general să identifice și să respecte rezervările drepturilor privind extragerea textului și a datelor exprimate în temeiul Art. 4(3) din Directiva (UE) 2019/790, „cum ar fi mijloace care pot fi citite automat” în cazul conținutului online. Modelele introduse pe piață înainte de această dată au termen până la 2 august 2027 (Art. 111(3)). Comisia poate aplica amenzi furnizorilor începând cu 2 august 2026.
Am citit ce poate citi un crawler pe 1.511 site-uri de știri din 27 de state membre: ziare și site-uri de știri din Wikidata al căror host se află în primele 100.000 din lista Chrome UX Report a țării lor, cu excluderea monitoarelor oficiale. Canalele au fost robots.txt (RFC 9309), TDMRep (fișier, antet HTTP, <meta>), Content-Signal, regula Content-Usage a IETF, noai și llms.txt. Am solicitat un URL doar acolo unde robots.txt permitea acest lucru.
Pe cele 1.356 de site-uri pe care le-am putut citi integral, 99 din 1.356 (7,3 %), IÎ 95 % 6,0–8,8 %, exprimă o rezervare care obligă un crawler indiferent de numele său.
- 558 din 1.356 (41,2 %) blochează la rădăcină cel puțin un crawler de IA numit explicit. Dintre acestea, 480 din 558 (86,0 %), IÎ 82,9–88,7 %, nu exprimă nimic din ce ar citi un crawler cu un nume nou.
- 777 din 1.356 (57,3 %) nu exprimă nicio rezervare în niciunul dintre canalele pe care le-am citit.
- Pe ansamblul celor 1.510 site-uri care au răspuns la solicitarea
robots.txt, cele cu o rezervare valabilă pentru orice crawler sunt cel puțin 110 din 1.510 (7,3 %). Cele care blochează crawlere după nume fără o rezervare valabilă pentru orice crawler sunt cel mult 621 din 699 (88,8 %). - Pe grupe de țări, site-uri citite integral cu o rezervare valabilă pentru orice crawler: țări mari 74 din 800 (9,2 %), medii 15 din 431 (3,5 %), mici 10 din 125 (8,0 %).
- Sensibilitatea la propria noastră modificare a regulii (D5). Conform regulii de acces înghețate înainte de colectare, fără rescanarea D5, rezultatul este de 93 din 1.282 de site-uri citite integral (7,3 %), IÎ 6,0–8,8 %, cu o rezervare valabilă pentru orice crawler, și 0 contradicții.
Canale.
- TDMRep apare pe 71 din 1.356 (5,2 %), IÎ 4,2–6,6 %. La 58 dintre cele 71 se află doar într-un antet sau într-un element
<meta>(meta 41, antet 22, fișier 13). Îl folosesc 53 dintre cele 192 de site-uri franceze citite integral (27,6 %). - Content-Signal
ai-train=noapare pe 18 site-uri.train-ai=nal IETF apare pe 0. - 17 site-uri trimit
Content-Usage: ai=n. Aceasta este eticheta pentru antrenarea IA din draft-ietf-aipref-vocab-01; versiunea actuală a draftului a eliminat-o, așa că parserele trebuie să o ignore. Citită ca rezervare privind antrenarea, ar ridica ponderea rezervărilor valabile pentru orice crawler la 116 din 1.356 (8,6 %). - Contradicții: 2 contradicții între cele 1.356 conform regulii actuale, 0 conform regulii înghețate. Ambele sunt site-uri ale Corriere della Sera, care au fost citite doar în rescanarea D5. Fiecare trimite Content-Signal
ai-train=yesîmpreună cu o rezervare TDMRep într-un element<meta>. - 218 din 1.510 (14,4 %) scriu o rezervare sau o interdicție generală în comentariile din
robots.txt, pe care un parser conform RFC 9309 le elimină.
Accesul și ce am greșit. Pentru 154 de site-uri am citit doar robots.txt, deoarece un detector deliberat conservator clasifică comentariile lor drept interdicție generală a accesului automatizat. Studiul și-a încălcat de cinci ori propria regulă de acces; fiecare încălcare este declarată, iar datele ei au fost șterse:
- D0: pilotul de explorare.
- D1: 7 solicitări către un host înainte de a-i consulta
robots.txt. - D2: 245 de solicitări către 92 de site-uri.
- D4: 3 solicitări către un site.
- D7: 72 de solicitări către 24 de site-uri.
Solicitările D7 au fost trimise într-o rescanare (D5) făcută după colectare, după ce agentul de IA care coordona studiul a schimbat regula privind ce se consideră interdicție. Instrucțiunile studiului au clasificat greșit notificarea celor 23 de site-uri Mediahuis ca fiind specifică unui anumit scop. Regula EasyxLab valabilă pentru tot laboratorul (3 octombrie 2026) tratează robots.txt ca obligatoriu la minimul legal. S16 păstrează deliberat o regulă mai strictă, deoarece obiectul său sunt aceste rezervări.
Auditurile detectoarelor (toate făcute de agenți de IA).
- Eșantionul propriu al autorului, detectoarele v1/v2: detectorul de rezervări a avut dreptate în 54 din 54 de cazuri semnalate; detectorul de interdicții v2 a avut dreptate în 35 din 62.
- Primul evaluator independent, v1/v2, alte 44 de site-uri: interdicție, corect în 15 din 21 de cazuri semnalate și 15 din 15 găsite; rezervare, corect în 20 din 20 de cazuri semnalate și 20 din 21 găsite.
- Al doilea evaluator, v3, încă 43 de site-uri: interdicție 15 din 15 în eșantion, dar o sensibilitate (recall) de circa 84 % (130 din 154) odată ce sunt numărate cele 24 de omisiuni D7; rezervare 15 din 16.
- v4 modifică exact aceste două moduri de eșec. Nu se pretinde niciun audit al v4.
Furnizori. La 3 octombrie 2026 am putut citi documentația despre crawlere a 8 din 14 furnizori; toți cei 8 menționează robots.txt. Niciunul nu menționează TDMRep, Content-Signal, Content-Usage sau noai.
Rezultatele pe site arată ce spun fișierele fiecărui site. Ele nu sunt o evaluare a site-ului: obligația revine furnizorilor de IA. Instrumentul de verificare este scripts/optout_check.py <domain>, care ar putea deveni instrumentul gratuit optout-lint.
Citați acest studiu
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}