EasyxLab
Limbă: RO Română

Traducere realizată cu IA a originalului în engleză, care este versiunea de referință. Citește în engleză

Studii / S16

Rezervarea drepturilor privind extragerea textului și a datelor în presa din UE-27, canal cu canal

Exprimă editorii de presă din UE rezervări ale drepturilor privind extragerea textului și a datelor pe care un crawler de IA le poate citi, indiferent de numele său?

Versiune de lucruPublicat 2026-10-03

Rezumat

Din 2 august 2025, Regulamentul privind inteligența artificială (Art. 53(1)(c)) impune furnizorilor de modele de IA de uz general să identifice și să respecte rezervările drepturilor privind extragerea textului și a datelor exprimate în temeiul Art. 4(3) din Directiva (UE) 2019/790, „cum ar fi mijloace care pot fi citite automat” în cazul conținutului online. Modelele introduse pe piață înainte de această dată au termen până la 2 august 2027 (Art. 111(3)). Comisia poate aplica amenzi furnizorilor începând cu 2 august 2026.

Am citit ce poate citi un crawler pe 1.511 site-uri de știri din 27 de state membre: ziare și site-uri de știri din Wikidata al căror host se află în primele 100.000 din lista Chrome UX Report a țării lor, cu excluderea monitoarelor oficiale. Canalele au fost robots.txt (RFC 9309), TDMRep (fișier, antet HTTP, <meta>), Content-Signal, regula Content-Usage a IETF, noai și llms.txt. Am solicitat un URL doar acolo unde robots.txt permitea acest lucru.

Pe cele 1.356 de site-uri pe care le-am putut citi integral, 99 din 1.356 (7,3 %), IÎ 95 % 6,0–8,8 %, exprimă o rezervare care obligă un crawler indiferent de numele său.

  • 558 din 1.356 (41,2 %) blochează la rădăcină cel puțin un crawler de IA numit explicit. Dintre acestea, 480 din 558 (86,0 %), IÎ 82,9–88,7 %, nu exprimă nimic din ce ar citi un crawler cu un nume nou.
  • 777 din 1.356 (57,3 %) nu exprimă nicio rezervare în niciunul dintre canalele pe care le-am citit.
  • Pe ansamblul celor 1.510 site-uri care au răspuns la solicitarea robots.txt, cele cu o rezervare valabilă pentru orice crawler sunt cel puțin 110 din 1.510 (7,3 %). Cele care blochează crawlere după nume fără o rezervare valabilă pentru orice crawler sunt cel mult 621 din 699 (88,8 %).
  • Pe grupe de țări, site-uri citite integral cu o rezervare valabilă pentru orice crawler: țări mari 74 din 800 (9,2 %), medii 15 din 431 (3,5 %), mici 10 din 125 (8,0 %).
  • Sensibilitatea la propria noastră modificare a regulii (D5). Conform regulii de acces înghețate înainte de colectare, fără rescanarea D5, rezultatul este de 93 din 1.282 de site-uri citite integral (7,3 %), IÎ 6,0–8,8 %, cu o rezervare valabilă pentru orice crawler, și 0 contradicții.

Canale.

  • TDMRep apare pe 71 din 1.356 (5,2 %), IÎ 4,2–6,6 %. La 58 dintre cele 71 se află doar într-un antet sau într-un element <meta> (meta 41, antet 22, fișier 13). Îl folosesc 53 dintre cele 192 de site-uri franceze citite integral (27,6 %).
  • Content-Signal ai-train=no apare pe 18 site-uri. train-ai=n al IETF apare pe 0.
  • 17 site-uri trimit Content-Usage: ai=n. Aceasta este eticheta pentru antrenarea IA din draft-ietf-aipref-vocab-01; versiunea actuală a draftului a eliminat-o, așa că parserele trebuie să o ignore. Citită ca rezervare privind antrenarea, ar ridica ponderea rezervărilor valabile pentru orice crawler la 116 din 1.356 (8,6 %).
  • Contradicții: 2 contradicții între cele 1.356 conform regulii actuale, 0 conform regulii înghețate. Ambele sunt site-uri ale Corriere della Sera, care au fost citite doar în rescanarea D5. Fiecare trimite Content-Signal ai-train=yes împreună cu o rezervare TDMRep într-un element <meta>.
  • 218 din 1.510 (14,4 %) scriu o rezervare sau o interdicție generală în comentariile din robots.txt, pe care un parser conform RFC 9309 le elimină.

Accesul și ce am greșit. Pentru 154 de site-uri am citit doar robots.txt, deoarece un detector deliberat conservator clasifică comentariile lor drept interdicție generală a accesului automatizat. Studiul și-a încălcat de cinci ori propria regulă de acces; fiecare încălcare este declarată, iar datele ei au fost șterse:

  • D0: pilotul de explorare.
  • D1: 7 solicitări către un host înainte de a-i consulta robots.txt.
  • D2: 245 de solicitări către 92 de site-uri.
  • D4: 3 solicitări către un site.
  • D7: 72 de solicitări către 24 de site-uri.

Solicitările D7 au fost trimise într-o rescanare (D5) făcută după colectare, după ce agentul de IA care coordona studiul a schimbat regula privind ce se consideră interdicție. Instrucțiunile studiului au clasificat greșit notificarea celor 23 de site-uri Mediahuis ca fiind specifică unui anumit scop. Regula EasyxLab valabilă pentru tot laboratorul (3 octombrie 2026) tratează robots.txt ca obligatoriu la minimul legal. S16 păstrează deliberat o regulă mai strictă, deoarece obiectul său sunt aceste rezervări.

Auditurile detectoarelor (toate făcute de agenți de IA).

  • Eșantionul propriu al autorului, detectoarele v1/v2: detectorul de rezervări a avut dreptate în 54 din 54 de cazuri semnalate; detectorul de interdicții v2 a avut dreptate în 35 din 62.
  • Primul evaluator independent, v1/v2, alte 44 de site-uri: interdicție, corect în 15 din 21 de cazuri semnalate și 15 din 15 găsite; rezervare, corect în 20 din 20 de cazuri semnalate și 20 din 21 găsite.
  • Al doilea evaluator, v3, încă 43 de site-uri: interdicție 15 din 15 în eșantion, dar o sensibilitate (recall) de circa 84 % (130 din 154) odată ce sunt numărate cele 24 de omisiuni D7; rezervare 15 din 16.
  • v4 modifică exact aceste două moduri de eșec. Nu se pretinde niciun audit al v4.

Furnizori. La 3 octombrie 2026 am putut citi documentația despre crawlere a 8 din 14 furnizori; toți cei 8 menționează robots.txt. Niciunul nu menționează TDMRep, Content-Signal, Content-Usage sau noai.

Rezultatele pe site arată ce spun fișierele fiecărui site. Ele nu sunt o evaluare a site-ului: obligația revine furnizorilor de IA. Instrumentul de verificare este scripts/optout_check.py <domain>, care ar putea deveni instrumentul gratuit optout-lint.

Citați acest studiu

Citare
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations
BibTeX
@techreport{easyxlab_s16,
  title       = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S16},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}