EasyxLab
Llengua: CA Català

Traducció feta amb IA de l'original en anglès, que és la versió de referència. Llegeix en anglès

Estudis / S16

Reserves de mineria de textos i dades a la premsa de la UE-27, canal per canal

Declaren els editors de premsa de la UE reserves de mineria de textos i dades que un rastrejador d'IA pugui llegir, sigui quin sigui el seu nom?

Esborrany de treballPublicat 2026-10-03

Resum

Des del 2 d'agost de 2025, el Reglament d'intel·ligència artificial (Art. 53(1)(c)) obliga els proveïdors de models d'IA d'ús general a detectar i complir les reserves de mineria de textos i dades expressades d'acord amb l'Art. 4(3) de la Directiva (UE) 2019/790, «com ara mitjans de lectura mecànica» en el cas del contingut en línia. Els models introduïts al mercat abans d'aquesta data tenen de termini fins al 2 d'agost de 2027 (Art. 111(3)). La Comissió pot multar els proveïdors a partir del 2 d'agost de 2026.

Vam llegir el que un rastrejador pot llegir a 1.511 llocs web de notícies de 27 estats membres: diaris i llocs de notícies de Wikidata el host dels quals figura entre els 100.000 primers de la llista del Chrome UX Report del seu país, excloent-ne els butlletins oficials. Els canals van ser robots.txt (RFC 9309), TDMRep (fitxer, capçalera HTTP, <meta>), Content-Signal, la regla Content-Usage de l'IETF, noai i llms.txt. Només vam sol·licitar una URL quan robots.txt ho permetia.

Als 1.356 llocs que vam poder llegir completament, 99 de 1.356 (7,3 %), IC 95 % 6,0–8,8 %, declaren una reserva que vincula un rastrejador sigui quin sigui el seu nom.

  • 558 de 1.356 (41,2 %) bloquegen a l'arrel del lloc almenys un rastrejador d'IA identificat pel seu nom. D'aquests, 480 de 558 (86,0 %), IC 82,9–88,7 %, no declaren res que pogués llegir un rastrejador amb un nom nou.
  • 777 de 1.356 (57,3 %) no declaren cap reserva en cap dels canals que vam llegir.
  • En el conjunt dels 1.510 llocs que van respondre a la petició de robots.txt, els que tenen una reserva vàlida per a qualsevol rastrejador són com a mínim 110 de 1.510 (7,3 %). Els que bloquegen rastrejadors pel seu nom sense una reserva vàlida per a qualsevol rastrejador són com a màxim 621 de 699 (88,8 %).
  • Per grup de països, llocs llegits completament amb una reserva vàlida per a qualsevol rastrejador: països grans, 74 de 800 (9,2 %); mitjans, 15 de 431 (3,5 %); petits, 10 de 125 (8,0 %).
  • Sensibilitat al nostre propi canvi de regla (D5). Amb la regla d'accés congelada abans de la recollida de dades, sense el nou escaneig D5, el resultat és de 93 de 1.282 llocs llegits completament (7,3 %), IC 6,0–8,8 %, amb una reserva vàlida per a qualsevol rastrejador, i 0 contradiccions.

Canals.

  • TDMRep és present a 71 de 1.356 (5,2 %), IC 4,2–6,6 %. En 58 dels 71 només figura en una capçalera o en un element <meta> (meta 41, capçalera 22, fitxer 13). L'utilitzen 53 dels 192 llocs francesos llegits completament (27,6 %).
  • Content-Signal ai-train=no apareix a 18 llocs. El train-ai=n de l'IETF apareix a 0.
  • 17 llocs envien Content-Usage: ai=n. És l'etiqueta d'entrenament d'IA de draft-ietf-aipref-vocab-01; l'esborrany actual la va eliminar, de manera que els analitzadors l'han d'ignorar. Llegida com a reserva d'entrenament, elevaria la proporció de reserves vàlides per a qualsevol rastrejador a 116 de 1.356 (8,6 %).
  • Contradiccions: 2 contradiccions entre els 1.356 amb la regla actual, 0 amb la regla congelada. Totes dues són llocs del Corriere della Sera, que només es van llegir en el nou escaneig D5. Cadascun envia Content-Signal ai-train=yes juntament amb una reserva TDMRep en un element <meta>.
  • 218 de 1.510 (14,4 %) escriuen una reserva o una prohibició general en comentaris de robots.txt, que un analitzador conforme a l'RFC 9309 descarta.

L'accés, i el que vam fer malament. En 154 llocs només vam llegir robots.txt, perquè un detector deliberadament conservador marca els seus comentaris com una prohibició general de l'accés automatitzat. L'estudi va incomplir cinc vegades la seva pròpia regla d'accés; cada incompliment està declarat i les seves dades, esborrades:

  • D0: el pilot exploratori.
  • D1: 7 peticions a un host abans de consultar-ne el robots.txt.
  • D2: 245 peticions a 92 llocs.
  • D4: 3 peticions a un lloc.
  • D7: 72 peticions a 24 llocs.

Les peticions D7 es van enviar en un nou escaneig (D5) fet després de la recollida de dades, després que l'agent d'IA coordinador de l'estudi canviés la regla sobre què compta com a prohibició. Les instruccions de l'estudi van classificar erròniament l'avís dels 23 llocs de Mediahuis com a limitat a una finalitat concreta. La regla d'EasyxLab per a tot el laboratori (3 d'octubre de 2026) tracta robots.txt com a vinculant en el mínim legal. S16 manté deliberadament una regla més estricta, perquè el seu objecte són aquestes reserves.

Auditories dels detectors (totes fetes per agents d'IA).

  • Mostra del mateix autor, detectors v1/v2: el detector de reserves va encertar en 54 de 54 casos marcats; el detector de prohibicions v2 va encertar en 35 de 62.
  • Primer revisor independent, v1/v2, 44 llocs més: prohibició, va encertar en 15 de 21 casos marcats i en va trobar 15 de 15; reserva, va encertar en 20 de 20 casos marcats i en va trobar 20 de 21.
  • Nou revisor, v3, 43 llocs més: prohibició, 15 de 15 a la mostra, però una exhaustivitat (recall) d'aproximadament el 84 % (130 de 154) un cop comptades les 24 omissions de D7; reserva, 15 de 16.
  • La v4 canvia exactament aquests dos modes de fallada. No es declara cap auditoria de la v4.

Proveïdors. El 3 d'octubre de 2026 vam poder llegir la documentació sobre rastrejadors de 8 de 14 proveïdors; tots 8 esmenten robots.txt. Cap no esmenta TDMRep, Content-Signal, Content-Usage ni noai.

Els resultats per lloc indiquen el que diuen els fitxers de cada lloc. No són una avaluació del lloc: l'obligació recau en els proveïdors d'IA. El comprovador és scripts/optout_check.py <domain>, que podria esdevenir l'eina gratuïta optout-lint.

Cita aquest estudi

Citació
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations
BibTeX
@techreport{easyxlab_s16,
  title       = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S16},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}