Estudos / S16
Reservas de minaría de textos e datos na prensa da UE-27, canle por canle
Declaran os editores de prensa da UE reservas de minaría de textos e datos que un rastrexador de IA poida ler, sexa cal sexa o seu nome?
Resumo
Desde o 2 de agosto de 2025, o Regulamento de intelixencia artificial (Art. 53(1)(c)) obriga os provedores de modelos de IA de uso xeral a detectar e cumprir as reservas de minaría de textos e datos expresadas de conformidade co Art. 4(3) da Directiva (UE) 2019/790, «como medios de lectura mecánica» no caso do contido en liña. Os modelos introducidos no mercado antes desa data teñen de prazo ata o 2 de agosto de 2027 (Art. 111(3)). A Comisión pode multar os provedores desde o 2 de agosto de 2026.
Lemos o que un rastrexador pode ler en 1511 sitios web de noticias de 27 Estados membros: xornais e sitios de noticias de Wikidata cuxo host figura entre os 100.000 primeiros da lista do Chrome UX Report do seu país, excluídos os boletíns oficiais. As canles foron robots.txt (RFC 9309), TDMRep (ficheiro, cabeceira HTTP, <meta>), Content-Signal, a regra Content-Usage do IETF, noai e llms.txt. Só solicitamos un enderezo URL cando robots.txt o permitía.
Nos 1356 sitios que puidemos ler por completo, 99 de 1356 (7,3 %), IC 95 % 6,0–8,8 %, declaran unha reserva que vincula un rastrexador sexa cal sexa o seu nome.
- 558 de 1356 (41,2 %) bloquean na raíz do sitio polo menos un rastrexador de IA identificado polo seu nome. Deles, 480 de 558 (86,0 %), IC 82,9–88,7 %, non declaran nada que puidese ler un rastrexador cun nome novo.
- 777 de 1356 (57,3 %) non declaran ningunha reserva en ningunha das canles que lemos.
- No conxunto dos 1510 sitios que responderon á petición de
robots.txt, os que teñen unha reserva válida para calquera rastrexador son polo menos 110 de 1510 (7,3 %). Os que bloquean rastrexadores polo seu nome sen unha reserva válida para calquera rastrexador son como máximo 621 de 699 (88,8 %). - Por grupo de países, sitios lidos por completo cunha reserva válida para calquera rastrexador: países grandes, 74 de 800 (9,2 %); medianos, 15 de 431 (3,5 %); pequenos, 10 de 125 (8,0 %).
- Sensibilidade ao noso propio cambio de regra (D5). Coa regra de acceso conxelada antes da recollida de datos, sen o novo escaneo D5, o resultado é de 93 de 1282 sitios lidos por completo (7,3 %), IC 6,0–8,8 %, cunha reserva válida para calquera rastrexador, e 0 contradicións.
Canles.
- TDMRep está presente en 71 de 1356 (5,2 %), IC 4,2–6,6 %. En 58 dos 71 só figura nunha cabeceira ou nun elemento
<meta>(meta 41, cabeceira 22, ficheiro 13). Úsano 53 dos 192 sitios franceses lidos por completo (27,6 %). - Content-Signal
ai-train=noaparece en 18 sitios. Otrain-ai=ndo IETF aparece en 0. - 17 sitios envían
Content-Usage: ai=n. É a etiqueta de adestramento de IA de draft-ietf-aipref-vocab-01; o borrador actual eliminouna, así que os analizadores deben ignorala. Lida como reserva de adestramento, elevaría a proporción de reservas válidas para calquera rastrexador a 116 de 1356 (8,6 %). - Contradicións: 2 contradicións entre os 1356 coa regra actual, 0 coa regra conxelada. Ambas son sitios do Corriere della Sera, que só se leron no novo escaneo D5. Cada un envía Content-Signal
ai-train=yesxunto cunha reserva TDMRep nun elemento<meta>. - 218 de 1510 (14,4 %) escriben unha reserva ou unha prohibición xeral en comentarios de
robots.txt, que un analizador conforme ao RFC 9309 descarta.
O acceso e o que fixemos mal. En 154 sitios só lemos robots.txt, porque un detector deliberadamente conservador marca os seus comentarios como unha prohibición xeral do acceso automatizado. O estudo incumpriu cinco veces a súa propia regra de acceso; cada incumprimento está declarado e os seus datos, borrados:
- D0: o piloto exploratorio.
- D1: 7 peticións a un host antes de consultar o seu
robots.txt. - D2: 245 peticións a 92 sitios.
- D4: 3 peticións a un sitio.
- D7: 72 peticións a 24 sitios.
As peticións D7 enviáronse nun novo escaneo (D5) feito despois da recollida de datos, despois de que o axente de IA coordinador do estudo cambiase a regra sobre o que conta como prohibición. As instrucións do estudo clasificaron erroneamente o aviso dos 23 sitios de Mediahuis como limitado a unha finalidade concreta. A regra de EasyxLab para todo o laboratorio (3 de outubro de 2026) trata robots.txt como vinculante no mínimo legal. S16 mantén deliberadamente unha regra máis estrita, porque o seu obxecto son esas reservas.
Auditorías dos detectores (todas feitas por axentes de IA).
- Mostra do propio autor, detectores v1/v2: o detector de reservas acertou en 54 de 54 casos marcados; o detector de prohibicións v2 acertou en 35 de 62.
- Primeiro revisor independente, v1/v2, outros 44 sitios: prohibición, acertou en 15 de 21 casos marcados e atopou 15 de 15; reserva, acertou en 20 de 20 casos marcados e atopou 20 de 21.
- Novo revisor, v3, outros 43 sitios: prohibición, 15 de 15 na mostra, pero unha exhaustividade (recall) de arredor do 84 % (130 de 154) ao contar as 24 omisións de D7; reserva, 15 de 16.
- A v4 cambia exactamente eses dous modos de fallo. Non se declara ningunha auditoría da v4.
Provedores. O 3 de outubro de 2026 puidemos ler a documentación sobre rastrexadores de 8 de 14 provedores; os 8 mencionan robots.txt. Ningún menciona TDMRep, Content-Signal, Content-Usage nin noai.
Os resultados por sitio indican o que din os ficheiros de cada sitio. Non son unha avaliación do sitio: a obriga recae nos provedores de IA. O comprobador é scripts/optout_check.py <domain>, que podería converterse na ferramenta gratuíta optout-lint.
Citar este estudo
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}