EasyxLab
Idioma: ES Español

Traducción por IA del original en inglés, que es la versión de referencia. Leer en inglés

Estudios / S16

Reservas de minería de textos y datos en la prensa de la UE-27, canal por canal

¿Declaran los editores de prensa de la UE reservas de minería de textos y datos que un rastreador de IA pueda leer, sea cual sea su nombre?

Borrador de trabajoPublicado 2026-10-03

Resumen

Desde el 2 de agosto de 2025, el Reglamento de Inteligencia Artificial (Art. 53(1)(c)) obliga a los proveedores de modelos de IA de uso general a detectar y cumplir las reservas de minería de textos y datos expresadas de conformidad con el Art. 4(3) de la Directiva (UE) 2019/790, «como medios de lectura mecánica» en el caso del contenido en línea. Los modelos introducidos en el mercado antes de esa fecha tienen de plazo hasta el 2 de agosto de 2027 (Art. 111(3)). La Comisión puede multar a los proveedores desde el 2 de agosto de 2026.

Leímos lo que un rastreador puede leer en 1511 sitios web de noticias de 27 Estados miembros: periódicos y sitios de noticias de Wikidata cuyo host figura entre los 100.000 primeros de la lista del Chrome UX Report de su país, excluidos los boletines oficiales. Los canales fueron robots.txt (RFC 9309), TDMRep (fichero, cabecera HTTP, <meta>), Content-Signal, la regla Content-Usage del IETF, noai y llms.txt. Solo solicitamos una URL cuando robots.txt lo permitía.

En los 1356 sitios que pudimos leer por completo, 99 de 1356 (7,3 %), IC 95 % 6,0–8,8 %, declaran una reserva que vincula a un rastreador sea cual sea su nombre.

  • 558 de 1356 (41,2 %) bloquean en la raíz del sitio al menos un rastreador de IA identificado por su nombre. De ellos, 480 de 558 (86,0 %), IC 82,9–88,7 %, no declaran nada que pudiera leer un rastreador con un nombre nuevo.
  • 777 de 1356 (57,3 %) no declaran ninguna reserva en ninguno de los canales que leímos.
  • En el conjunto de los 1510 sitios que respondieron a la petición de robots.txt, los que tienen una reserva válida para cualquier rastreador son al menos 110 de 1510 (7,3 %). Los que bloquean rastreadores por su nombre sin una reserva válida para cualquier rastreador son como máximo 621 de 699 (88,8 %).
  • Por grupo de países, sitios leídos por completo con una reserva válida para cualquier rastreador: países grandes, 74 de 800 (9,2 %); medianos, 15 de 431 (3,5 %); pequeños, 10 de 125 (8,0 %).
  • Sensibilidad a nuestro propio cambio de regla (D5). Con la regla de acceso congelada antes de la recogida de datos, sin el reescaneo D5, el resultado es de 93 de 1282 sitios leídos por completo (7,3 %), IC 6,0–8,8 %, con una reserva válida para cualquier rastreador, y 0 contradicciones.

Canales.

  • TDMRep está presente en 71 de 1356 (5,2 %), IC 4,2–6,6 %. En 58 de los 71 solo figura en una cabecera o en un elemento <meta> (meta 41, cabecera 22, fichero 13). Lo usan 53 de los 192 sitios franceses leídos por completo (27,6 %).
  • Content-Signal ai-train=no aparece en 18 sitios. El train-ai=n del IETF aparece en 0.
  • 17 sitios envían Content-Usage: ai=n. Es la etiqueta de entrenamiento de IA de draft-ietf-aipref-vocab-01; el borrador actual la eliminó, así que los analizadores deben ignorarla. Leída como reserva de entrenamiento, elevaría la proporción de reservas válidas para cualquier rastreador a 116 de 1356 (8,6 %).
  • Contradicciones: 2 contradicciones entre los 1356 con la regla actual, 0 con la regla congelada. Ambas son sitios del Corriere della Sera, que solo se leyeron en el reescaneo D5. Cada uno envía Content-Signal ai-train=yes junto con una reserva TDMRep en un elemento <meta>.
  • 218 de 1510 (14,4 %) escriben una reserva o una prohibición general en comentarios de robots.txt, que un analizador conforme al RFC 9309 descarta.

El acceso y lo que hicimos mal. En 154 sitios solo leímos robots.txt, porque un detector deliberadamente conservador marca sus comentarios como una prohibición general del acceso automatizado. El estudio incumplió cinco veces su propia regla de acceso; cada incumplimiento está declarado y sus datos, borrados:

  • D0: el piloto exploratorio.
  • D1: 7 peticiones a un host antes de consultar su robots.txt.
  • D2: 245 peticiones a 92 sitios.
  • D4: 3 peticiones a un sitio.
  • D7: 72 peticiones a 24 sitios.

Las peticiones D7 se enviaron en un reescaneo (D5) hecho después de la recogida de datos, después de que el agente de IA coordinador del estudio cambiara la regla de lo que cuenta como prohibición. Las instrucciones del estudio clasificaron erróneamente el aviso de los 23 sitios de Mediahuis como limitado a una finalidad concreta. La regla de EasyxLab para todo el laboratorio (3 de octubre de 2026) trata robots.txt como vinculante en el mínimo legal. S16 mantiene deliberadamente una regla más estricta, porque su objeto son esas reservas.

Auditorías de los detectores (todas hechas por agentes de IA).

  • Muestra del propio autor, detectores v1/v2: el detector de reservas acertó en 54 de 54 casos marcados; el detector de prohibiciones v2 acertó en 35 de 62.
  • Primer revisor independiente, v1/v2, otros 44 sitios: prohibición, acertó en 15 de 21 casos marcados y encontró 15 de 15; reserva, acertó en 20 de 20 casos marcados y encontró 20 de 21.
  • Nuevo revisor, v3, otros 43 sitios: prohibición, 15 de 15 en la muestra, pero una exhaustividad (recall) de alrededor del 84 % (130 de 154) al contar las 24 omisiones de D7; reserva, 15 de 16.
  • La v4 cambia exactamente esos dos modos de fallo. No se declara ninguna auditoría de la v4.

Proveedores. El 3 de octubre de 2026 pudimos leer la documentación sobre rastreadores de 8 de 14 proveedores; los 8 mencionan robots.txt. Ninguno menciona TDMRep, Content-Signal, Content-Usage ni noai.

Los resultados por sitio indican lo que dicen los ficheros de cada sitio. No son una evaluación del sitio: la obligación recae en los proveedores de IA. El comprobador es scripts/optout_check.py <domain>, que podría convertirse en la herramienta gratuita optout-lint.

Citar este estudio

Cita
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations
BibTeX
@techreport{easyxlab_s16,
  title       = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S16},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}