EasyxLab
Idioma: PT Português

Tradução feita por IA do original em inglês, que é a versão de referência. Ler em inglês

Estudos / S16

Reservas de prospeção de textos e dados na imprensa da UE-27, canal a canal

Os editores de imprensa da UE expressam reservas de prospeção de textos e dados que um rastreador de IA consiga ler, seja qual for o seu nome?

Versão de trabalhoPublicado 2026-10-03

Resumo

Desde 2 de agosto de 2025, o Regulamento da Inteligência Artificial (Art. 53(1)(c)) obriga os prestadores de modelos de IA de finalidade geral a identificar e cumprir as reservas de prospeção de textos e dados expressas nos termos do Art. 4(3) da Diretiva (UE) 2019/790, «em particular por meio de leitura ótica» no caso de conteúdos em linha. Os modelos colocados no mercado antes dessa data têm até 2 de agosto de 2027 (Art. 111(3)). A Comissão pode aplicar coimas aos prestadores a partir de 2 de agosto de 2026.

Lemos o que um rastreador consegue ler em 1511 sites de notícias de 27 Estados-Membros: jornais e sites de notícias do Wikidata cujo host está entre os primeiros 100 000 da lista do Chrome UX Report do respetivo país, excluindo os diários oficiais. Os canais foram robots.txt (RFC 9309), TDMRep (ficheiro, cabeçalho HTTP, <meta>), Content-Signal, a regra Content-Usage do IETF, noai e llms.txt. Só pedimos um URL quando o robots.txt o permitia.

Nos 1356 sites que conseguimos ler na íntegra, 99 de 1356 (7,3%), IC 95% 6,0–8,8%, expressam uma reserva que vincula um rastreador seja qual for o seu nome.

  • 558 de 1356 (41,2%) bloqueiam na raiz pelo menos um rastreador de IA identificado pelo nome. Destes, 480 de 558 (86,0%), IC 82,9–88,7%, não expressam nada que um rastreador com um nome novo leria.
  • 777 de 1356 (57,3%) não expressam nenhuma reserva em nenhum dos canais que lemos.
  • No conjunto dos 1510 sites que responderam ao pedido de robots.txt, os que têm uma reserva válida para qualquer rastreador são pelo menos 110 de 1510 (7,3%). Os que bloqueiam rastreadores pelo nome sem uma reserva válida para qualquer rastreador são no máximo 621 de 699 (88,8%).
  • Por grupo de países, sites lidos na íntegra com uma reserva válida para qualquer rastreador: países grandes 74 de 800 (9,2%), médios 15 de 431 (3,5%), pequenos 10 de 125 (8,0%).
  • Sensibilidade à nossa própria alteração de regra (D5). Com a regra de acesso congelada antes da recolha, sem a nova varredura D5, o resultado é de 93 de 1282 sites lidos na íntegra (7,3%), IC 6,0–8,8%, com uma reserva válida para qualquer rastreador, e 0 contradições.

Canais.

  • O TDMRep está presente em 71 de 1356 (5,2%), IC 4,2–6,6%. Em 58 dos 71 está apenas num cabeçalho ou num elemento <meta> (meta 41, cabeçalho 22, ficheiro 13). Usam-no 53 dos 192 sites franceses lidos na íntegra (27,6%).
  • O Content-Signal ai-train=no aparece em 18 sites. O train-ai=n do IETF aparece em 0.
  • 17 sites enviam Content-Usage: ai=n. É a etiqueta de treino de IA do draft-ietf-aipref-vocab-01; o rascunho atual eliminou-a, pelo que os analisadores devem ignorá-la. Lida como reserva de treino, elevaria a proporção de reservas válidas para qualquer rastreador para 116 de 1356 (8,6%).
  • Contradições: 2 contradições entre os 1356 com a regra atual, 0 com a regra congelada. Ambas são sites do Corriere della Sera, que só foram lidos na nova varredura D5. Cada um envia Content-Signal ai-train=yes juntamente com uma reserva TDMRep num elemento <meta>.
  • 218 de 1510 (14,4%) escrevem uma reserva ou uma proibição geral em comentários do robots.txt, que um analisador conforme ao RFC 9309 descarta.

O acesso, e o que fizemos mal. Em 154 sites lemos apenas o robots.txt, porque um detetor deliberadamente conservador classifica os seus comentários como uma proibição geral do acesso automatizado. O estudo violou cinco vezes a sua própria regra de acesso; cada violação está declarada e os respetivos dados foram apagados:

  • D0: o piloto exploratório.
  • D1: 7 pedidos a um host antes de consultar o seu robots.txt.
  • D2: 245 pedidos a 92 sites.
  • D4: 3 pedidos a um site.
  • D7: 72 pedidos a 24 sites.

Os pedidos D7 foram enviados numa nova varredura (D5) feita depois da recolha, depois de o agente de IA coordenador do estudo ter alterado a regra sobre o que conta como proibição. As instruções do estudo classificaram erradamente o aviso dos 23 sites da Mediahuis como específico de uma finalidade. A regra do EasyxLab para todo o laboratório (3 de outubro de 2026) trata o robots.txt como vinculativo no mínimo legal. O S16 mantém deliberadamente uma regra mais estrita, porque o seu objeto são essas reservas.

Auditorias dos detetores (todas feitas por agentes de IA).

  • Amostra do próprio autor, detetores v1/v2: o detetor de reservas acertou em 54 de 54 casos assinalados; o detetor de proibições v2 acertou em 35 de 62.
  • Primeiro revisor independente, v1/v2, outros 44 sites: proibição, acertou em 15 de 21 casos assinalados e encontrou 15 de 15; reserva, acertou em 20 de 20 casos assinalados e encontrou 20 de 21.
  • Novo revisor, v3, mais 43 sites: proibição, 15 de 15 na amostra, mas uma sensibilidade (recall) de cerca de 84% (130 de 154) contando as 24 omissões de D7; reserva, 15 de 16.
  • A v4 altera exatamente esses dois modos de falha. Não se declara nenhuma auditoria da v4.

Prestadores. A 3 de outubro de 2026 conseguimos ler a documentação sobre rastreadores de 8 de 14 prestadores; os 8 mencionam robots.txt. Nenhum menciona TDMRep, Content-Signal, Content-Usage nem noai.

Os resultados por site indicam o que dizem os ficheiros de cada site. Não são uma avaliação do site: a obrigação recai sobre os prestadores de IA. O verificador é scripts/optout_check.py <domain>, que poderá tornar-se a ferramenta gratuita optout-lint.

Citar este estudo

Citação
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations
BibTeX
@techreport{easyxlab_s16,
  title       = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S16},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}