EasyxLab
Lingua: IT Italiano

Traduzione con IA dell'originale in inglese, che è la versione di riferimento. Leggi in inglese

Studi / S16

Riserve sull'estrazione di testo e di dati nella stampa dell'UE-27, canale per canale

Gli editori di notizie dell'UE esprimono riserve sull'estrazione di testo e di dati che un crawler di IA possa leggere, qualunque sia il suo nome?

Bozza di lavoroPubblicato 2026-10-03

Sintesi

Dal 2 agosto 2025 il regolamento sull'intelligenza artificiale (Art. 53(1)(c)) impone ai fornitori di modelli di IA per finalità generali di individuare e rispettare le riserve sull'estrazione di testo e di dati espresse a norma dell'Art. 4(3) della direttiva (UE) 2019/790, «ad esempio attraverso strumenti che consentano lettura automatizzata» per i contenuti online. I modelli immessi sul mercato prima di tale data hanno tempo fino al 2 agosto 2027 (Art. 111(3)). La Commissione può infliggere ammende ai fornitori dal 2 agosto 2026.

Abbiamo letto ciò che un crawler può leggere su 1.511 siti di notizie in 27 Stati membri: quotidiani e siti di notizie tratti da Wikidata il cui host è tra i primi 100.000 della lista del Chrome UX Report del rispettivo paese, escluse le gazzette ufficiali. I canali erano robots.txt (RFC 9309), TDMRep (file, intestazione HTTP, <meta>), Content-Signal, la regola Content-Usage dell'IETF, noai e llms.txt. Abbiamo richiesto un URL solo dove robots.txt lo consentiva.

Sui 1.356 siti che abbiamo potuto leggere per intero, 99 su 1.356 (7,3%), IC 95% 6,0–8,8%, esprimono una riserva che vincola un crawler qualunque sia il suo nome.

  • 558 su 1.356 (41,2%) bloccano alla radice almeno un crawler di IA indicato per nome. Di questi, 480 su 558 (86,0%), IC 82,9–88,7%, non esprimono nulla che un crawler con un nome nuovo leggerebbe.
  • 777 su 1.356 (57,3%) non esprimono alcuna riserva in nessuno dei canali che abbiamo letto.
  • Sull'insieme dei 1.510 siti che hanno risposto alla richiesta di robots.txt, quelli con una riserva valida per qualsiasi crawler sono almeno 110 su 1.510 (7,3%). Quelli che bloccano crawler per nome senza una riserva valida per qualsiasi crawler sono al massimo 621 su 699 (88,8%).
  • Per gruppo di paesi, siti letti per intero con una riserva valida per qualsiasi crawler: paesi grandi 74 su 800 (9,2%), medi 15 su 431 (3,5%), piccoli 10 su 125 (8,0%).
  • Sensibilità alla nostra stessa modifica della regola (D5). Con la regola di accesso congelata prima della raccolta, senza la nuova scansione D5, il risultato è di 93 siti letti per intero su 1.282 (7,3%), IC 6,0–8,8%, con una riserva valida per qualsiasi crawler, e 0 contraddizioni.

Canali.

  • TDMRep è presente su 71 siti su 1.356 (5,2%), IC 4,2–6,6%. Per 58 dei 71 si trova solo in un'intestazione o in un elemento <meta> (meta 41, intestazione 22, file 13). Lo usano 53 dei 192 siti francesi letti per intero (27,6%).
  • Content-Signal ai-train=no compare su 18 siti. Il train-ai=n dell'IETF compare su 0.
  • 17 siti inviano Content-Usage: ai=n. È l'etichetta per l'addestramento dell'IA di draft-ietf-aipref-vocab-01; la bozza attuale l'ha eliminata, quindi i parser devono ignorarla. Letta come riserva sull'addestramento, porterebbe la quota di riserve valide per qualsiasi crawler a 116 su 1.356 (8,6%).
  • Contraddizioni: 2 contraddizioni tra i 1.356 con la regola attuale, 0 con la regola congelata. Entrambe riguardano siti del Corriere della Sera, letti solo nella nuova scansione D5. Ciascuno invia Content-Signal ai-train=yes insieme a una riserva TDMRep in un elemento <meta>.
  • 218 su 1.510 (14,4%) scrivono una riserva o un divieto generale nei commenti di robots.txt, che un parser conforme alla RFC 9309 scarta.

L'accesso, e dove abbiamo sbagliato. Per 154 siti abbiamo letto solo robots.txt, perché un rilevatore volutamente prudente classifica i loro commenti come divieto generale di accesso automatizzato. Lo studio ha violato cinque volte la propria regola di accesso; ogni violazione è dichiarata e i relativi dati sono stati cancellati:

  • D0: il pilota esplorativo.
  • D1: 7 richieste a un host prima di consultarne il robots.txt.
  • D2: 245 richieste a 92 siti.
  • D4: 3 richieste a un sito.
  • D7: 72 richieste a 24 siti.

Le richieste D7 sono state inviate in una nuova scansione (D5) eseguita dopo la raccolta, dopo che l'agente di IA che coordinava lo studio aveva cambiato la regola su ciò che conta come divieto. Le istruzioni dello studio classificavano erroneamente l'avviso dei 23 siti di Mediahuis come relativo a una finalità specifica. La regola di EasyxLab valida per tutto il laboratorio (3 ottobre 2026) tratta robots.txt come vincolante nella misura minima prevista dalla legge. S16 mantiene volutamente una regola più rigorosa, perché il suo oggetto sono quelle riserve.

Verifiche dei rilevatori (tutte svolte da agenti di IA).

  • Campione dell'autore, rilevatori v1/v2: il rilevatore di riserve era corretto su 54 delle 54 segnalazioni; il rilevatore di divieti v2 era corretto su 35 delle 62.
  • Primo revisore indipendente, v1/v2, altri 44 siti: divieto corretto su 15 delle 21 segnalazioni e 15 trovati su 15; riserva corretta su 20 delle 20 segnalazioni e 20 trovate su 21.
  • Nuovo revisore, v3, altri 43 siti: divieto 15 su 15 nel campione, ma un richiamo (recall) di circa l'84% (130 su 154) contando i 24 casi mancati di D7; riserva 15 su 16.
  • La v4 modifica esattamente queste due modalità di errore. Non si dichiara alcuna verifica della v4.

Fornitori. Il 3 ottobre 2026 abbiamo potuto leggere la documentazione sui crawler di 8 fornitori su 14; tutti e 8 citano robots.txt. Nessuno cita TDMRep, Content-Signal, Content-Usage o noai.

I risultati per sito riportano ciò che dicono i file di ciascun sito. Non sono una valutazione del sito: l'obbligo ricade sui fornitori di IA. Lo strumento di verifica è scripts/optout_check.py <domain>, che potrebbe diventare lo strumento gratuito optout-lint.

Cita questo studio

Citazione
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations
BibTeX
@techreport{easyxlab_s16,
  title       = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S16},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}