Studier / S16
Forbehold mod tekst- og datamining i pressen i EU-27, kanal for kanal
Udtrykker nyhedsudgivere i EU forbehold mod tekst- og datamining, som en AI-crawler kan læse, uanset hvad den hedder?
Resumé
Siden den 2. august 2025 har forordningen om kunstig intelligens (Art. 53(1)(c)) pålagt udbydere af AI-modeller til almen brug at identificere og overholde forbehold mod tekst- og datamining, der udtrykkes i henhold til Art. 4(3) i direktiv (EU) 2019/790, »såsom en maskinlæsbar måde« for indhold online. Modeller, der er bragt i omsætning før denne dato, har frist til den 2. august 2027 (Art. 111(3)). Kommissionen kan pålægge udbydere bøder fra den 2. august 2026.
Vi læste, hvad en crawler kan læse på 1.511 nyhedswebsteder i 27 medlemsstater: aviser og nyhedssites fra Wikidata, hvis vært ligger blandt de første 100.000 på Chrome UX Report-listen for deres land, eksklusive officielle statstidender. Kanalerne var robots.txt (RFC 9309), TDMRep (fil, HTTP-header, <meta>), Content-Signal, IETF-reglen Content-Usage, noai og llms.txt. Vi hentede kun en URL, hvor robots.txt tillod det.
Af de 1.356 websteder, som vi kunne læse fuldt ud, udtrykker 99 af 1.356 (7,3 %), 95 %-KI 6,0–8,8 %, et forbehold, der binder en crawler uanset dens navn.
- 558 af 1.356 (41,2 %) blokerer mindst én navngiven AI-crawler på rodniveau. Af dem udtrykker 480 af 558 (86,0 %), KI 82,9–88,7 %, intet, som en crawler med et nyt navn ville læse.
- 777 af 1.356 (57,3 %) udtrykker intet forbehold i nogen af de kanaler, vi læste.
- Blandt alle 1.510 websteder, der svarede på forespørgslen efter
robots.txt, er dem med et navneuafhængigt forbehold mindst 110 af 1.510 (7,3 %). Dem, der blokerer crawlere ved navn uden et navneuafhængigt forbehold, er højst 621 af 699 (88,8 %). - Efter landegruppe, navneuafhængige forbehold blandt de websteder, der blev læst fuldt ud: store lande 74 af 800 (9,2 %), mellemstore 15 af 431 (3,5 %), små 10 af 125 (8,0 %).
- Følsomhed over for vores egen regelændring (D5). Efter den adgangsregel, der blev fastfrosset før indsamlingen, uden genscanningen D5, er resultatet 93 af 1.282 websteder læst fuldt ud (7,3 %), KI 6,0–8,8 %, med et navneuafhængigt forbehold, og 0 modstridigheder.
Kanaler.
- TDMRep findes på 71 af 1.356 (5,2 %), KI 4,2–6,6 %. For 58 af de 71 står det kun i en header eller et
<meta>-element (meta 41, header 22, fil 13). 53 af 192 franske websteder læst fuldt ud (27,6 %) bruger det. - Content-Signal
ai-train=noforekommer på 18 websteder. IETF'strain-ai=nforekommer på 0. - 17 websteder sender
Content-Usage: ai=n. Det er mærket for AI-træning i draft-ietf-aipref-vocab-01; det aktuelle udkast har fjernet det, så parsere skal ignorere det. Læst som et forbehold mod træning ville det hæve andelen af navneuafhængige forbehold til 116 af 1.356 (8,6 %). - Modstridigheder: 2 modstridigheder blandt de 1.356 efter den nuværende regel, 0 efter den fastfrosne regel. Begge er websteder fra Corriere della Sera, som kun blev læst i genscanningen D5. Hvert af dem sender Content-Signal
ai-train=yessammen med et TDMRep-forbehold i et<meta>-element. - 218 af 1.510 (14,4 %) skriver et forbehold eller et generelt forbud i kommentarer i
robots.txt, som en parser efter RFC 9309 kasserer.
Adgang, og hvad vi gjorde forkert. For 154 websteder læste vi kun robots.txt, fordi en bevidst forsigtig detektor klassificerer deres kommentarer som et generelt forbud mod automatiseret adgang. Undersøgelsen brød fem gange sin egen adgangsregel; hvert brud er oplyst, og dets data er slettet:
- D0: den udforskende pilot.
- D1: 7 forespørgsler til en vært, før dens
robots.txtvar hentet. - D2: 245 forespørgsler til 92 websteder.
- D4: 3 forespørgsler til ét websted.
- D7: 72 forespørgsler til 24 websteder.
D7-forespørgslerne blev sendt i en genscanning (D5) efter indsamlingen, efter at undersøgelsens koordinerende AI-agent havde ændret reglen for, hvad der tæller som forbud. Undersøgelsens instruktioner klassificerede fejlagtigt meddelelsen på de 23 Mediahuis-websteder som formålsspecifik. EasyxLabs regel for hele laboratoriet (3. oktober 2026) behandler robots.txt som bindende på det lovpligtige minimum. S16 fastholder bevidst en strengere regel, fordi det er disse forbehold, undersøgelsen handler om.
Kontroller af detektorerne (alle udført af AI-agenter).
- Forfatterens egen stikprøve, detektorer v1/v2: forbeholdsdetektoren ramte rigtigt i 54 af 54 markeringer; forbudsdetektoren v2 ramte rigtigt i 35 af 62.
- Første uafhængige bedømmer, v1/v2, 44 andre websteder: forbud rigtigt i 15 af 21 markeringer og 15 af 15 fundet; forbehold rigtigt i 20 af 20 markeringer og 20 af 21 fundet.
- Genbedømmer, v3, yderligere 43 websteder: forbud 15 af 15 i stikprøven, men en recall på omkring 84 % (130 af 154), når de 24 oversete D7-tilfælde medregnes; forbehold 15 af 16.
- v4 ændrer præcis disse to fejltyper. Der hævdes ingen kontrol af v4.
Udbydere. Den 3. oktober 2026 kunne vi læse crawlerdokumentationen fra 8 af 14 udbydere; alle 8 nævner robots.txt. Ingen nævner TDMRep, Content-Signal, Content-Usage eller noai.
Resultaterne pr. websted angiver, hvad hvert websteds filer siger. De er ikke en vurdering af webstedet: forpligtelsen påhviler AI-udbyderne. Kontrolværktøjet er scripts/optout_check.py <domain>, som kan blive det gratis værktøj optout-lint.
Citér dette studie
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}