Studies / S16
Voorbehouden voor tekst- en datamining in de pers van de EU-27, kanaal per kanaal
Maken nieuwsuitgevers in de EU voorbehouden voor tekst- en datamining kenbaar die een AI-crawler kan lezen, ongeacht zijn naam?
Samenvatting
Sinds 2 augustus 2025 verplicht de verordening artificiële intelligentie (Art. 53(1)(c)) aanbieders van AI-modellen voor algemene doeleinden om voorbehouden voor tekst- en datamining die op grond van Art. 4(3) van Richtlijn (EU) 2019/790 tot uitdrukking zijn gebracht, vast te stellen en na te leven, bij online content “zoals machinaal leesbare middelen”. Voor modellen die vóór die datum in de handel zijn gebracht, geldt een termijn tot 2 augustus 2027 (Art. 111(3)). De Commissie kan aanbieders vanaf 2 augustus 2026 geldboeten opleggen.
We hebben gelezen wat een crawler kan lezen op 1.511 nieuwswebsites in 27 lidstaten: kranten en nieuwssites uit Wikidata waarvan de host in de top 100.000 van de Chrome UX Report-lijst van hun land staat, met uitzondering van officiële publicatiebladen. De kanalen waren robots.txt (RFC 9309), TDMRep (bestand, HTTP-header, <meta>), Content-Signal, de IETF-regel Content-Usage, noai en llms.txt. We vroegen een URL alleen op als robots.txt dat toestond.
Van de 1.356 sites die we volledig konden lezen, maken er 99 van 1.356 (7,3%), 95%-BI 6,0–8,8%, een voorbehoud kenbaar dat een crawler bindt, ongeacht zijn naam.
- 558 van 1.356 (41,2%) blokkeren ten minste één AI-crawler bij naam op rootniveau. Daarvan maken 480 van 558 (86,0%), BI 82,9–88,7%, niets kenbaar wat een crawler met een nieuwe naam zou lezen.
- 777 van 1.356 (57,3%) maken in geen enkel kanaal dat we lazen een voorbehoud kenbaar.
- Over alle 1.510 sites die op het opvragen van
robots.txtantwoordden, hebben ten minste 110 van 1.510 (7,3%) een naamonafhankelijk voorbehoud. Sites die crawlers bij naam blokkeren zonder naamonafhankelijk voorbehoud, zijn er hoogstens 621 van 699 (88,8%). - Per landengroep, naamonafhankelijke voorbehouden onder de volledig gelezen sites: grote landen 74 van 800 (9,2%), middelgrote 15 van 431 (3,5%), kleine 10 van 125 (8,0%).
- Gevoeligheid voor onze eigen regelwijziging (D5). Volgens de toegangsregel die vóór de verzameling werd bevroren, zonder de nieuwe scan D5, is de uitkomst 93 van 1.282 volledig gelezen sites (7,3%), BI 6,0–8,8%, met een naamonafhankelijk voorbehoud, en 0 tegenstrijdigheden.
Kanalen.
- TDMRep staat op 71 van 1.356 (5,2%), BI 4,2–6,6%. Bij 58 van de 71 staat het alleen in een header of een
<meta>-element (meta 41, header 22, bestand 13). 53 van de 192 volledig gelezen Franse sites (27,6%) gebruiken het. - Content-Signal
ai-train=nokomt voor op 18 sites. Hettrain-ai=nvan de IETF komt op 0 sites voor. - 17 sites sturen
Content-Usage: ai=n. Dat is het label voor AI-training uit draft-ietf-aipref-vocab-01; de huidige versie van de draft heeft het geschrapt, dus parsers moeten het negeren. Gelezen als voorbehoud voor training zou het het aandeel naamonafhankelijke voorbehouden verhogen tot 116 van 1.356 (8,6%). - Tegenstrijdigheden: 2 tegenstrijdigheden onder de 1.356 volgens de huidige regel, 0 volgens de bevroren regel. Beide zijn sites van Corriere della Sera, die alleen bij de nieuwe scan D5 zijn gelezen. Elk daarvan stuurt Content-Signal
ai-train=yessamen met een TDMRep-voorbehoud in een<meta>-element. - 218 van 1.510 (14,4%) schrijven een voorbehoud of een algemeen verbod in opmerkingen in
robots.txt, die een parser volgens RFC 9309 verwerpt.
Toegang, en wat we fout deden. Bij 154 sites lazen we alleen robots.txt, omdat een bewust voorzichtige detector hun opmerkingen aanmerkt als een algemeen verbod op geautomatiseerde toegang. De studie heeft haar eigen toegangsregel vijf keer overtreden; elke overtreding is gemeld en de bijbehorende gegevens zijn verwijderd:
- D0: de verkennende pilot.
- D1: 7 verzoeken aan een host voordat diens
robots.txtwas opgevraagd. - D2: 245 verzoeken aan 92 sites.
- D4: 3 verzoeken aan één site.
- D7: 72 verzoeken aan 24 sites.
De D7-verzoeken werden verstuurd bij een nieuwe scan (D5) na de verzameling, nadat de coördinerende AI-agent van de studie de regel had gewijzigd voor wat als verbod geldt. De instructies van de studie classificeerden de kennisgeving van de 23 Mediahuis-sites ten onrechte als doelspecifiek. De labbrede regel van EasyxLab (3 oktober 2026) behandelt robots.txt als bindend op het wettelijke minimum. S16 houdt bewust een strengere regel aan, omdat die voorbehouden het onderwerp ervan zijn.
Controles van de detectoren (alle door AI-agents).
- Eigen steekproef van de auteur, detectoren v1/v2: de voorbehoudsdetector had het bij 54 van de 54 markeringen juist; de verbodsdetector v2 bij 35 van de 62.
- Eerste onafhankelijke beoordelaar, v1/v2, 44 andere sites: verbod juist bij 15 van de 21 markeringen en 15 van de 15 gevonden; voorbehoud juist bij 20 van de 20 markeringen en 20 van de 21 gevonden.
- Herbeoordelaar, v3, 43 verdere sites: verbod 15 van de 15 in de steekproef, maar een recall van ongeveer 84% (130 van 154) als de 24 gemiste D7-gevallen worden meegeteld; voorbehoud 15 van de 16.
- v4 wijzigt precies die twee faalwijzen. Een controle van v4 wordt niet geclaimd.
Aanbieders. Op 3 oktober 2026 konden we de crawlerdocumentatie van 8 van de 14 aanbieders lezen; alle 8 noemen robots.txt. Geen enkele noemt TDMRep, Content-Signal, Content-Usage of noai.
De resultaten per site geven weer wat de bestanden van elke site zeggen. Ze zijn geen beoordeling van de site: de verplichting ligt bij de AI-aanbieders. De checker is scripts/optout_check.py <domain>, dat de gratis tool optout-lint kan worden.
Deze studie citeren
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}