Études / S16
Réservations de fouille de textes et de données dans la presse de l'UE-27, canal par canal
Les éditeurs de presse de l'UE expriment-ils des réservations de fouille de textes et de données qu'un robot d'IA peut lire, quel que soit son nom ?
Résumé
Depuis le 2 août 2025, le règlement sur l'intelligence artificielle (Art. 53(1)(c)) impose aux fournisseurs de modèles d'IA à usage général d'identifier et de respecter les réservations de fouille de textes et de données exprimées en vertu de l'Art. 4(3) de la directive (UE) 2019/790, « notamment par des procédés lisibles par machine » pour les contenus en ligne. Les modèles mis sur le marché avant cette date ont jusqu'au 2 août 2027 (Art. 111(3)). La Commission peut infliger des amendes aux fournisseurs à partir du 2 août 2026.
Nous avons lu ce qu'un robot d'indexation peut lire sur 1 511 sites d'information de 27 États membres : journaux et sites d'information issus de Wikidata dont l'hôte figure parmi les 100 000 premiers de la liste du Chrome UX Report de leur pays, à l'exclusion des journaux officiels. Les canaux étaient robots.txt (RFC 9309), TDMRep (fichier, en-tête HTTP, <meta>), Content-Signal, la règle Content-Usage de l'IETF, noai et llms.txt. Nous n'avons demandé une URL que lorsque robots.txt l'autorisait.
Sur les 1 356 sites que nous avons pu lire intégralement, 99 sur 1 356 (7,3 %), IC à 95 % 6,0–8,8 %, expriment une réservation qui vaut pour un robot d'indexation quel que soit son nom.
- 558 sur 1 356 (41,2 %) bloquent à la racine au moins un robot d'IA désigné par son nom. Parmi eux, 480 sur 558 (86,0 %), IC 82,9–88,7 %, n'expriment rien qu'un robot portant un nouveau nom lirait.
- 777 sur 1 356 (57,3 %) n'expriment aucune réservation dans aucun des canaux que nous avons lus.
- Sur l'ensemble des 1 510 sites qui ont répondu pour
robots.txt, on compte au moins 110 sites sur 1 510 (7,3 %) avec une réservation valable pour tout robot. Ceux qui bloquent des robots désignés par leur nom sans réservation valable pour tout robot sont au plus 621 sur 699 (88,8 %). - Par groupe de pays, sites lus intégralement avec une réservation valable pour tout robot : grands pays 74 sur 800 (9,2 %), pays moyens 15 sur 431 (3,5 %), petits pays 10 sur 125 (8,0 %).
- Sensibilité à notre propre changement de règle (D5). Selon la règle d'accès gelée avant la collecte, sans le nouveau balayage D5, le résultat est de 93 sites lus intégralement sur 1 282 (7,3 %), IC 6,0–8,8 %, avec une réservation valable pour tout robot, et 0 contradiction.
Canaux.
- TDMRep figure sur 71 sites sur 1 356 (5,2 %), IC 4,2–6,6 %. Pour 58 des 71, il ne se trouve que dans un en-tête ou un élément
<meta>(meta 41, en-tête 22, fichier 13). 53 des 192 sites français lus intégralement (27,6 %) l'utilisent. - Content-Signal
ai-train=noapparaît sur 18 sites. Letrain-ai=nde l'IETF apparaît sur 0. - 17 sites envoient
Content-Usage: ai=n. C'est l'étiquette d'entraînement de l'IA de draft-ietf-aipref-vocab-01 ; le projet actuel l'a supprimée, de sorte que les analyseurs doivent l'ignorer. Lue comme une réservation relative à l'entraînement, elle porterait la part des réservations valables pour tout robot à 116 sur 1 356 (8,6 %). - Contradictions : 2 contradictions parmi les 1 356 selon la règle actuelle, 0 selon la règle gelée. Il s'agit dans les deux cas de sites du Corriere della Sera, qui n'ont été lus que lors du nouveau balayage D5. Chacun envoie Content-Signal
ai-train=yesen même temps qu'une réservation TDMRep dans un élément<meta>. - 218 sur 1 510 (14,4 %) écrivent une réservation ou une interdiction générale dans des commentaires de
robots.txt, qu'un analyseur conforme à la RFC 9309 écarte.
L'accès, et nos erreurs. Pour 154 sites, nous n'avons lu que robots.txt, car un détecteur délibérément prudent classe leurs commentaires comme une interdiction générale de l'accès automatisé. L'étude a enfreint cinq fois sa propre règle d'accès ; chaque manquement est déclaré et ses données ont été supprimées :
- D0 : le pilote exploratoire.
- D1 : 7 requêtes à un hôte avant de consulter son
robots.txt. - D2 : 245 requêtes à 92 sites.
- D4 : 3 requêtes à un site.
- D7 : 72 requêtes à 24 sites.
Les requêtes D7 ont été envoyées lors d'un nouveau balayage (D5) effectué après la collecte, après que l'agent d'IA coordinateur de l'étude a modifié la règle définissant ce qui compte comme une interdiction. Les instructions de l'étude classaient à tort la mention des 23 sites de Mediahuis comme limitée à une finalité particulière. La règle commune à tout EasyxLab (3 octobre 2026) traite robots.txt comme contraignant au minimum légal. S16 conserve délibérément une règle plus stricte, parce que son objet est ces réservations.
Audits des détecteurs (tous réalisés par des agents d'IA).
- Échantillon de l'auteur, détecteurs v1/v2 : le détecteur de réservations avait raison pour 54 des 54 cas signalés ; le détecteur d'interdictions v2 avait raison pour 35 des 62.
- Premier relecteur indépendant, v1/v2, 44 autres sites : interdiction, juste pour 15 des 21 cas signalés, et 15 trouvées sur 15 ; réservation, juste pour 20 des 20 cas signalés, et 20 trouvées sur 21.
- Nouveau relecteur, v3, 43 sites supplémentaires : interdiction, 15 sur 15 dans l'échantillon, mais un rappel d'environ 84 % (130 sur 154) une fois comptés les 24 cas manqués de D7 ; réservation, 15 sur 16.
- La v4 modifie exactement ces deux modes de défaillance. Aucun audit de la v4 n'est revendiqué.
Fournisseurs. Le 3 octobre 2026, nous avons pu lire la documentation sur les robots d'indexation de 8 fournisseurs sur 14 ; les 8 citent robots.txt. Aucun ne cite TDMRep, Content-Signal, Content-Usage ou noai.
Les résultats par site indiquent ce que disent les fichiers de chaque site. Ils ne constituent pas une évaluation du site : l'obligation pèse sur les fournisseurs d'IA. Le vérificateur est scripts/optout_check.py <domain>, qui pourrait devenir l'outil gratuit optout-lint.
Citer cette étude
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}