Uuringud / S16
Teksti- ja andmekaeve suhtes õiguste piiramine ELi 27 riigi ajakirjanduses, kanalite kaupa
Kas ELi uudisväljaanded väljendavad teksti- ja andmekaeve suhtes õiguste piiramist, mida TI-roomik suudab lugeda olenemata oma nimest?
Kokkuvõte
Alates 2. augustist 2025 nõuab ELi tehisintellekti määrus (Art. 53(1)(c)), et üldotstarbeliste tehisintellektimudelite pakkujad tuvastaksid ja järgiksid direktiivi (EL) 2019/790 Art. 4(3) kohaselt väljendatud õiguste piiramist teksti- ja andmekaeve suhtes, mis veebisisu puhul toimub „näiteks masinloetavate vahenditega“. Enne seda kuupäeva turule lastud mudelitel on aega 2. augustini 2027 (Art. 111(3)). Komisjon saab pakkujatele trahve määrata alates 2. augustist 2026.
Lugesime seda, mida roomik saab lugeda, 1 511 uudissaidil 27 liikmesriigis: need on Wikidatast pärit ajalehed ja uudissaidid, mille host kuulub oma riigi Chrome UX Reporti nimekirjas 100 000 esimese hulka; ametlikud teatajad on välja jäetud. Kanalid olid robots.txt (RFC 9309), TDMRep (fail, HTTP-päis, <meta>), Content-Signal, IETF-i Content-Usage-reegel, noai ja llms.txt. Pärisime URL-i ainult siis, kui robots.txt seda lubas.
Saitidest, mida saime täielikult lugeda, väljendavad 99 saiti 1 356-st (7,3%), 95% UV 6,0–8,8%, õiguste piiramist, mis kehtib roomiku suhtes olenemata selle nimest.
- 558 saiti 1 356-st (41,2%) blokeerivad juurtasemel vähemalt ühe nimelise TI-roomiku. Neist 480 saiti 558-st (86,0%), UV 82,9–88,7%, ei väljenda midagi, mida uue nimega roomik loeks.
- 777 saiti 1 356-st (57,3%) ei väljenda õiguste piiramist üheski kanalis, mida me lugesime.
- Kõigi 1 510 saidi seas, mis vastasid
robots.txtpäringule, on nimest sõltumatu õiguste piiramine vähemalt 110 saidil 1 510-st (7,3%). Nimelisi blokeerijaid, kellel puudub nimest sõltumatu õiguste piiramine, on kõige rohkem 621 saiti 699-st (88,8%). - Riikide suurusrühmade kaupa nimest sõltumatu õiguste piiramisega saidid täielikult loetud saitide seas: suured riigid 74 saiti 800-st (9,2%), keskmised 15 saiti 431-st (3,5%), väikesed 10 saiti 125-st (8,0%).
- Tundlikkus meie enda reeglimuudatuse (D5) suhtes. Enne andmekogumist külmutatud juurdepääsureegli järgi, ilma D5 korduskontrollita, on tulemus 93 täielikult loetud saiti 1 282-st (7,3%), UV 6,0–8,8%, millel on nimest sõltumatu õiguste piiramine, ning 0 vastuolu.
Kanalid.
- TDMRep on kasutusel 71 saidil 1 356-st (5,2%), UV 4,2–6,6%. 71-st 58 puhul on see ainult päises või
<meta>-elemendis (meta 41, päis 22, fail 13). 192 täielikult loetud Prantsuse saidist kasutab seda 53 (27,6%). - Content-Signal
ai-train=noesineb 18 saidil. IETF-itrain-ai=nesineb 0 saidil. - 17 saiti saadavad
Content-Usage: ai=n. See on draft-ietf-aipref-vocab-01 TI-treenimise silt; kehtivast kavandist on see välja jäetud, seega peavad parserid seda eirama. Kui seda lugeda treenimist puudutavaks õiguste piiramiseks, tõuseks nimest sõltumatu osakaal 116 saidini 1 356-st (8,6%). - Vastuolud: kehtiva reegli järgi 2 vastuolu 1 356 saidi seas, külmutatud reegli järgi 0. Mõlemad on Corriere della Sera saidid, mida loeti ainult D5 korduskontrollis. Kumbki saadab Content-Signal
ai-train=yeskoos TDMRepi<meta>-elemendis väljendatud õiguste piiramisega. - 218 saiti 1 510-st (14,4%) kirjutavad õiguste piiramise või üldise keelu
robots.txtkommentaaridesse, mille RFC 9309 parser kõrvale jätab.
Juurdepääs ja meie vead. 154 saidi puhul lugesime ainult robots.txt faili, sest teadlikult konservatiivne tuvastaja märgib nende kommentaarid automatiseeritud juurdepääsu üldiseks keeluks. Uuring rikkus oma juurdepääsureeglit viiel korral; iga rikkumine on deklareeritud ja selle andmed kustutatud:
- D0: eeluuringu piloot.
- D1: 7 päringut hostile enne selle
robots.txtlugemist. - D2: 245 päringut 92 saidile.
- D4: 3 päringut ühele saidile.
- D7: 72 päringut 24 saidile.
D7 päringud saadeti pärast andmekogumist tehtud korduskontrollis (D5), kui uuringut koordineeriv TI-agent oli muutnud reeglit selle kohta, mida loetakse keeluks. Uuringu juhised liigitasid 23 Mediahuisi saidi teate ekslikult eesmärgipõhiseks. EasyxLabi kogu laborit hõlmav reegel (3. oktoober 2026) käsitab robots.txt faili siduvana õigusliku miinimumi ulatuses. S16 hoiab teadlikult rangemat reeglit, sest selle uurimisobjekt ongi need õiguste piiramised.
Tuvastajate auditid (kõik tegid TI-agendid).
- Autori enda valim, tuvastajad v1/v2: õiguste piiramise tuvastaja oli õige 54 märkimisel 54-st; v2 keelutuvastaja oli õige 35 korral 62-st.
- Esimene sõltumatu ülevaataja, v1/v2, 44 muud saiti: keelutuvastaja oli õige 15 märkimisel 21-st ja leidis 15 juhtu 15-st; õiguste piiramise tuvastaja oli õige 20 märkimisel 20-st ja leidis 20 juhtu 21-st.
- Korduvülevaataja, v3, veel 43 saiti: keelutuvastaja oli valimis õige 15 korral 15-st, kuid saagis oli umbes 84% (130 juhtu 154-st), kui arvestada 24 D7 möödalasku; õiguste piiramise tuvastaja 15 korral 16-st.
- v4 muudab täpselt neid kahte vealiiki. v4 auditeerimist ei väideta.
Pakkujad. 2026-10-03 saime lugeda 14 pakkujast 8 roomikudokumentatsiooni; kõik 8 nimetavad robots.txt faili. TDMRep, Content-Signal, Content-Usage ega noai ei ole üheski neist nimetatud.
Saitide kaupa tulemused näitavad, mida iga saidi failid ütlevad. Need ei ole saidi hinnang: kohustus lasub TI-pakkujatel. Kontrollija on scripts/optout_check.py <domain>, millest võib saada tasuta tööriist optout-lint.
Viita sellele uuringule
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}