Pētījumi / S16
Tekstizraces un datizraces tiesību rezervācijas ES-27 presē, kanāls pa kanālam
Vai ES ziņu izdevēji pauž tekstizraces un datizraces tiesību rezervācijas, ko MI rāpulis var nolasīt neatkarīgi no tā nosaukuma?
Kopsavilkums
Kopš 2025. gada 2. augusta Mākslīgā intelekta akts (Art. 53(1)(c)) prasa vispārīga lietojuma MI modeļu nodrošinātājiem identificēt un ievērot tekstizraces un datizraces tiesību rezervāciju, kas pausta, ievērojot Direktīvas (ES) 2019/790 Art. 4(3), tiešsaistes saturam — „tostarp ar mašīnlasāmiem līdzekļiem“. Modeļiem, kas laisti tirgū pirms šā datuma, termiņš ir līdz 2027. gada 2. augustam (Art. 111(3)). Komisija var uzlikt nodrošinātājiem naudas sodus no 2026. gada 2. augusta.
Mēs nolasījām to, ko rāpulis var nolasīt 1511 ziņu vietnēs 27 dalībvalstīs: tie ir laikraksti un ziņu vietnes no Wikidata, kuru resursdators (host) ir savas valsts Chrome UX Report saraksta pirmajos 100 000, izņemot oficiālos izdevumus. Kanāli bija robots.txt (RFC 9309), TDMRep (datne, HTTP galvene, <meta>), Content-Signal, IETF noteikums Content-Usage, noai un llms.txt. URL pieprasījām tikai tur, kur to atļāva robots.txt.
No 1356 vietnēm, kuras varējām nolasīt pilnībā, 99 no 1356 (7,3 %), 95 % TI 6,0–8,8 %, pauž rezervāciju, kas saista rāpuli neatkarīgi no tā nosaukuma.
- 558 no 1356 (41,2 %) saknes līmenī bloķē vismaz vienu konkrēti nosauktu MI rāpuli. No tām 480 no 558 (86,0 %), TI 82,9–88,7 %, nepauž neko, ko nolasītu rāpulis ar jaunu nosaukumu.
- 777 no 1356 (57,3 %) nevienā no mūsu nolasītajiem kanāliem nepauž nekādu rezervāciju.
- Starp visām 1510 vietnēm, kas atbildēja attiecībā uz
robots.txt, vietņu ar agnostisku (no rāpuļa nosaukuma neatkarīgu) rezervāciju ir vismaz 110 no 1510 (7,3 %). Konkrētu nosaukumu bloķētāju bez agnostiskas rezervācijas ir ne vairāk kā 621 no 699 (88,8 %). - Pēc valstu grupām vietnes ar agnostisku rezervāciju starp pilnībā nolasītajām: lielās valstis 74 no 800 (9,2 %), vidējās 15 no 431 (3,5 %), mazās 10 no 125 (8,0 %).
- Jutīgums pret mūsu pašu noteikuma izmaiņām (D5). Saskaņā ar piekļuves noteikumu, kas iesaldēts pirms datu vākšanas, bez atkārtotās skenēšanas D5 rezultāts ir 93 no 1282 (7,3 %), TI 6,0–8,8 %, pilnībā nolasītu vietņu ar agnostisku rezervāciju un 0 pretrunu.
Kanāli.
- TDMRep izmanto 71 no 1356 (5,2 %), TI 4,2–6,6 %. 58 no šīm 71 tas ir tikai galvenē vai elementā
<meta>(meta 41, galvene 22, datne 13). To izmanto 53 no 192 pilnībā nolasītajām Francijas vietnēm (27,6 %). - Content-Signal
ai-train=noizmanto 18 vietnes. IETFtrain-ai=nizmanto 0. - 17 vietnes sūta
Content-Usage: ai=n. Tā ir MI apmācības etiķete no draft-ietf-aipref-vocab-01; pašreizējais projekts to izņēma, tāpēc parsētājiem tā jāignorē. Ja to lasītu kā apmācības tiesību rezervāciju, agnostiskais īpatsvars pieaugtu līdz 116 no 1356 (8,6 %). - Pretrunas: 2 pretrunas starp 1356 saskaņā ar pašreizējo noteikumu, 0 saskaņā ar iesaldēto noteikumu. Abas ir Corriere della Sera vietnes, kas tika nolasītas tikai atkārtotajā skenēšanā D5. Katra no tām sūta Content-Signal
ai-train=yeskopā ar TDMRep rezervāciju elementā<meta>. - 218 no 1510 (14,4 %) raksta rezervāciju vai vispārēju aizliegumu
robots.txtkomentāros, kurus RFC 9309 parsētājs atmet.
Piekļuve un kur mēs kļūdījāmies. 154 vietnēs mēs nolasījām tikai robots.txt, jo apzināti konservatīvs detektors to komentārus atzīmē kā vispārēju automatizētas piekļuves aizliegumu. Pētījums piecas reizes pārkāpa savu piekļuves noteikumu; katrs pārkāpums ir deklarēts, un tā dati izdzēsti:
- D0: izpētes pilotprojekts.
- D1: 7 pieprasījumi resursdatoram pirms tā
robots.txt. - D2: 245 pieprasījumi 92 vietnēm.
- D4: 3 pieprasījumi vienai vietnei.
- D7: 72 pieprasījumi 24 vietnēm.
D7 pieprasījumi tika nosūtīti atkārtotā skenēšanā (D5), kas veikta pēc datu vākšanas, pēc tam, kad pētījuma koordinējošais MI aģents mainīja noteikumu par to, kas uzskatāms par aizliegumu. Pētījuma instrukcijās 23 Mediahuis vietņu paziņojums tika kļūdaini klasificēts kā konkrētam nolūkam paredzēts. EasyxLab visai laboratorijai piemērojamais noteikums (2026. gada 3. oktobris) uzskata robots.txt par saistošu tiesiskā minimuma apmērā. S16 apzināti saglabā stingrāku noteikumu, jo tā temats ir tieši šīs rezervācijas.
Detektoru auditi (visus veica MI aģenti).
- Autora paša izlase, detektori v1/v2: rezervāciju detektors bija pareizs 54 no 54 atzīmētajiem gadījumiem; aizlieguma detektors v2 bija pareizs 35 no 62.
- Pirmais neatkarīgais recenzents, v1/v2, 44 citas vietnes: aizliegums pareizs 15 no 21 atzīmētā gadījuma un atrasti 15 no 15; rezervācija pareiza 20 no 20 atzīmētajiem gadījumiem un atrasti 20 no 21.
- Atkārtotais recenzents, v3, vēl 43 vietnes: aizliegums 15 no 15 izlasē, bet pārklājums (recall) ap 84 % (130 no 154), ja ieskaita 24 D7 izlaidumus; rezervācija 15 no 16.
- v4 maina tieši šos divus kļūdu veidus. Netiek apgalvots, ka v4 būtu auditēts.
Nodrošinātāji. 2026-10-03 mēs varējām nolasīt rāpuļu dokumentāciju 8 no 14 nodrošinātājiem; visi 8 min robots.txt. Neviens nemin TDMRep, Content-Signal, Content-Usage vai noai.
Rezultāti pa vietnēm norāda, ko saka katras vietnes datnes. Tie nav vietnes novērtējums: pienākums ir MI nodrošinātājiem. Pārbaudes rīks ir scripts/optout_check.py <domain>, kas var kļūt par bezmaksas rīku optout-lint.
Citējiet šo pētījumu
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}