Tyrimai / S16
Išlygos dėl pasiliekamų teisių į tekstų ir duomenų gavybą ES-27 spaudoje, kanalas po kanalo
Ar ES naujienų leidėjai pareiškia išlygas dėl pasiliekamų teisių į tekstų ir duomenų gavybą, kurias DI robotas gali perskaityti, kad ir koks būtų jo pavadinimas?
Santrauka
Nuo 2025 m. rugpjūčio 2 d. Dirbtinio intelekto aktas (Art. 53(1)(c)) reikalauja, kad bendrosios paskirties DI modelių tiekėjai nustatytų pagal Direktyvos (ES) 2019/790 Art. 4(3) išreikštas išlygas dėl pasiliekamų teisių į tekstų ir duomenų gavybą ir jų laikytųsi; internete prieinamo turinio atveju jos išreiškiamos, „pavyzdžiui, kompiuterio skaitomomis priemonėmis“. Iki šios datos rinkai pateiktiems modeliams terminas – 2027 m. rugpjūčio 2 d. (Art. 111(3)). Komisija gali skirti tiekėjams baudas nuo 2026 m. rugpjūčio 2 d.
Perskaitėme tai, ką robotas gali perskaityti 1511 naujienų svetainių 27 valstybėse narėse: tai laikraščiai ir naujienų svetainės iš Wikidata, kurių serveris (host) patenka tarp 100 000 populiariausių jų šalies Chrome UX Report sąraše, išskyrus oficialiuosius leidinius. Kanalai buvo robots.txt (RFC 9309), TDMRep (failas, HTTP antraštė, <meta>), Content-Signal, IETF taisyklė Content-Usage, noai ir llms.txt. URL užklausdavome tik ten, kur tai leido robots.txt.
Iš 1356 svetainių, kurias galėjome perskaityti visiškai, 99 iš 1356 (7,3 %), 95 % PI 6,0–8,8 %, pareiškia išlygą, kuri saisto robotą, kad ir koks būtų jo pavadinimas.
- 558 iš 1356 (41,2 %) šakniniu lygmeniu blokuoja bent vieną konkrečiu pavadinimu nurodytą DI robotą. Iš jų 480 iš 558 (86,0 %), PI 82,9–88,7 %, nepareiškia nieko, ką perskaitytų naujo pavadinimo robotas.
- 777 iš 1356 (57,3 %) jokiame mūsų perskaitytame kanale nepareiškia jokios išlygos.
- Tarp visų 1510 svetainių, kurios atsakė dėl
robots.txt, svetainių su agnostine (nuo roboto pavadinimo nepriklausančia) išlyga yra bent 110 iš 1510 (7,3 %). Blokuojančių konkrečius pavadinimus be agnostinės išlygos yra ne daugiau kaip 621 iš 699 (88,8 %). - Pagal šalių grupes svetainės su agnostine išlyga tarp visiškai perskaitytų svetainių: didelės šalys 74 iš 800 (9,2 %), vidutinės 15 iš 431 (3,5 %), mažos 10 iš 125 (8,0 %).
- Jautrumas mūsų pačių taisyklės pakeitimui (D5). Pagal prieš duomenų rinkimą įšaldytą prieigos taisyklę, be pakartotinio skenavimo D5, rezultatas yra 93 iš 1282 (7,3 %), PI 6,0–8,8 %, visiškai perskaitytų svetainių su agnostine išlyga ir 0 prieštaravimų.
Kanalai.
- TDMRep naudoja 71 iš 1356 (5,2 %), PI 4,2–6,6 %. 58 iš šių 71 jis yra tik antraštėje arba elemente
<meta>(meta 41, antraštė 22, failas 13). Jį naudoja 53 iš 192 visiškai perskaitytų Prancūzijos svetainių (27,6 %). - Content-Signal
ai-train=nonaudoja 18 svetainių. IETFtrain-ai=nnaudoja 0. - 17 svetainių siunčia
Content-Usage: ai=n. Tai draft-ietf-aipref-vocab-01 DI mokymo žyma; dabartinis projektas ją pašalino, todėl analizatoriai ją turi ignoruoti. Jei ji būtų laikoma išlyga dėl mokymo, agnostinė dalis padidėtų iki 116 iš 1356 (8,6 %). - Prieštaravimai: 2 prieštaravimai tarp 1356 pagal dabartinę taisyklę, 0 pagal įšaldytą taisyklę. Abi yra Corriere della Sera svetainės, kurios buvo perskaitytos tik pakartotinio skenavimo D5 metu. Kiekviena siunčia Content-Signal
ai-train=yeskartu su TDMRep išlyga<meta>elemente. - 218 iš 1510 (14,4 %) išlygą arba bendrą draudimą rašo
robots.txtkomentaruose, kuriuos RFC 9309 analizatorius atmeta.
Prieiga ir kur suklydome. 154 svetainėse perskaitėme tik robots.txt, nes sąmoningai konservatyvus detektorius jų komentarus žymi kaip bendrą automatizuotos prieigos draudimą. Tyrimas penkis kartus pažeidė savo paties prieigos taisyklę; kiekvienas pažeidimas deklaruotas, o jo duomenys ištrinti:
- D0: žvalgomasis bandymas.
- D1: 7 užklausos serveriui prieš jo
robots.txt. - D2: 245 užklausos 92 svetainėms.
- D4: 3 užklausos vienai svetainei.
- D7: 72 užklausos 24 svetainėms.
D7 užklausos buvo išsiųstos pakartotinio skenavimo (D5), atlikto po duomenų rinkimo, metu, po to, kai tyrimą koordinuojantis DI agentas pakeitė taisyklę, kas laikoma draudimu. Tyrimo instrukcijose 23 Mediahuis svetainių pranešimas buvo klaidingai priskirtas konkrečiam tikslui skirtiems pranešimams. Visai EasyxLab laboratorijai taikoma taisyklė (2026 m. spalio 3 d.) laiko robots.txt privalomu teisinio minimumo apimtimi. S16 sąmoningai laikosi griežtesnės taisyklės, nes jo tema – būtent šios išlygos.
Detektorių auditai (visus atliko DI agentai).
- Autoriaus paties imtis, detektoriai v1/v2: išlygų detektorius buvo teisus dėl 54 iš 54 pažymėtų atvejų; v2 draudimo detektorius – dėl 35 iš 62.
- Pirmasis nepriklausomas recenzentas, v1/v2, 44 kitos svetainės: draudimas teisingas dėl 15 iš 21 pažymėto atvejo ir rasta 15 iš 15; išlyga teisinga dėl 20 iš 20 pažymėtų atvejų ir rasta 20 iš 21.
- Pakartotinis recenzentas, v3, dar 43 svetainės: draudimas 15 iš 15 imtyje, bet atkūrimas (recall) apie 84 % (130 iš 154), įskaičiavus 24 D7 praleidimus; išlyga 15 iš 16.
- v4 keičia būtent šiuos du klaidų tipus. Neteigiama, kad v4 buvo audituotas.
Tiekėjai. 2026-10-03 galėjome perskaityti 8 iš 14 tiekėjų robotų dokumentaciją; visi 8 nurodo robots.txt. Nė vienas nenurodo TDMRep, Content-Signal, Content-Usage ar noai.
Rezultatai pagal svetainę nurodo, ką sako kiekvienos svetainės failai. Tai nėra svetainės vertinimas: pareiga tenka DI tiekėjams. Tikrinimo priemonė – scripts/optout_check.py <domain>, kuri gali tapti nemokamu įrankiu optout-lint.
Cituokite šį tyrimą
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}