Tanulmányok / S16
A szöveg- és adatbányászatra vonatkozó jogfenntartások az EU-27 sajtójában, csatornánként
Kifejeznek-e az uniós hírkiadók olyan, a szöveg- és adatbányászatra vonatkozó jogfenntartást, amelyet egy MI-robot a nevétől függetlenül el tud olvasni?
Összefoglaló
2025. augusztus 2. óta a mesterséges intelligenciáról szóló rendelet (Art. 53(1)(c)) előírja az általános célú MI-modellek szolgáltatói számára, hogy azonosítsák és betartsák a szöveg- és adatbányászatra vonatkozó jogfenntartásokat, amelyeket az (EU) 2019/790 irányelv Art. 4(3) rendelkezése szerint fejeztek ki, online tartalom esetében például „géppel olvasható módszerek révén”. Az ezen időpont előtt forgalomba hozott modelleknek 2027. augusztus 2-ig van határidejük (Art. 111(3)). A Bizottság 2026. augusztus 2-tól bírságot szabhat ki a szolgáltatókra.
Azt olvastuk be, amit egy robot el tud olvasni 1511 híroldalon 27 tagállamban: a Wikidatából vett napilapokon és híroldalakon, amelyek hosztja az adott ország Chrome UX Report-listájának első 100 000 helye között van, a hivatalos közlönyök kivételével. A csatornák a következők voltak: robots.txt (RFC 9309), TDMRep (fájl, HTTP-fejléc, <meta>), Content-Signal, az IETF Content-Usage szabálya, noai és llms.txt. Egy URL-t csak akkor kértünk le, ha a robots.txt megengedte.
Az 1356 webhelyen, amelyet teljes egészében be tudtunk olvasni, 1356-ból 99 (7,3%), 95%-os CI: 6,0–8,8%, fejez ki olyan jogfenntartást, amely egy robotra a nevétől függetlenül kötelező.
- 1356-ból 558 (41,2%) gyökérszinten tilt legalább egy név szerint megnevezett MI-robotot. Közülük 558-ból 480 (86,0%), CI: 82,9–88,7%, semmit nem fejez ki, amit egy új nevű robot elolvasna.
- 1356-ból 777 (57,3%) egyetlen általunk olvasott csatornán sem fejez ki jogfenntartást.
- Az 1510 webhely egészén, amely válaszolt a
robots.txtlekérésére, a névtől független jogfenntartással rendelkezők száma legalább 1510-ből 110 (7,3%). A robotokat név szerint tiltó, de névtől független jogfenntartás nélküli webhelyek száma legfeljebb 699-ből 621 (88,8%). - Országcsoportonként a névtől független jogfenntartás a teljes egészében beolvasott webhelyek között: nagy országok 800-ból 74 (9,2%), közepesek 431-ből 15 (3,5%), kicsik 125-ből 10 (8,0%).
- Érzékenység a saját szabálymódosításunkra (D5). A gyűjtés előtt rögzített hozzáférési szabály szerint, a D5 újraszkennelés nélkül az eredmény 1282 teljes egészében beolvasott webhelyből 93 (7,3%), CI: 6,0–8,8%, névtől független jogfenntartással, és 0 ellentmondás.
Csatornák.
- A TDMRep 1356-ból 71 webhelyen szerepel (5,2%), CI: 4,2–6,6%. A 71 közül 58-nál csak fejlécben vagy
<meta>elemben található (meta 41, fejléc 22, fájl 13). A 192 teljes egészében beolvasott francia webhely közül 53 (27,6%) használja. - A Content-Signal
ai-train=no18 webhelyen jelenik meg. Az IETFtrain-ai=njelzése 0 webhelyen. - 17 webhely küld
Content-Usage: ai=njelzést. Ez a draft-ietf-aipref-vocab-01 MI-tanításra vonatkozó címkéje; a jelenlegi tervezet elhagyta, ezért az elemzőknek figyelmen kívül kell hagyniuk. Ha tanításra vonatkozó jogfenntartásként olvasnánk, a névtől független jogfenntartások aránya 1356-ból 116-ra (8,6%) nőne. - Ellentmondások: a jelenlegi szabály szerint 2 ellentmondás az 1356 között, a rögzített szabály szerint 0. Mindkettő a Corriere della Sera egy-egy webhelye; ezeket csak a D5 újraszkenneléskor olvastuk be. Mindegyik Content-Signal
ai-train=yesjelzést küld egy<meta>elemben megadott TDMRep-jogfenntartással együtt. - 1510-ből 218 (14,4%) a
robots.txtmegjegyzéseibe írja a jogfenntartást vagy az általános tilalmat, amelyeket egy RFC 9309 szerinti elemző elvet.
Hozzáférés, és amit elrontottunk. 154 webhelynél csak a robots.txt fájlt olvastuk be, mert egy szándékosan óvatos detektor a megjegyzéseiket az automatizált hozzáférés általános tilalmának minősíti. A tanulmány ötször szegte meg a saját hozzáférési szabályát; minden szabályszegést nyilvánosságra hoztunk, és a hozzá tartozó adatokat töröltük:
- D0: a felderítő kísérleti szakasz.
- D1: 7 kérés egy hoszthoz, mielőtt lekértük volna a
robots.txtfájlját. - D2: 245 kérés 92 webhelyhez.
- D4: 3 kérés egy webhelyhez.
- D7: 72 kérés 24 webhelyhez.
A D7-kéréseket a gyűjtés után végzett újraszkennelés (D5) során küldtük, miután a tanulmányt koordináló MI-ágens megváltoztatta azt a szabályt, hogy mi számít tilalomnak. A tanulmány utasításai tévesen célspecifikusnak minősítették a 23 Mediahuis-webhely közleményét. Az EasyxLab egész laborra érvényes szabálya (2026. október 3.) a robots.txt fájlt a törvényes minimum szerint kezeli kötelezőként. Az S16 szándékosan szigorúbb szabályt tart meg, mert ezek a jogfenntartások a tárgya.
A detektorok ellenőrzései (mindegyiket MI-ágensek végezték).
- A szerző saját mintája, v1/v2 detektorok: a jogfenntartás-detektor 54 jelzéséből 54 helyes volt; a v2 tilalomdetektor 62 jelzéséből 35.
- Első független ellenőr, v1/v2, 44 másik webhely: tilalom – 21 jelzésből 15 helyes, és 15-ből 15-öt megtalált; jogfenntartás – 20 jelzésből 20 helyes, és 21-ből 20-at megtalált.
- Újraellenőr, v3, további 43 webhely: tilalom a mintában 15-ből 15, de a D7 24 kihagyott esetét is beszámítva a felidézés (recall) kb. 84% (154-ből 130); jogfenntartás 16-ból 15.
- A v4 pontosan ezt a két hibatípust változtatja meg. A v4 ellenőrzéséről nem teszünk állítást.
Szolgáltatók. 2026. október 3-án 14 szolgáltató közül 8 robot-dokumentációját tudtuk elolvasni; mind a 8 említi a robots.txt-t. Egyik sem említi a TDMRep, a Content-Signal, a Content-Usage vagy a noai megoldást.
A webhelyenkénti eredmények azt mutatják, mit mondanak az egyes webhelyek fájljai. Nem a webhely értékelését jelentik: a kötelezettség az MI-szolgáltatókat terheli. Az ellenőrző eszköz a scripts/optout_check.py <domain>, amelyből az ingyenes optout-lint eszköz válhat.
Hivatkozás erre a tanulmányra
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}