EasyxLab
Nyelv: HU Magyar

Az angol eredeti mesterséges intelligenciával készült fordítása; a referenciaváltozat az angol eredeti. Olvasás angolul

Tanulmányok / S16

A szöveg- és adatbányászatra vonatkozó jogfenntartások az EU-27 sajtójában, csatornánként

Kifejeznek-e az uniós hírkiadók olyan, a szöveg- és adatbányászatra vonatkozó jogfenntartást, amelyet egy MI-robot a nevétől függetlenül el tud olvasni?

MunkaváltozatKözzétéve 2026-10-03

Összefoglaló

2025. augusztus 2. óta a mesterséges intelligenciáról szóló rendelet (Art. 53(1)(c)) előírja az általános célú MI-modellek szolgáltatói számára, hogy azonosítsák és betartsák a szöveg- és adatbányászatra vonatkozó jogfenntartásokat, amelyeket az (EU) 2019/790 irányelv Art. 4(3) rendelkezése szerint fejeztek ki, online tartalom esetében például „géppel olvasható módszerek révén”. Az ezen időpont előtt forgalomba hozott modelleknek 2027. augusztus 2-ig van határidejük (Art. 111(3)). A Bizottság 2026. augusztus 2-tól bírságot szabhat ki a szolgáltatókra.

Azt olvastuk be, amit egy robot el tud olvasni 1511 híroldalon 27 tagállamban: a Wikidatából vett napilapokon és híroldalakon, amelyek hosztja az adott ország Chrome UX Report-listájának első 100 000 helye között van, a hivatalos közlönyök kivételével. A csatornák a következők voltak: robots.txt (RFC 9309), TDMRep (fájl, HTTP-fejléc, <meta>), Content-Signal, az IETF Content-Usage szabálya, noai és llms.txt. Egy URL-t csak akkor kértünk le, ha a robots.txt megengedte.

Az 1356 webhelyen, amelyet teljes egészében be tudtunk olvasni, 1356-ból 99 (7,3%), 95%-os CI: 6,0–8,8%, fejez ki olyan jogfenntartást, amely egy robotra a nevétől függetlenül kötelező.

  • 1356-ból 558 (41,2%) gyökérszinten tilt legalább egy név szerint megnevezett MI-robotot. Közülük 558-ból 480 (86,0%), CI: 82,9–88,7%, semmit nem fejez ki, amit egy új nevű robot elolvasna.
  • 1356-ból 777 (57,3%) egyetlen általunk olvasott csatornán sem fejez ki jogfenntartást.
  • Az 1510 webhely egészén, amely válaszolt a robots.txt lekérésére, a névtől független jogfenntartással rendelkezők száma legalább 1510-ből 110 (7,3%). A robotokat név szerint tiltó, de névtől független jogfenntartás nélküli webhelyek száma legfeljebb 699-ből 621 (88,8%).
  • Országcsoportonként a névtől független jogfenntartás a teljes egészében beolvasott webhelyek között: nagy országok 800-ból 74 (9,2%), közepesek 431-ből 15 (3,5%), kicsik 125-ből 10 (8,0%).
  • Érzékenység a saját szabálymódosításunkra (D5). A gyűjtés előtt rögzített hozzáférési szabály szerint, a D5 újraszkennelés nélkül az eredmény 1282 teljes egészében beolvasott webhelyből 93 (7,3%), CI: 6,0–8,8%, névtől független jogfenntartással, és 0 ellentmondás.

Csatornák.

  • A TDMRep 1356-ból 71 webhelyen szerepel (5,2%), CI: 4,2–6,6%. A 71 közül 58-nál csak fejlécben vagy <meta> elemben található (meta 41, fejléc 22, fájl 13). A 192 teljes egészében beolvasott francia webhely közül 53 (27,6%) használja.
  • A Content-Signal ai-train=no 18 webhelyen jelenik meg. Az IETF train-ai=n jelzése 0 webhelyen.
  • 17 webhely küld Content-Usage: ai=n jelzést. Ez a draft-ietf-aipref-vocab-01 MI-tanításra vonatkozó címkéje; a jelenlegi tervezet elhagyta, ezért az elemzőknek figyelmen kívül kell hagyniuk. Ha tanításra vonatkozó jogfenntartásként olvasnánk, a névtől független jogfenntartások aránya 1356-ból 116-ra (8,6%) nőne.
  • Ellentmondások: a jelenlegi szabály szerint 2 ellentmondás az 1356 között, a rögzített szabály szerint 0. Mindkettő a Corriere della Sera egy-egy webhelye; ezeket csak a D5 újraszkenneléskor olvastuk be. Mindegyik Content-Signal ai-train=yes jelzést küld egy <meta> elemben megadott TDMRep-jogfenntartással együtt.
  • 1510-ből 218 (14,4%) a robots.txt megjegyzéseibe írja a jogfenntartást vagy az általános tilalmat, amelyeket egy RFC 9309 szerinti elemző elvet.

Hozzáférés, és amit elrontottunk. 154 webhelynél csak a robots.txt fájlt olvastuk be, mert egy szándékosan óvatos detektor a megjegyzéseiket az automatizált hozzáférés általános tilalmának minősíti. A tanulmány ötször szegte meg a saját hozzáférési szabályát; minden szabályszegést nyilvánosságra hoztunk, és a hozzá tartozó adatokat töröltük:

  • D0: a felderítő kísérleti szakasz.
  • D1: 7 kérés egy hoszthoz, mielőtt lekértük volna a robots.txt fájlját.
  • D2: 245 kérés 92 webhelyhez.
  • D4: 3 kérés egy webhelyhez.
  • D7: 72 kérés 24 webhelyhez.

A D7-kéréseket a gyűjtés után végzett újraszkennelés (D5) során küldtük, miután a tanulmányt koordináló MI-ágens megváltoztatta azt a szabályt, hogy mi számít tilalomnak. A tanulmány utasításai tévesen célspecifikusnak minősítették a 23 Mediahuis-webhely közleményét. Az EasyxLab egész laborra érvényes szabálya (2026. október 3.) a robots.txt fájlt a törvényes minimum szerint kezeli kötelezőként. Az S16 szándékosan szigorúbb szabályt tart meg, mert ezek a jogfenntartások a tárgya.

A detektorok ellenőrzései (mindegyiket MI-ágensek végezték).

  • A szerző saját mintája, v1/v2 detektorok: a jogfenntartás-detektor 54 jelzéséből 54 helyes volt; a v2 tilalomdetektor 62 jelzéséből 35.
  • Első független ellenőr, v1/v2, 44 másik webhely: tilalom – 21 jelzésből 15 helyes, és 15-ből 15-öt megtalált; jogfenntartás – 20 jelzésből 20 helyes, és 21-ből 20-at megtalált.
  • Újraellenőr, v3, további 43 webhely: tilalom a mintában 15-ből 15, de a D7 24 kihagyott esetét is beszámítva a felidézés (recall) kb. 84% (154-ből 130); jogfenntartás 16-ból 15.
  • A v4 pontosan ezt a két hibatípust változtatja meg. A v4 ellenőrzéséről nem teszünk állítást.

Szolgáltatók. 2026. október 3-án 14 szolgáltató közül 8 robot-dokumentációját tudtuk elolvasni; mind a 8 említi a robots.txt-t. Egyik sem említi a TDMRep, a Content-Signal, a Content-Usage vagy a noai megoldást.

A webhelyenkénti eredmények azt mutatják, mit mondanak az egyes webhelyek fájljai. Nem a webhely értékelését jelentik: a kötelezettség az MI-szolgáltatókat terheli. Az ellenőrző eszköz a scripts/optout_check.py <domain>, amelyből az ingyenes optout-lint eszköz válhat.

Hivatkozás erre a tanulmányra

Hivatkozás
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations
BibTeX
@techreport{easyxlab_s16,
  title       = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S16},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}