Tutkimukset / S16
Oikeuksien pidättäminen tekstin- ja tiedonlouhintaan EU-27:n lehdistössä kanava kanavalta
Ilmaisevatko EU:n uutisjulkaisijat tekstin- ja tiedonlouhintaa koskevia oikeuksien pidättämisiä, jotka tekoälyrobotti voi lukea nimestään riippumatta?
Tiivistelmä
Tekoälysäädös (Art. 53(1)(c)) on 2. elokuuta 2025 alkaen velvoittanut yleiskäyttöisten tekoälymallien tarjoajat tunnistamaan ja noudattamaan tekstin- ja tiedonlouhintaa koskevaa oikeuksien pidättämistä, joka on ilmaistu direktiivin (EU) 2019/790 Art. 4(3):n mukaisesti, verkossa olevan sisällön osalta ”kuten koneluettavilla keinoilla”. Ennen tätä päivää markkinoille saatetuilla malleilla on aikaa 2. elokuuta 2027 asti (Art. 111(3)). Komissio voi määrätä tarjoajille sakkoja 2. elokuuta 2026 alkaen.
Luimme sen, minkä hakurobotti voi lukea 1 511 uutissivustolla 27 jäsenvaltiossa: Wikidatasta poimitut sanomalehdet ja uutissivustot, joiden isäntä kuuluu oman maansa Chrome UX Report -listan 100 000 ensimmäisen joukkoon, virallisia lehtiä lukuun ottamatta. Kanavat olivat robots.txt (RFC 9309), TDMRep (tiedosto, HTTP-otsake, <meta>), Content-Signal, IETF:n Content-Usage-sääntö, noai ja llms.txt. Pyysimme URL-osoitetta vain, jos robots.txt salli sen.
Niistä 1 356 sivustosta, jotka pystyimme lukemaan kokonaan, 99 sivustoa 1 356:sta (7,3 %), 95 %:n LV 6,0–8,8 %, ilmaisee oikeuksien pidättämisen, joka sitoo hakurobottia sen nimestä riippumatta.
- 558 sivustoa 1 356:sta (41,2 %) estää juuritasolla vähintään yhden nimeltä mainitun tekoälyrobotin. Niistä 480 sivustoa 558:sta (86,0 %), LV 82,9–88,7 %, ei ilmaise mitään, minkä uudella nimellä toimiva hakurobotti lukisi.
- 777 sivustoa 1 356:sta (57,3 %) ei ilmaise oikeuksien pidättämistä missään lukemassamme kanavassa.
- Kaikista 1 510 sivustosta, jotka vastasivat
robots.txt-pyyntöön, nimestä riippumattoman pidättämisen ilmaisee vähintään 110 sivustoa 1 510:stä (7,3 %). Nimeltä estäviä sivustoja, joilla ei ole nimestä riippumatonta pidättämistä, on enintään 621 sivustoa 699:stä (88,8 %). - Maaryhmittäin nimestä riippumaton pidättäminen kokonaan luetuilla sivustoilla: suuret maat 74 sivustoa 800:sta (9,2 %), keskikokoiset 15 sivustoa 431:stä (3,5 %), pienet 10 sivustoa 125:stä (8,0 %).
- Herkkyys omalle sääntömuutoksellemme (D5). Ennen keruuta jäädytetyn pääsysäännön mukaan, ilman D5-uudelleenskannausta, tulos on 93 kokonaan luettua sivustoa 1 282:sta (7,3 %), LV 6,0–8,8 %, joilla on nimestä riippumaton pidättäminen, ja 0 ristiriitaa.
Kanavat.
- TDMRep on käytössä 71 sivustolla 1 356:sta (5,2 %), LV 4,2–6,6 %. Näistä 71 sivustosta 58:lla se on vain otsakkeessa tai
<meta>-elementissä (meta 41, otsake 22, tiedosto 13). Sitä käyttää 53 kokonaan luettua ranskalaista sivustoa 192:sta (27,6 %). - Content-Signal
ai-train=noesiintyy 18 sivustolla. IETF:ntrain-ai=nesiintyy 0 sivustolla. - 17 sivustoa lähettää
Content-Usage: ai=n. Se on luonnoksen draft-ietf-aipref-vocab-01 tekoälykoulutuksen merkintä; nykyinen luonnos poisti sen, joten jäsentimien on jätettävä se huomiotta. Koulutusta koskevana pidättämisenä luettuna se nostaisi nimestä riippumattomien pidättämisten osuuden 116 sivustoon 1 356:sta (8,6 %). - Ristiriidat: nykyisellä säännöllä 2 ristiriitaa 1 356 sivuston joukossa, jäädytetyllä säännöllä 0. Molemmat ovat Corriere della Seran sivustoja, jotka luettiin vain D5-uudelleenskannauksessa. Kumpikin lähettää Content-Signal-arvon
ai-train=yesyhdessä<meta>-elementissä olevan TDMRep-pidättämisen kanssa. - 218 sivustoa 1 510:stä (14,4 %) kirjoittaa oikeuksien pidättämisen tai yleisen kiellon
robots.txt-tiedoston kommentteihin, jotka RFC 9309:n mukainen jäsennin hylkää.
Pääsy ja mitä teimme väärin. 154 sivustolta luimme vain robots.txt-tiedoston, koska tarkoituksella varovaiseksi tehty tunnistin luokittelee niiden kommentit automatisoidun pääsyn yleiseksi kielloksi. Tutkimus rikkoi omaa pääsysääntöään viisi kertaa; jokainen rikkomus on ilmoitettu ja sen tiedot poistettu:
- D0: tunnusteleva pilotti.
- D1: 7 pyyntöä isännälle ennen sen
robots.txt-tiedoston hakemista. - D2: 245 pyyntöä 92 sivustolle.
- D4: 3 pyyntöä yhdelle sivustolle.
- D7: 72 pyyntöä 24 sivustolle.
D7-pyynnöt lähetettiin keruun jälkeen tehdyssä uudelleenskannauksessa (D5) sen jälkeen, kun tutkimusta koordinoiva tekoälyagentti oli muuttanut sääntöä siitä, mikä lasketaan kielloksi. Tutkimuksen ohjeet luokittelivat virheellisesti 23 Mediahuis-sivuston ilmoituksen käyttötarkoituskohtaiseksi. EasyxLabin koko laboratoriota koskeva sääntö (3. lokakuuta 2026) pitää robots.txt-tiedostoa sitovana lain edellyttämän vähimmäistason mukaisesti. S16 noudattaa tarkoituksella tiukempaa sääntöä, koska sen aiheena ovat nämä oikeuksien pidättämiset.
Tunnistimien tarkastukset (kaikki tekoälyagenttien tekemiä).
- Tekijän oma otos, tunnistimet v1/v2: pidättämisen tunnistin oli oikeassa 54 merkinnässä 54:stä; kiellon tunnistin v2 oli oikeassa 35 merkinnässä 62:sta.
- Ensimmäinen riippumaton tarkastaja, v1/v2, 44 muuta sivustoa: kielto oikein 15 merkinnässä 21:stä ja 15 tapausta 15:stä löydetty; pidättäminen oikein 20 merkinnässä 20:stä ja 20 tapausta 21:stä löydetty.
- Uusintatarkastaja, v3, 43 muuta sivustoa: kielto 15 tapausta 15:stä otoksessa, mutta kattavuus (recall) noin 84 % (130 tapausta 154:stä), kun D7:n 24 huomaamatta jäänyttä tapausta lasketaan mukaan; pidättäminen 15 tapausta 16:sta.
- v4 muuttaa juuri nämä kaksi virhetyyppiä. v4:stä ei väitetä tehdyn tarkastusta.
Tarjoajat. Pystyimme 3. lokakuuta 2026 lukemaan hakurobottien dokumentaation 8 tarjoajalta 14:stä; kaikki 8 mainitsevat robots.txt-tiedoston. Yksikään ei mainitse seuraavia: TDMRep, Content-Signal, Content-Usage tai noai.
Sivustokohtaiset tulokset kertovat, mitä kunkin sivuston tiedostot sanovat. Ne eivät ole sivuston arviointi: velvoite on tekoälyn tarjoajilla. Tarkistin on scripts/optout_check.py <domain>, josta voi tulla maksuton optout-lint-työkalu.
Viittaa tähän tutkimukseen
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}