EasyxLab
Hizkuntza: EU Euskara

Jatorrizko ingelesezko testuaren AA bidezko itzulpena; ingelesezko bertsioa da erreferentziazkoa. Irakurri ingelesez

Azterlanak / S16

Testu- eta datu-meatzaritzari buruzko erreserbak EB-27ko prentsan, kanalez kanal

EBko albiste-argitaratzaileek adierazten al dute AA arakatzaile batek irakur dezakeen testu- eta datu-meatzaritzari buruzko erreserbarik, haren izena edozein dela ere?

Lan-zirriborroaArgitaratua 2026-10-03

Laburpena

2025eko abuztuaren 2tik, EBko Adimen Artifizialari buruzko Erregelamenduak (Art. 53(1)(c)) eskatzen die helburu orokorreko AA ereduen hornitzaileei (EB) 2019/790 Zuzentarauaren Art. 4(3)ren arabera adierazitako testu- eta datu-meatzaritzari buruzko erreserbak identifikatu eta errespetatzea, linean dagoen edukiaren kasuan «makinek irakurtzeko moduko bitartekoen bidez, adibidez». Data hori baino lehen merkaturatutako ereduek 2027ko abuztuaren 2ra arte dute epea (Art. 111(3)). Batzordeak 2026ko abuztuaren 2tik aurrera isunak jar diezazkieke hornitzaileei.

Arakatzaile batek irakur dezakeena irakurri genuen 27 estatu kidetako 1.511 albiste-webgunetan: Wikidatako egunkariak eta albiste-webguneak, zeinen ostalaria bere herrialdeko Chrome UX Report zerrendako lehen 100.000en artean dagoen; aldizkari ofizialak kanpoan utzi ziren. Kanalak hauek izan ziren: robots.txt (RFC 9309), TDMRep (fitxategia, HTTP goiburua, <meta>), Content-Signal, IETFren Content-Usage araua, noai eta llms.txt. URL bat robots.txt fitxategiak baimentzen zuenean soilik eskatu genuen.

Osorik irakurri ahal izan genituen webguneetan, 1.356tik 99k (%7,3; %95eko konfiantza-tartea: %6,0–8,8) arakatzaile bat lotzen duen erreserba bat adierazten dute, haren izena edozein dela ere.

  • 1.356tik 558k (%41,2) gutxienez izendun AA arakatzaile bat blokeatzen dute erroan. Horietatik, 558tik 480k (%86,0; konfiantza-tartea: %82,9–88,7) ez dute adierazten izen berria duen arakatzaile batek irakurriko lukeen ezer.
  • 1.356tik 777k (%57,3) ez dute erreserbarik adierazten irakurri genuen ezein kanaletan.
  • robots.txt eskaerari erantzun zioten 1.510 webgune guztien artean, izenarekiko agnostikoen kopurua gutxienez 1.510etik 110 da (%7,3). Erreserba agnostikorik gabeko izendun blokeatzaileak gehienez 699tik 621 dira (%88,8).
  • Herrialde-tartearen arabera, agnostikoak osorik irakurritako webguneen artean: herrialde handiak 800etik 74 (%9,2), ertainak 431tik 15 (%3,5), txikiak 125etik 10 (%8,0).
  • Gure arau-aldaketarekiko sentikortasuna (D5). Bilketaren aurretik izoztutako sarbide-arauaren arabera, D5 berreskaneatzerik gabe, emaitza hau da: osorik irakurritako 1.282 webguneetatik 93k (%7,3; konfiantza-tartea: %6,0–8,8) erreserba agnostiko bat dute, eta 0 kontraesan daude.

Kanalak.

  • TDMRep 1.356tik 71 webgunetan dago (%5,2; konfiantza-tartea: %4,2–6,6). 71 horietatik 58tan goiburu batean edo <meta> elementu batean bakarrik dago (meta 41, goiburua 22, fitxategia 13). Osorik irakurritako 192 webgune frantsesetatik 53k (%27,6) erabiltzen dute.
  • Content-Signal ai-train=no 18 webgunetan agertzen da. IETFren train-ai=n 0 webgunetan agertzen da.
  • 17 webgunek Content-Usage: ai=n bidaltzen dute. Hori draft-ietf-aipref-vocab-01 zirriborroko AA entrenamenduaren etiketa da; egungo zirriborroak kendu egin du, eta, beraz, analizatzaileek ez diote kasurik egin behar. Entrenamenduari buruzko erreserba gisa irakurrita, proportzio agnostikoa 1.356tik 116ra igoko litzateke (%8,6).
  • Kontraesanak: 1.356en artean 2 kontraesan egungo arauaren arabera, 0 arau izoztuaren arabera. Biak Corriere della Serako webguneak dira, eta D5 berreskaneatzean soilik irakurri ziren. Bakoitzak Content-Signal ai-train=yes bidaltzen du TDMRep <meta> erreserba batekin batera.
  • 1.510etik 218k (%14,4) erreserba bat edo debeku orokor bat idazten dute robots.txt fitxategiaren iruzkinetan, eta RFC 9309 analizatzaile batek baztertu egiten ditu iruzkin horiek.

Sarbidea, eta zer egin genuen gaizki. 154 webgunetan robots.txt bakarrik irakurri genuen, nahita kontserbadorea den detektagailu batek haien iruzkinak sarbide automatizatuaren debeku orokortzat markatzen dituelako. Azterketak bost aldiz hautsi zuen bere sarbide-araua; urraketa bakoitza adierazita dago eta haren datuak ezabatuta daude:

  • D0: esplorazio-pilotua.
  • D1: 7 eskaera ostalari bati, haren robots.txt irakurri aurretik.
  • D2: 245 eskaera 92 webguneri.
  • D4: 3 eskaera webgune bati.
  • D7: 72 eskaera 24 webguneri.

D7 eskaerak bilketaren ondoren egindako berreskaneatze batean (D5) bidali ziren, azterketa koordinatzen zuen AA agenteak debekutzat zer hartzen den zehazten duen araua aldatu ondoren. Azterketaren jarraibideek oker sailkatu zuten 23 Mediahuis webguneen oharra, helburu jakin baterakoa balitz bezala. EasyxLab-en laborategi osorako arauak (2026ko urriaren 3koa) robots.txt lotesletzat hartzen du legeak eskatzen duen gutxieneko neurrian. S16k nahita arau zorrotzagoa mantentzen du, haren gaia erreserba horiek baitira.

Detektagailuen auditoriak (guztiak AA agenteek eginak).

  • Egilearen lagina, v1/v2 detektagailuak: erreserba-detektagailuak 54 markatik 54tan asmatu zuen; v2 debeku-detektagailuak 62tik 35etan.
  • Lehen berrikusle independentea, v1/v2, beste 44 webgune: debekuak 21 markatik 15etan asmatu zuen, eta 15etik 15 aurkitu zituen; erreserbak 20 markatik 20tan asmatu zuen, eta 21etik 20 aurkitu zituen.
  • Bigarren berrikuslea, v3, beste 43 webgune: debekua 15etik 15 laginean, baina %84 inguruko estaldura (recall) (154tik 130) D7ko 24 hutsegiteak zenbatuta; erreserba 16tik 15.
  • v4k zehazki bi hutsegite-modu horiek aldatzen ditu. Ez da v4ren auditoriarik aldarrikatzen.

Hornitzaileak. 2026ko urriaren 3an, 14 hornitzailetatik 8ren arakatzaile-dokumentazioa irakurri ahal izan genuen; 8ek robots.txt aipatzen dute. Batek ere ez ditu aipatzen TDMRep, Content-Signal, Content-Usage edo noai.

Webgune bakoitzeko emaitzek webgune bakoitzaren fitxategiek zer dioten adierazten dute. Ez dira webgunearen ebaluazio bat: betebeharra AA hornitzaileena da. Egiaztatzailea scripts/optout_check.py <domain> da, eta optout-lint doako tresna bihur daiteke.

Aipatu azterlan hau

Aipamena
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations
BibTeX
@techreport{easyxlab_s16,
  title       = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S16},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}