EasyxLab
Språk: SV Svenska

AI-översättning av det engelska originalet, som är referensversionen. Läs på engelska

Studier / S16

Förbehåll mot text- och datautvinning i pressen i EU-27, kanal för kanal

Uttrycker nyhetsutgivare i EU förbehåll mot text- och datautvinning som en AI-crawler kan läsa, oavsett vad den heter?

ArbetsutkastPublicerad 2026-10-03

Sammanfattning

Sedan den 2 augusti 2025 kräver förordningen om artificiell intelligens (Art. 53(1)(c)) att leverantörer av AI-modeller för allmänna ändamål identifierar och efterlever förbehåll mot text- och datautvinning som uttryckts enligt Art. 4(3) i direktiv (EU) 2019/790, ”exempelvis maskinläsbara metoder” i fråga om innehåll online. Modeller som släppts ut på marknaden före det datumet har till den 2 augusti 2027 på sig (Art. 111(3)). Kommissionen kan påföra leverantörer sanktionsavgifter från och med den 2 augusti 2026.

Vi läste det som en crawler kan läsa på 1 511 nyhetswebbplatser i 27 medlemsstater: tidningar och nyhetssajter från Wikidata vars värd finns bland de 100 000 första i Chrome UX Report-listan för deras land, med undantag för officiella kungörelsetidningar. Kanalerna var robots.txt (RFC 9309), TDMRep (fil, HTTP-huvud, <meta>), Content-Signal, IETF-regeln Content-Usage, noai och llms.txt. Vi begärde en URL bara där robots.txt tillät det.

Av de 1 356 webbplatser som vi kunde läsa i sin helhet uttrycker 99 av 1 356 (7,3 %), 95 % KI 6,0–8,8 %, ett förbehåll som binder en crawler oavsett vad den heter.

  • 558 av 1 356 (41,2 %) blockerar minst en namngiven AI-crawler på rotnivå. Av dem uttrycker 480 av 558 (86,0 %), KI 82,9–88,7 %, inget som en crawler med ett nytt namn skulle läsa.
  • 777 av 1 356 (57,3 %) uttrycker inget förbehåll i någon av de kanaler vi läste.
  • Bland alla 1 510 webbplatser som svarade på begäran om robots.txt är de med ett namnoberoende förbehåll minst 110 av 1 510 (7,3 %). De som blockerar crawlers med namn utan ett namnoberoende förbehåll är högst 621 av 699 (88,8 %).
  • Per landgrupp, namnoberoende förbehåll bland de webbplatser som lästes i sin helhet: stora länder 74 av 800 (9,2 %), medelstora 15 av 431 (3,5 %), små 10 av 125 (8,0 %).
  • Känslighet för vår egen regeländring (D5). Med den åtkomstregel som frystes före insamlingen, utan omskanningen D5, blir resultatet 93 av 1 282 webbplatser som lästes i sin helhet (7,3 %), KI 6,0–8,8 %, med ett namnoberoende förbehåll, och 0 motsägelser.

Kanaler.

  • TDMRep finns på 71 av 1 356 (5,2 %), KI 4,2–6,6 %. På 58 av de 71 finns det bara i ett huvud eller ett <meta>-element (meta 41, huvud 22, fil 13). 53 av 192 franska webbplatser som lästes i sin helhet (27,6 %) använder det.
  • Content-Signal ai-train=no förekommer på 18 webbplatser. IETF:s train-ai=n förekommer på 0.
  • 17 webbplatser skickar Content-Usage: ai=n. Det är etiketten för AI-träning i draft-ietf-aipref-vocab-01; det aktuella utkastet har strukit den, så parsrar måste ignorera den. Läst som ett förbehåll mot träning skulle den höja andelen namnoberoende förbehåll till 116 av 1 356 (8,6 %).
  • Motsägelser: 2 motsägelser bland de 1 356 enligt den nuvarande regeln, 0 enligt den frysta regeln. Båda är webbplatser för Corriere della Sera, som bara lästes vid omskanningen D5. Var och en skickar Content-Signal ai-train=yes tillsammans med ett TDMRep-förbehåll i ett <meta>-element.
  • 218 av 1 510 (14,4 %) skriver ett förbehåll eller ett allmänt förbud i kommentarer i robots.txt, som en parser enligt RFC 9309 kastar bort.

Åtkomst, och vad vi gjorde fel. För 154 webbplatser läste vi bara robots.txt, eftersom en avsiktligt försiktig detektor klassar deras kommentarer som ett allmänt förbud mot automatiserad åtkomst. Studien bröt fem gånger mot sin egen åtkomstregel; varje överträdelse redovisas och dess data har raderats:

  • D0: den utforskande pilotstudien.
  • D1: 7 begäranden till en värd innan dess robots.txt hade hämtats.
  • D2: 245 begäranden till 92 webbplatser.
  • D4: 3 begäranden till en webbplats.
  • D7: 72 begäranden till 24 webbplatser.

D7-begärandena skickades vid en omskanning (D5) som gjordes efter insamlingen, sedan studiens samordnande AI-agent hade ändrat regeln för vad som räknas som förbud. Studiens instruktioner klassade felaktigt meddelandet på de 23 Mediahuis-webbplatserna som ändamålsspecifikt. EasyxLabs regel för hela labbet (3 oktober 2026) behandlar robots.txt som bindande på den lagstadgade miniminivån. S16 behåller avsiktligt en strängare regel, eftersom studien handlar om dessa förbehåll.

Granskningar av detektorerna (alla gjorda av AI-agenter).

  • Författarens eget urval, detektorer v1/v2: förbehållsdetektorn hade rätt i 54 av 54 flaggningar; förbudsdetektorn v2 hade rätt i 35 av 62.
  • Första oberoende granskare, v1/v2, 44 andra webbplatser: förbud rätt i 15 av 21 flaggningar och 15 av 15 hittade; förbehåll rätt i 20 av 20 flaggningar och 20 av 21 hittade.
  • Omgranskare, v3, ytterligare 43 webbplatser: förbud 15 av 15 i urvalet, men en täckning (recall) på omkring 84 % (130 av 154) när de 24 missarna i D7 räknas in; förbehåll 15 av 16.
  • v4 ändrar exakt de två felmoderna. Vi gör inte anspråk på någon granskning av v4.

Leverantörer. Den 3 oktober 2026 kunde vi läsa crawlerdokumentationen från 8 av 14 leverantörer; alla 8 nämner robots.txt. Ingen nämner TDMRep, Content-Signal, Content-Usage eller noai.

Resultaten per webbplats anger vad varje webbplats filer säger. De är ingen bedömning av webbplatsen: skyldigheten ligger på AI-leverantörerna. Kontrollverktyget är scripts/optout_check.py <domain>, som kan bli det kostnadsfria verktyget optout-lint.

Citera den här studien

Referens
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations
BibTeX
@techreport{easyxlab_s16,
  title       = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S16},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}