EasyxLab
Sprache: DE Deutsch

KI-Übersetzung des englischen Originals, das die maßgebliche Fassung ist. Auf Englisch lesen

Studien / S16

Nutzungsvorbehalte für Text und Data Mining in der Presse der EU-27, Kanal für Kanal

Erklären Nachrichtenverlage in der EU Nutzungsvorbehalte für Text und Data Mining, die ein KI-Crawler lesen kann, unabhängig von seinem Namen?

ArbeitsentwurfVeröffentlicht 2026-10-03

Zusammenfassung

Seit dem 2. August 2025 verpflichtet die Verordnung über künstliche Intelligenz (Art. 53(1)(c)) Anbieter von KI-Modellen mit allgemeinem Verwendungszweck, die nach Art. 4(3) der Richtlinie (EU) 2019/790 geltend gemachten Nutzungsvorbehalte für Text und Data Mining zu ermitteln und einzuhalten, bei Online-Inhalten „etwa mit maschinenlesbaren Mitteln“. Für Modelle, die vor diesem Datum in Verkehr gebracht wurden, gilt eine Frist bis zum 2. August 2027 (Art. 111(3)). Die Kommission kann ab dem 2. August 2026 Geldbußen gegen Anbieter verhängen.

Wir haben gelesen, was ein Crawler auf 1.511 Nachrichten-Websites in 27 Mitgliedstaaten lesen kann: Zeitungen und Nachrichtenseiten aus Wikidata, deren Host in der Liste des Chrome UX Report für ihr Land unter den ersten 100.000 liegt, ohne Amtsblätter. Die Kanäle waren robots.txt (RFC 9309), TDMRep (Datei, HTTP-Header, <meta>), Content-Signal, die IETF-Regel Content-Usage, noai und llms.txt. Wir haben eine URL nur abgerufen, wenn robots.txt es erlaubte.

Von den 1.356 Websites, die wir vollständig lesen konnten, erklären 99 von 1.356 (7,3 %), 95-%-Konfidenzintervall 6,0–8,8 %, einen Vorbehalt, der einen Crawler unabhängig von seinem Namen bindet.

  • 558 von 1.356 (41,2 %) sperren mindestens einen namentlich genannten KI-Crawler auf Root-Ebene. Davon erklären 480 von 558 (86,0 %), Konfidenzintervall 82,9–88,7 %, nichts, was ein Crawler mit neuem Namen lesen würde.
  • 777 von 1.356 (57,3 %) erklären in keinem der von uns gelesenen Kanäle einen Vorbehalt.
  • Über alle 1.510 Websites, die auf die Abfrage von robots.txt antworteten, haben mindestens 110 von 1.510 (7,3 %) einen namensunabhängigen Vorbehalt. Websites, die Crawler namentlich sperren, ohne einen namensunabhängigen Vorbehalt zu erklären, sind höchstens 621 von 699 (88,8 %).
  • Nach Ländergruppe, namensunabhängige Vorbehalte unter den vollständig gelesenen Websites: große Länder 74 von 800 (9,2 %), mittlere 15 von 431 (3,5 %), kleine 10 von 125 (8,0 %).
  • Empfindlichkeit gegenüber unserer eigenen Regeländerung (D5). Nach der vor der Erhebung eingefrorenen Zugriffsregel, ohne den erneuten Scan D5, ergeben sich 93 von 1.282 vollständig gelesenen Websites (7,3 %), Konfidenzintervall 6,0–8,8 %, mit einem namensunabhängigen Vorbehalt, und 0 Widersprüche.

Kanäle.

  • TDMRep findet sich auf 71 von 1.356 (5,2 %), Konfidenzintervall 4,2–6,6 %. Bei 58 der 71 steht es nur in einem Header oder einem <meta>-Element (Meta 41, Header 22, Datei 13). 53 von 192 vollständig gelesenen französischen Websites (27,6 %) nutzen es.
  • Content-Signal ai-train=no erscheint auf 18 Websites. Das train-ai=n der IETF erscheint auf 0.
  • 17 Websites senden Content-Usage: ai=n. Das ist die Kennzeichnung für KI-Training aus draft-ietf-aipref-vocab-01; der aktuelle Entwurf hat sie gestrichen, Parser müssen sie also ignorieren. Als Vorbehalt gegen Training gelesen, würde sie den Anteil namensunabhängiger Vorbehalte auf 116 von 1.356 (8,6 %) erhöhen.
  • Widersprüche: 2 Widersprüche unter den 1.356 nach der aktuellen Regel, 0 nach der eingefrorenen Regel. Beide sind Websites des Corriere della Sera, die nur beim erneuten Scan D5 gelesen wurden. Jede sendet Content-Signal ai-train=yes zusammen mit einem TDMRep-Vorbehalt in einem <meta>-Element.
  • 218 von 1.510 (14,4 %) schreiben einen Vorbehalt oder ein allgemeines Verbot in Kommentare von robots.txt, die ein Parser nach RFC 9309 verwirft.

Zugriff, und was wir falsch gemacht haben. Bei 154 Websites haben wir nur robots.txt gelesen, weil ein bewusst vorsichtig ausgelegter Detektor ihre Kommentare als allgemeines Verbot automatisierten Zugriffs einstuft. Die Studie hat ihre eigene Zugriffsregel fünfmal verletzt; jeder Verstoß ist offengelegt und seine Daten sind gelöscht:

  • D0: die explorative Pilotphase.
  • D1: 7 Anfragen an einen Host vor dem Abruf seiner robots.txt.
  • D2: 245 Anfragen an 92 Websites.
  • D4: 3 Anfragen an eine Website.
  • D7: 72 Anfragen an 24 Websites.

Die D7-Anfragen wurden bei einem erneuten Scan (D5) nach der Erhebung gesendet, nachdem der koordinierende KI-Agent der Studie die Regel dafür geändert hatte, was als Verbot gilt. Die Anweisungen der Studie stuften den Hinweis der 23 Mediahuis-Websites fälschlich als zweckspezifisch ein. Die laborweite Regel von EasyxLab (3. Oktober 2026) behandelt robots.txt als verbindlich im gesetzlichen Mindestumfang. S16 behält bewusst eine strengere Regel bei, weil diese Vorbehalte ihr Gegenstand sind.

Prüfungen der Detektoren (alle durch KI-Agenten).

  • Eigene Stichprobe des Autors, Detektoren v1/v2: Der Vorbehaltsdetektor lag bei 54 von 54 Markierungen richtig; der Verbotsdetektor v2 bei 35 von 62.
  • Erster unabhängiger Prüfer, v1/v2, 44 andere Websites: Verbot bei 15 von 21 Markierungen richtig und 15 von 15 gefunden; Vorbehalt bei 20 von 20 Markierungen richtig und 20 von 21 gefunden.
  • Nachprüfer, v3, 43 weitere Websites: Verbot 15 von 15 in der Stichprobe, aber etwa 84 % Trefferquote (Recall; 130 von 154), wenn man die 24 übersehenen D7-Fälle mitzählt; Vorbehalt 15 von 16.
  • v4 ändert genau diese beiden Fehlerarten. Eine Prüfung von v4 wird nicht behauptet.

Anbieter. Am 3. Oktober 2026 konnten wir die Crawler-Dokumentation von 8 der 14 Anbieter lesen; alle 8 nennen robots.txt. Keiner nennt TDMRep, Content-Signal, Content-Usage oder noai.

Die Ergebnisse je Website geben wieder, was die Dateien der jeweiligen Website sagen. Sie sind keine Bewertung der Website: Die Pflicht liegt bei den KI-Anbietern. Das Prüfwerkzeug ist scripts/optout_check.py <domain>, aus dem das kostenlose Tool optout-lint werden könnte.

Diese Studie zitieren

Zitation
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations
BibTeX
@techreport{easyxlab_s16,
  title       = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S16},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}