Μελέτες / S16
Διατήρηση δικαιωμάτων για την εξόρυξη κειμένων και δεδομένων στον Τύπο της ΕΕ-27, κανάλι προς κανάλι
Δηλώνουν οι εκδότες ειδήσεων της ΕΕ διατήρηση δικαιωμάτων για την εξόρυξη κειμένων και δεδομένων που μπορεί να διαβάσει ένας ανιχνευτής ΤΝ, όποιο κι αν είναι το όνομά του;
Περίληψη
Από τις 2 Αυγούστου 2025, ο κανονισμός για την τεχνητή νοημοσύνη (Art. 53(1)(c)) υποχρεώνει τους παρόχους μοντέλων ΤΝ γενικού σκοπού να εντοπίζουν και να συμμορφώνονται με τη διατήρηση δικαιωμάτων για την εξόρυξη κειμένων και δεδομένων που εκφράζεται δυνάμει του Art. 4(3) της οδηγίας (ΕΕ) 2019/790, «όπως με μηχαναναγνώσιμα μέσα» για το επιγραμμικό περιεχόμενο. Τα μοντέλα που διατέθηκαν στην αγορά πριν από την ημερομηνία αυτή έχουν προθεσμία έως τις 2 Αυγούστου 2027 (Art. 111(3)). Η Επιτροπή μπορεί να επιβάλλει πρόστιμα στους παρόχους από τις 2 Αυγούστου 2026.
Διαβάσαμε ό,τι μπορεί να διαβάσει ένας ανιχνευτής σε 1.511 ειδησεογραφικούς ιστότοπους σε 27 κράτη μέλη: εφημερίδες και ειδησεογραφικούς ιστότοπους από το Wikidata των οποίων ο διακομιστής (host) βρίσκεται στους πρώτους 100.000 της λίστας Chrome UX Report της χώρας τους, εξαιρουμένων των επίσημων εφημερίδων του κράτους. Τα κανάλια ήταν τα robots.txt (RFC 9309), TDMRep (αρχείο, κεφαλίδα HTTP, <meta>), Content-Signal, ο κανόνας Content-Usage της IETF, noai και llms.txt. Ζητήσαμε μια διεύθυνση URL μόνο όπου το επέτρεπε το robots.txt.
Στους 1.356 ιστότοπους που μπορέσαμε να διαβάσουμε πλήρως, οι 99 από τους 1.356 (7,3%), 95% ΔΕ 6,0–8,8%, δηλώνουν διατήρηση δικαιωμάτων που δεσμεύει έναν ανιχνευτή όποιο κι αν είναι το όνομά του.
- 558 από τους 1.356 (41,2%) μπλοκάρουν στη ρίζα τουλάχιστον έναν ονομαστικά προσδιορισμένο ανιχνευτή ΤΝ. Από αυτούς, οι 480 από τους 558 (86,0%), ΔΕ 82,9–88,7%, δεν δηλώνουν τίποτα που θα διάβαζε ένας ανιχνευτής με νέο όνομα.
- 777 από τους 1.356 (57,3%) δεν δηλώνουν καμία διατήρηση δικαιωμάτων σε κανένα από τα κανάλια που διαβάσαμε.
- Σε όλους τους 1.510 ιστότοπους που απάντησαν για το
robots.txt, όσοι έχουν διατήρηση δικαιωμάτων ανεξάρτητη από το όνομα του ανιχνευτή είναι τουλάχιστον 110 από τους 1.510 (7,3%). Όσοι μπλοκάρουν ανιχνευτές ονομαστικά χωρίς διατήρηση ανεξάρτητη από το όνομα είναι το πολύ 621 από τους 699 (88,8%). - Ανά ομάδα χωρών, ιστότοποι που διαβάστηκαν πλήρως με διατήρηση ανεξάρτητη από το όνομα: μεγάλες χώρες 74 από 800 (9,2%), μεσαίες 15 από 431 (3,5%), μικρές 10 από 125 (8,0%).
- Ευαισθησία στη δική μας αλλαγή κανόνα (D5). Με τον κανόνα πρόσβασης που είχε παγώσει πριν από τη συλλογή, χωρίς τη νέα σάρωση D5, το αποτέλεσμα είναι 93 από 1.282 ιστότοπους που διαβάστηκαν πλήρως (7,3%), ΔΕ 6,0–8,8%, με διατήρηση ανεξάρτητη από το όνομα, και 0 αντιφάσεις.
Κανάλια.
- Το TDMRep υπάρχει σε 71 από τους 1.356 (5,2%), ΔΕ 4,2–6,6%. Σε 58 από τους 71 βρίσκεται μόνο σε κεφαλίδα ή σε στοιχείο
<meta>(meta 41, κεφαλίδα 22, αρχείο 13). Το χρησιμοποιούν 53 από τους 192 γαλλικούς ιστότοπους που διαβάστηκαν πλήρως (27,6%). - Το Content-Signal
ai-train=noεμφανίζεται σε 18 ιστότοπους. Τοtrain-ai=nτης IETF εμφανίζεται σε 0. - 17 ιστότοποι στέλνουν
Content-Usage: ai=n. Πρόκειται για την ετικέτα εκπαίδευσης ΤΝ του draft-ietf-aipref-vocab-01· το τρέχον σχέδιο την αφαίρεσε, οπότε οι αναλυτές πρέπει να την αγνοούν. Αν διαβαστεί ως διατήρηση δικαιωμάτων για την εκπαίδευση, θα αύξανε το ποσοστό διατήρησης ανεξάρτητης από το όνομα σε 116 από 1.356 (8,6%). - Αντιφάσεις: 2 αντιφάσεις στους 1.356 με τον τρέχοντα κανόνα, 0 με τον παγωμένο κανόνα. Και οι δύο αφορούν ιστότοπους της Corriere della Sera, που διαβάστηκαν μόνο στη νέα σάρωση D5. Ο καθένας στέλνει Content-Signal
ai-train=yesμαζί με διατήρηση δικαιωμάτων TDMRep σε στοιχείο<meta>. - 218 από τους 1.510 (14,4%) γράφουν διατήρηση δικαιωμάτων ή γενική απαγόρευση σε σχόλια του
robots.txt, τα οποία ένας αναλυτής σύμφωνος με το RFC 9309 απορρίπτει.
Η πρόσβαση, και τι κάναμε λάθος. Σε 154 ιστότοπους διαβάσαμε μόνο το robots.txt, επειδή ένα σκόπιμα συντηρητικό εργαλείο εντοπισμού χαρακτηρίζει τα σχόλιά τους ως γενική απαγόρευση της αυτοματοποιημένης πρόσβασης. Η μελέτη παραβίασε πέντε φορές τον δικό της κανόνα πρόσβασης· κάθε παράβαση δηλώνεται και τα δεδομένα της έχουν διαγραφεί:
- D0: η διερευνητική πιλοτική φάση.
- D1: 7 αιτήματα σε έναν host πριν από την ανάκτηση του
robots.txtτου. - D2: 245 αιτήματα σε 92 ιστότοπους.
- D4: 3 αιτήματα σε έναν ιστότοπο.
- D7: 72 αιτήματα σε 24 ιστότοπους.
Τα αιτήματα D7 στάλθηκαν σε μια νέα σάρωση (D5) που έγινε μετά τη συλλογή, αφού ο συντονιστικός πράκτορας ΤΝ της μελέτης άλλαξε τον κανόνα για το τι θεωρείται απαγόρευση. Οι οδηγίες της μελέτης ταξινόμησαν εσφαλμένα την ειδοποίηση των 23 ιστότοπων της Mediahuis ως ειδική για συγκεκριμένο σκοπό. Ο κανόνας του EasyxLab για όλο το εργαστήριο (3 Οκτωβρίου 2026) αντιμετωπίζει το robots.txt ως δεσμευτικό στο ελάχιστο που απαιτεί ο νόμος. Η S16 διατηρεί σκόπιμα αυστηρότερο κανόνα, επειδή αντικείμενό της είναι αυτές οι διατηρήσεις δικαιωμάτων.
Έλεγχοι των εργαλείων εντοπισμού (όλοι από πράκτορες ΤΝ).
- Δείγμα του ίδιου του συντάκτη, εργαλεία v1/v2: το εργαλείο εντοπισμού διατήρησης δικαιωμάτων ήταν σωστό σε 54 από 54 επισημάνσεις· το εργαλείο εντοπισμού απαγορεύσεων v2 σε 35 από 62.
- Πρώτος ανεξάρτητος αξιολογητής, v1/v2, 44 άλλοι ιστότοποι: απαγόρευση σωστή σε 15 από 21 επισημάνσεις και 15 από 15 εντοπισμένες· διατήρηση σωστή σε 20 από 20 επισημάνσεις και 20 από 21 εντοπισμένες.
- Δεύτερος αξιολογητής, v3, 43 ακόμη ιστότοποι: απαγόρευση 15 από 15 στο δείγμα, αλλά ανάκληση (recall) περίπου 84% (130 από 154) αν μετρηθούν οι 24 παραλείψεις του D7· διατήρηση 15 από 16.
- Η v4 αλλάζει ακριβώς αυτούς τους δύο τρόπους αστοχίας. Δεν δηλώνεται κανένας έλεγχος της v4.
Πάροχοι. Στις 3 Οκτωβρίου 2026 μπορέσαμε να διαβάσουμε την τεκμηρίωση για τους ανιχνευτές για 8 από τους 14 παρόχους· και οι 8 αναφέρουν το robots.txt. Κανένας δεν αναφέρει τα TDMRep, Content-Signal, Content-Usage ή noai.
Τα αποτελέσματα ανά ιστότοπο αναφέρουν τι λένε τα αρχεία κάθε ιστότοπου. Δεν αποτελούν αξιολόγηση του ιστότοπου: η υποχρέωση βαραίνει τους παρόχους ΤΝ. Το εργαλείο ελέγχου είναι το scripts/optout_check.py <domain>, το οποίο μπορεί να γίνει το δωρεάν εργαλείο optout-lint.
Παραπομπή σε αυτή τη μελέτη
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}