Изследвания / S16
Запазване на права за извличане на информация от текст и данни в пресата на ЕС-27, канал по канал
Заявяват ли издателите на новини в ЕС запазване на права за извличане на информация от текст и данни, което робот на ИИ може да прочете, независимо от името си?
Резюме
От 2 август 2025 г. Актът за изкуствения интелект (Art. 53(1)(c)) изисква от доставчиците на модели на ИИ с общо предназначение да установяват и съблюдават запазването на права за извличане на информация от текст и данни, изразено съгласно Art. 4(3) от Директива (ЕС) 2019/790, „като например машинночетими средства“ за съдържанието онлайн. Моделите, пуснати на пазара преди тази дата, имат срок до 2 август 2027 г. (Art. 111(3)). Комисията може да налага глоби на доставчиците от 2 август 2026 г.
Прочетохме това, което един робот може да прочете на 1 511 новинарски сайта в 27 държави членки: вестници и новинарски сайтове от Wikidata, чийто хост е в първите 100 000 в списъка на Chrome UX Report за съответната държава, като официалните държавни вестници са изключени. Каналите бяха robots.txt (RFC 9309), TDMRep (файл, HTTP заглавка, <meta>), Content-Signal, правилото Content-Usage на IETF, noai и llms.txt. Заявявахме URL само там, където robots.txt го позволяваше.
От 1 356-те сайта, които успяхме да прочетем изцяло, 99 от 1 356 (7,3%), 95% ДИ 6,0–8,8%, заявяват запазване на права, което обвързва робота независимо от името му.
- 558 от 1 356 (41,2%) блокират поне един поименно посочен робот на ИИ в корена на сайта. От тях 480 от 558 (86,0%), ДИ 82,9–88,7%, не заявяват нищо, което би прочел робот с ново име.
- 777 от 1 356 (57,3%) не заявяват запазване на права в нито един от прочетените от нас канали.
- Сред всички 1 510 сайта, които отговориха за
robots.txt, агностичните (независещи от името на робота) са най-малко 110 от 1 510 (7,3%). Блокиращите поименно без агностично запазване на права са най-много 621 от 699 (88,8%). - По групи държави, агностични сред изцяло прочетените сайтове: големи държави 74 от 800 (9,2%), средни 15 от 431 (3,5%), малки 10 от 125 (8,0%).
- Чувствителност към собствената ни промяна на правилото (D5). Съгласно правилото за достъп, замразено преди събирането, без повторното сканиране D5, резултатът е 93 от 1 282 (7,3%), ДИ 6,0–8,8%, изцяло прочетени сайта с агностично запазване на права и 0 противоречия.
Канали.
- TDMRep присъства на 71 от 1 356 (5,2%), ДИ 4,2–6,6%. При 58 от тези 71 той е само в заглавка или в елемент
<meta>(meta 41, заглавка 22, файл 13). Използват го 53 от 192 изцяло прочетени френски сайта (27,6%). - Content-Signal
ai-train=noсе среща на 18 сайта.train-ai=nна IETF се среща на 0. - 17 сайта изпращат
Content-Usage: ai=n. Това е етикетът за обучение на ИИ от draft-ietf-aipref-vocab-01; текущият проект го премахна, така че парсерите трябва да го игнорират. Ако се тълкува като запазване на права по отношение на обучението, агностичният дял би се увеличил до 116 от 1 356 (8,6%). - Противоречия: 2 противоречия сред 1 356-те по текущото правило, 0 по замразеното правило. И двата са сайтове на Corriere della Sera, прочетени само при повторното сканиране D5. Всеки от тях изпраща Content-Signal
ai-train=yesзаедно със запазване на права чрез TDMRep в<meta>. - 218 от 1 510 (14,4%) пишат запазване на права или обща забрана в коментарите на
robots.txt, които парсер по RFC 9309 отхвърля.
Достъп и в какво сгрешихме. За 154 сайта прочетохме само robots.txt, защото умишлено консервативен детектор отбелязва коментарите им като обща забрана за автоматизиран достъп. Изследването наруши собственото си правило за достъп пет пъти; всяко нарушение е декларирано, а данните от него – изтрити:
- D0: разузнавателният пилот.
- D1: 7 заявки към хост преди неговия
robots.txt. - D2: 245 заявки към 92 сайта.
- D4: 3 заявки към един сайт.
- D7: 72 заявки към 24 сайта.
Заявките D7 бяха изпратени при повторно сканиране (D5), направено след събирането, след като координиращият агент с ИИ на изследването промени правилото за това какво се счита за забрана. Инструкциите на изследването погрешно класифицираха известието на 23-те сайта на Mediahuis като отнасящо се до конкретна цел. Общото правило на EasyxLab за цялата лаборатория (3 октомври 2026 г.) третира robots.txt като обвързващ в рамките на правния минимум. S16 съзнателно запазва по-строго правило, защото предметът му са именно тези запазвания на права.
Одити на детекторите (всички извършени от агенти с ИИ).
- Собствената извадка на автора, детектори v1/v2: детекторът за запазване на права е бил прав при 54 от 54 отбелязвания; детекторът за забрана v2 е бил прав при 35 от 62.
- Първи независим рецензент, v1/v2, 44 други сайта: забрана – прав при 15 от 21 отбелязвания и открити 15 от 15; запазване на права – прав при 20 от 20 отбелязвания и открити 20 от 21.
- Повторен рецензент, v3, 43 допълнителни сайта: забрана 15 от 15 в извадката, но пълнота (recall) около 84% (130 от 154), след като се отчетат 24-те пропуска от D7; запазване на права 15 от 16.
- v4 променя точно тези два вида грешки. Не се твърди, че v4 е одитиран.
Доставчици. На 2026-10-03 успяхме да прочетем документацията за роботите на 8 от 14 доставчици; всичките 8 посочват robots.txt. Никой не посочва TDMRep, Content-Signal, Content-Usage или noai.
Резултатите по сайтове посочват какво казват файловете на всеки сайт. Те не са оценка на сайта: задължението е на доставчиците на ИИ. Инструментът за проверка е scripts/optout_check.py <domain>, който може да стане безплатният инструмент optout-lint.
Цитирайте това изследване
EasyxLab (2026). Text-and-data-mining reservations in the EU-27 press, channel by channel. Study S16. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations@techreport{easyxlab_s16,
title = {Text-and-data-mining reservations in the EU-27 press, channel by channel},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S16},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s16-eu-press-tdm-reservations}
}