Tanulmányok / S2
Hamisított MI-robotok
Mennyi valódi abból a forgalomból, amely MI- vagy keresőrobotnak adja ki magát?
Összefoglaló
A webhelyek üzemeltetői a hozzáférési naplóikban szereplő „GPTBot”, „ClaudeBot” vagy „ChatGPT-User” bejegyzéseket annak bizonyítékaként számolják, hogy MI-rendszerek olvassák vagy idézik őket. A User-Agent szabad szöveg. Három kis, éles üzemű webhelyen minden olyan kérést, amely a 23 MI- vagy keresőrobot valamelyikének adta ki magát (16 548 kérés; egy 68 napos napló, két 7–9 napos napló, valamint egy 30 napos Cloudflare-peremnézet), összevetettünk az adott üzemeltető saját közzétett ellenőrzési módszerével: IP-tartományokat tartalmazó JSON-fájlokkal és előre irányú megerősítéssel ellenőrzött fordított DNS-sel (forward-confirmed reverse DNS). Az állítások 39,3%-a hamisított volt (a tesztelhetők 44,3%-a), 49,5%-uk igazoltan valódi, 11,2%-uk nem ellenőrizhető vagy meghatározatlan. A felhasználó által kezdeményezett lekérők – azok a nevek, amelyeket a leggyakrabban „MI-idézés” jelének tekintenek – voltak a legrosszabbak: 67,8%-uk hamisított volt, a Claude-User, a Perplexity-User, a MistralAI-User és a DuckAssistBot esetében pedig 0–4,2% volt valódi. A Google-Extended, egy olyan token, amelyet a Google szerint soha nem küldenek User-Agent értékként, 371-szer jelent meg. Az összes hamisítás legfeljebb 54 címről érkezett, ezek 81%-a felhő- vagy tárhelyszolgáltatói hálózatban van (egyetlen felhőszolgáltató ügyfél-címtartománya önmagában 66%); a hamisított kérések 97%-a olyan forrásokból jött, amelyek hitelesítő adatokat is kerestek (.env, config.json, service-account.json), 92%-uk pedig olyanokból, amelyek több üzemeltető identitását váltogatták. A fő webhelyen a CDN peremén a hamisított forgalom a forrásszerver által naplózott mennyiség 3,1-szerese volt; az ingyenes csomag alapbeállításai ennek 0,7%-át blokkolták. Közzétesszük az ai-bot-verify eszközt: függőségek nélküli ellenőrző bármilyen hozzáférési naplóhoz, amely csak összesített adatokat ad ki, és megtagadja az IP-címek kiírását.
Hivatkozás erre a tanulmányra
EasyxLab (2026). Spoofed AI crawlers. Study S2. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s2-spoofed-ai-crawlers@techreport{easyxlab_s2,
title = {Spoofed AI crawlers},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S2},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s2-spoofed-ai-crawlers}
}