Μελέτες / S2
Πλαστοί ανιχνευτές ΤΝ
Πόση από την κίνηση που δηλώνει ότι προέρχεται από ανιχνευτή ΤΝ ή μηχανής αναζήτησης είναι πραγματική;
Περίληψη
Οι διαχειριστές ιστοτόπων μετρούν τα «GPTBot», «ClaudeBot» ή «ChatGPT-User» στα αρχεία καταγραφής πρόσβασης ως ένδειξη ότι συστήματα ΤΝ τους διαβάζουν ή τους παραθέτουν. Το User-Agent είναι ελεύθερο κείμενο. Ελέγξαμε κάθε αίτημα που δήλωνε ότι προέρχεται από έναν από 23 ανιχνευτές ΤΝ ή μηχανών αναζήτησης σε τρεις μικρούς ιστότοπους σε παραγωγή (16.548 αιτήματα· ένα αρχείο καταγραφής 68 ημερών, δύο των 7–9 ημερών, καθώς και μια προβολή 30 ημερών από το edge του Cloudflare) με τη μέθοδο επαλήθευσης που δημοσιεύει ο ίδιος κάθε φορέας: αρχεία JSON με εύρη IP και αντίστροφο DNS με επιβεβαίωση προς τα εμπρός (forward-confirmed reverse DNS). Το 39,3% των ισχυρισμών ήταν πλαστοί (44,3% όσων μπορούσαν να ελεγχθούν), το 49,5% επαληθεύτηκε και το 11,2% ήταν μη επαληθεύσιμο ή αδιευκρίνιστο. Τα εργαλεία ανάκτησης που εκκινούνται από χρήστη, τα ονόματα που διαβάζονται συχνότερα ως ένδειξη «παράθεσης από ΤΝ», ήταν τα χειρότερα: 67,8% πλαστά, ενώ τα Claude-User, Perplexity-User, MistralAI-User και DuckAssistBot ήταν γνήσια σε ποσοστό 0–4,2%. Το Google-Extended, ένα token που η Google δηλώνει ότι δεν αποστέλλεται ποτέ ως User-Agent, εμφανίστηκε 371 φορές. Όλη η πλαστογράφηση προήλθε από το πολύ 54 διευθύνσεις, το 81% των οποίων βρίσκεται σε δίκτυα cloud/φιλοξενίας (μόνο ο χώρος πελατών ενός παρόχου cloud: 66%)· το 97% των πλαστών αιτημάτων προήλθε από πηγές που αναζητούσαν επίσης διαπιστευτήρια (.env, config.json, service-account.json) και το 92% από πηγές που εναλλάσσονταν μεταξύ των ταυτοτήτων πολλών φορέων. Στον κύριο ιστότοπο, στο edge του CDN, ο όγκος των πλαστών αιτημάτων ήταν 3,1× αυτόν που κατέγραψε ο διακομιστής προέλευσης· οι προεπιλεγμένες ρυθμίσεις του δωρεάν πακέτου μπλόκαραν το 0,7% του όγκου αυτού. Δημοσιεύουμε το ai-bot-verify, ένα εργαλείο επαλήθευσης χωρίς εξαρτήσεις για οποιοδήποτε αρχείο καταγραφής πρόσβασης, το οποίο εξάγει μόνο συγκεντρωτικά στοιχεία και αρνείται να γράψει διευθύνσεις IP.
Παραπομπή σε αυτή τη μελέτη
EasyxLab (2026). Spoofed AI crawlers. Study S2. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s2-spoofed-ai-crawlers@techreport{easyxlab_s2,
title = {Spoofed AI crawlers},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S2},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s2-spoofed-ai-crawlers}
}