Studio Empirico · Ricerca MINDCEPTION

Cosa fanno davvero i bot AI sul tuo sito: 4.259.100 richieste, 52 giorni

Per 52 giorni abbiamo registrato e verificato ogni singola richiesta in ingresso su un e-commerce di erboristeria (erbecedario.it). L'obiettivo: capire se e come le AI leggono il web reale, chi spoofa le User-Agent e se il file llms.txt serve davvero.

Campione documentato su log Nginx e Cloudflare · 1 agosto – 22 settembre 2026 · n=1

Chi arriva davvero sui server

Dietro un proxy o CDN (come Cloudflare) l'IP visibile è l'edge. Abbiamo verificato l'ultimo hop non forgiabile di X-Forwarded-For mediante rDNS e ASN proprietari di ciascuna organizzazione.

Bot dichiarato (User-Agent)
Richieste verificate (IP rDNS/ASN)
Googlebot (Search + AI Overviews)
196.639 richieste autentiche (crawl-*.googlebot.com)
ClaudeBot (Anthropic)
14.726 richieste autentiche (ASN AWS, range ristretto)
Amazonbot (Amazon)
12.443 richieste autentiche (*.amazonbot.amazon)
ChatGPT-User (OpenAI, on-demand)
7.454 richieste autentiche (Azure/GCP)
PerplexityBot (Perplexity)
3.131 richieste autentiche (16 IP, AWS)
GPTBot + OAI-SearchBot (OpenAI)
5.066 richieste autentiche (2.758 + 2.308)
Google-Extended (Opt-out Gemini)
801 richieste totali — solo 23 autentiche (97,1% spoof)
GrokBot (xAI)
761 richieste totali — solo 2 autentiche (99,7% spoof)

Le 3 scoperte fondamentali dell'analisi

1

Google AI = Googlebot

Tutta la presenza di Google AI sul sito è il crawl di ricerca ordinario (193.264 pagine viste, ~3.200 al giorno). Le AI Overviews e la modalità AI non usano bot separati. Chi vi vende una "strategia crawler Google AI" separata dalla SEO tecnica sta vendendo un'illusione.

0

llms.txt scaricati da modelli

Su 4,2 milioni di richieste, abbiamo contato 50 tentativi di accesso a /llms.txt (tutti 404). Nessuno proveniva da OpenAI, Anthropic, Google o Perplexity. A cercarlo sono solo auditor e crawler di tool SEO come Semrush o BuiltWith.

99%

Spoofing delle User-Agent

Un singolo IP hosting su GCP ha alternato 10 bot AI diversi nello stesso giorno (ClaudeBot al mattino, GPTBot a pranzo, GrokBot nel pomeriggio) cercando file come /.env e /rclone.conf. Senza validazione rDNS/ASN, i report sui bot AI contano solo scanner malevoli.

La regola d'oro: Essere letti ≠ Essere citati

Scansione dei bot (Log Nginx)
Visibilità generativa (MINDCEPTION)
Misura quante pagine HTML/risorse vengono scaricate
Misura se il brand viene raccomandato nelle risposte generate
Filtra per IP, rDNS, codici di risposta HTTP (200, 404, 503)
Valuta entità semantica, quota di menzioni e co-citazioni
È il prerequisito infrastrutturale di base
È il risultato percepito dal potenziale cliente finale

Tutti questi bot hanno regolarmente scansionato il catalogo e le schede prodotto. Eppure, nelle risposte dei modelli alle domande degli utenti, la presenza del brand varia in modo indipendente. Per sapere cosa i motori generativi dicono davvero di voi, serve una misurazione dedicata sulle risposte.

Misura la visibilità reale del tuo brand

Ti mandiamo la misurazione di ingresso: dove il tuo brand compare nelle risposte AI e chi compare al suo posto. Cosa arriva: 5 domande, 4 piattaforme, 3 brand. Fase di calibrazione: misuriamo un numero limitato di aziende, su candidatura.

La misurazione arriva entro 4 giorni lavorativi · Nessun impegno

Domande frequenti sulla ricerca e i bot

Google AI ha un crawler dedicato diverso da Googlebot?

No. Nei nostri log verificati (193.264 pagine scansionate), Google AI Overviews e Google AI Mode si basano interamente sulle scansioni del normale Googlebot. Non esiste un crawler separato di ricerca AI.

I modelli AI scaricano e utilizzano il file llms.txt?

Nel nostro campione di 4.259.100 richieste su 52 giorni, nessun modello consumer (ChatGPT, Claude, Google, Perplexity) ha scaricato llms.txt. Le uniche richieste sono arrivate da crawler di strumenti SEO e di audit.

Basta leggere la User-Agent per identificare un bot AI?

No. Le stringhe User-Agent sono facilmente falsificabili. Nel nostro studio, il 99,7% del traffico con User-Agent GrokBot e oltre il 97% di quello con Google-Extended era costituito da scanner malevoli mascherati da bot AI. L'identificazione richiede verifica rDNS e ASN sull'IP di origine.

Essere scansionati da un bot AI garantisce di essere citati nelle risposte?

No. La scansione è un prerequisito tecnico, ma la presenza nelle risposte generate dipende da autorità dell'entità, citazioni di terze parti e coerenza delle fonti esterne.