Studio Empirico · Ricerca MINDCEPTION
Per 52 giorni abbiamo registrato e verificato ogni singola richiesta in ingresso su un e-commerce di erboristeria (erbecedario.it). L'obiettivo: capire se e come le AI leggono il web reale, chi spoofa le User-Agent e se il file llms.txt serve davvero.
Campione documentato su log Nginx e Cloudflare · 1 agosto – 22 settembre 2026 · n=1
Dietro un proxy o CDN (come Cloudflare) l'IP visibile è l'edge. Abbiamo verificato l'ultimo hop non forgiabile di X-Forwarded-For mediante rDNS e ASN proprietari di ciascuna organizzazione.
Tutta la presenza di Google AI sul sito è il crawl di ricerca ordinario (193.264 pagine viste, ~3.200 al giorno). Le AI Overviews e la modalità AI non usano bot separati. Chi vi vende una "strategia crawler Google AI" separata dalla SEO tecnica sta vendendo un'illusione.
Su 4,2 milioni di richieste, abbiamo contato 50 tentativi di accesso a /llms.txt (tutti 404). Nessuno proveniva da OpenAI, Anthropic, Google o Perplexity. A cercarlo sono solo auditor e crawler di tool SEO come Semrush o BuiltWith.
Un singolo IP hosting su GCP ha alternato 10 bot AI diversi nello stesso giorno (ClaudeBot al mattino, GPTBot a pranzo, GrokBot nel pomeriggio) cercando file come /.env e /rclone.conf. Senza validazione rDNS/ASN, i report sui bot AI contano solo scanner malevoli.
Tutti questi bot hanno regolarmente scansionato il catalogo e le schede prodotto. Eppure, nelle risposte dei modelli alle domande degli utenti, la presenza del brand varia in modo indipendente. Per sapere cosa i motori generativi dicono davvero di voi, serve una misurazione dedicata sulle risposte.
Ti mandiamo la misurazione di ingresso: dove il tuo brand compare nelle risposte AI e chi compare al suo posto. Cosa arriva: 5 domande, 4 piattaforme, 3 brand. Fase di calibrazione: misuriamo un numero limitato di aziende, su candidatura.
Grazie! Ti risponderemo entro 2 giorni lavorativi. ✅
No. Nei nostri log verificati (193.264 pagine scansionate), Google AI Overviews e Google AI Mode si basano interamente sulle scansioni del normale Googlebot. Non esiste un crawler separato di ricerca AI.
Nel nostro campione di 4.259.100 richieste su 52 giorni, nessun modello consumer (ChatGPT, Claude, Google, Perplexity) ha scaricato llms.txt. Le uniche richieste sono arrivate da crawler di strumenti SEO e di audit.
No. Le stringhe User-Agent sono facilmente falsificabili. Nel nostro studio, il 99,7% del traffico con User-Agent GrokBot e oltre il 97% di quello con Google-Extended era costituito da scanner malevoli mascherati da bot AI. L'identificazione richiede verifica rDNS e ASN sull'IP di origine.
No. La scansione è un prerequisito tecnico, ma la presenza nelle risposte generate dipende da autorità dell'entità, citazioni di terze parti e coerenza delle fonti esterne.