Cos’è l’Answer-Engine Optimization (AEO) e come preparare il tuo sito all’era dell’AI-Search
llms.txt vs robots.txt: come farsi leggere e citare dalle AI
7 Gennaio 2026
Per anni abbiamo ragionato così: “se Google non mi indicizza, non esisto.” Nel 2026, la frase cambia: “se le AI non mi capiscono (e non mi citano), non esisto nel punto in cui l’utente decide.” Ed è qui che entrano in scena due file che, da fuori, sembrano simili… ma in realtà fanno due mestieri diversi:
- robots.txt = regola l’accesso dei crawler,
- llms.txt = prova a “spiegare” il sito alle AI.
La domanda giusta quindi non è “quale uso?”, ma: “che problema sto risolvendo?”
1) robots.txt: è un cancello, non un manuale
robots.txt nasce come Robots Exclusion Protocol: un file in root che dice ai bot cosa possono o non possono scansionare. È usato soprattutto per gestire traffico dei crawler e, in alcuni casi, evitare crawling di risorse. Ma ha un limite fondamentale: non può “imporre” nulla. È una convenzione che i crawler rispettano se sono “educati”. Questa cosa è importante perché nel mondo AI esistono bot “ufficiali” e trasparenti (che rispettano robots) e bot “opachi” (che possono ignorarlo).
Quindi robots.txt non è sicurezza, è governance.
2) Mettere un agent AI nel robots.txt va bene?
Qui veniamo alla domanda diretta: “inserire user-agent AI nel robots.txt vale davvero?” Sì, esiste ed è concretamente utile per gestire come alcuni sistemi AI accedono ai contenuti. OpenAI, per esempio, documenta esplicitamente i suoi crawler e come gestirli via robots.txt (con user-agent dedicati, e finalità diverse). E qui c’è una distinzione chiave (che quasi nessuno racconta):
- alcuni bot servono per training / raccolta,
- altri bot servono per retrieval / search (quelli che ti portano citazioni e traffico).
Se vengono bloccati indiscriminatamente “i bot AI”, rischiamo di fare una cosa paradossale: proteggiamo il contenuto dal training… ma ci rendiamo invisibili nei sistemi che citano e linkano… e infatti OpenAI dice chiaramente: se vuoi comparire in ChatGPT Search con citazioni e link, non devi bloccare il crawler di ricerca (OAI-SearchBot).
Quindi? Sì: ha senso mettere agent AI nel robots.txt, ma solo se viene fatto in modo selettivo.
3) llms.txt: non è un “cancello”. È un “indice ragionato” per LLM.
llms.txt è una proposta recente (non ancora uno standard web “ufficiale” come robots). L’idea è semplice: creare un file in root (/llms.txt) che contenga una guida per i modelli linguistici: cos’è il sito, quali pagine sono “canoniche”, dove sono le risorse migliori in formato leggibile, quali directory usare e via dicendo. Il punto è: llms.txt non blocca nulla. Non dice “non entrare”. Dice: “se devi capire questo sito, inizia da qui.” È il passaggio da SEO a… documentazione per intelligenze.
4) Allora quale usare? Entrambi, ma con scopi diversi.
robots.txt (con la consapevolezza che è “volontario”, non coercitivo), se vogliamo:
- governare chi può crawlare,
- distinguere tra bot di training e bot di retrieval,
- evitare sprechi di crawl su aree inutili,
- rendere esplicita la policy verso i crawler.
llms.txt, se vogliamo:
- indicare alle AI le risorse migliori,
- far emergere pagine “fondamentali” (guide, glossary, pillar),
- ridurre ambiguità e dispersione del contenuto,
- aumentare la probabilità che un agent scelga le pagine quando deve rispondere.
In sintesti robots.txt è la policy, llms.txt è l’onboarding.
5) La terza via che molti dimenticano: i segnali che contano davvero per la citazione
Se il nostro obiettivo è farsi citare, robots e llms sono utili, ma non bastano da soli. In pratica, le AI (e i sistemi tipo AI Overview) tendono a preferire fonti:
- chiare, strutturate, con autorialità,
- con dati verificabili,
- con markup e contesto coerenti.
Qui rientrano:
- Schema.org (Person/Organization/BlogPosting + about/keywords/articleBody),
- FAQ ben scritte,
- pagine autore “stabili” (con @id persistente),
- coerenza cross-channel (il “brand entity” che tu insegni).
Robots/llms sono il “routing”. La citazione viene vinta con contenuto + struttura + identità. Una strategia concreta, a prova di 2026?
- robots.txt
- non bloccare a tappeto i bot “search/retrieval” se vogliamo citazioni e link,
- valutare blocchi selettivi solo per training, se è una policy.
- llms.txt
- mettere 10/20 link “canonici” (pillar, glossario, pagine autore, guide),
- usare testo semplice e orientato alla comprensione.
- Schema.org + autorialità
robots ti difende. llms ti presenta. La citazione ti premia.
Nel web classico vinceva chi si posizionava, mentre nel web conversazionale vince chi diventa fonte. robots.txt serve per dire “questa è casa mia” e llms.txt serve per dire “ecco da dove iniziare”. Il resto lo fa la qualità del contenuto e l’identità semantica. E qui, onestamente, il futuro è già iniziato.
Potrebbe interessarti anche
Corsi, articoli, eventi: il mondo Ninja è ricco di risorse e di appuntamenti da non perdere.








