Il robots.txt è un file di testo posto nella radice del sito che indica ai crawler dei motori di ricerca quali percorsi non devono scansionare. Regola la scansione, non l’indicizzazione, e non è uno strumento di sicurezza.
Cosa fa e cosa non fa
Il file può impedire la scansione di una sezione, ma una pagina bloccata può comunque comparire fra i risultati se altri siti la collegano: il motore ne conosce l’esistenza pur non potendone leggere il contenuto. Per tenere davvero una pagina fuori dai risultati serve l’istruzione di esclusione dall’indice, che però richiede che la pagina sia scansionabile.
È una contraddizione che genera molti errori: bloccando una pagina nel robots si impedisce al motore di leggere proprio l’istruzione che ne chiederebbe l’esclusione.
L’errore che si paga più caro
Il caso più costoso è la riga che blocca l’intero sito, lasciata dall’ambiente di sviluppo e portata online con il lancio. L’effetto è la progressiva sparizione dai risultati nell’arco di giorni o settimane, spesso notata quando il danno è già fatto.
Per questo il controllo del file dovrebbe far parte della lista di verifica di ogni messa online, insieme al controllo delle istruzioni di esclusione nelle intestazioni delle pagine.
Cosa chiedere all’agenzia
Sono controlli che richiedono cinque minuti e prevengono mesi di recupero.
- Il file attuale blocca qualcosa che dovrebbe essere visibile?
- Chi verifica il file al momento della messa online di una nuova versione del sito?
- Le risorse necessarie a visualizzare correttamente le pagine sono scansionabili?
Errori tipici
- Portare in produzione il blocco totale usato in fase di sviluppo.
- Usare il file per nascondere contenuti riservati, che restano raggiungibili da chiunque conosca l’indirizzo.
- Bloccare fogli di stile e script, impedendo al motore di valutare la pagina come la vede l’utente.
Per approfondire
- Approfondimento: SEO tecnica: audit, crawlability, indexability
- Chi se ne occupa: le agenzie di SEO selezionate dalla redazione
- Termini collegati: Indicizzazione, Crawl budget, Sitemap XML