Robots.txt
robots.txt è un file di testo posizionato nella directory principale di un sito web che istruisce i crawler dei motori di ricerca su quali pagine o file è consentito o negato richiedere. È la prima linea di difesa nel controllare come i bot interagiscono con l'infrastruttura del tuo sito e aiuta a ottimizzare il budget di crawl.
Indirizzare i bot ai tuoi migliori contenuti
Google alloca un "crawl budget" limitato al tuo sito: il numero di pagine che i suoi bot scansioneranno al giorno. Se i bot perdono tempo a scansionare pannelli di amministrazione, pagine stampabili duplicate o URL di carrello/checkout, potrebbero non trovare le tue preziose pagine di prodotti tradotti. robots.txt dice ai bot "Non perdere tempo su /admin/, concentrati invece su /en/, /fr/, /de/". Per i siti internazionali, dovresti impedire la scansione delle pagine di reindirizzamento dell'auto-rilevamento della lingua, degli endpoint API e di eventuali URL tecnici che non necessitano di essere indicizzati. Tuttavia, NON bloccare mai accidentalmente le tue directory linguistiche: è un errore catastrofico che uccide tutto il SEO internazionale.
Consentire vs. Negare l'accesso al Crawl
Impatto nel Mondo Reale
Il sito non ha robots.txt, i bot scansionano 10.000 URL del carrello
Budget di crawl sprecato, pagine di prodotto scansionate lentamente
I nuovi prodotti impiegano settimane per apparire nei risultati di ricerca
Aggiungi robots.txt: Disallow /cart/, /checkout/, /api/
I bot si concentrano al 100% sulle pagine di prodotto e linguistiche
Nuovi prodotti indicizzati entro 24 ore