Noindex o X-Robots-Tag
Una direttiva esplicita può impedire l'indicizzazione anche se la pagina è raggiungibile.
Una pagina può essere online e corretta per un utente, ma restare fuori dall'indice per motivi molto diversi: discovery, crawling, canonical, noindex, rendering o segnali duplicati. La prima cosa utile è capire in quale passaggio si interrompe il percorso.
Lo stesso sintomo può avere cause opposte. Prima di cambiare qualcosa conviene separarle.
Una direttiva esplicita può impedire l'indicizzazione anche se la pagina è raggiungibile.
Google può ricevere il segnale che la versione da tenere è diversa da quella che vuoi indicizzare.
Una URL con pochi link interni o isolata può essere scoperta tardi o considerata poco importante.
HTML iniziale scarno, errori client o contenuti caricati tardi possono cambiare ciò che il crawler vede.
Google conosce la URL ma non l'ha ancora inserita stabilmente nell'indice.
Status code, catene di redirect o risposte diverse tra crawler e utenti possono creare segnali contraddittori.
Partiamo dalla URL, poi allarghiamo il controllo alla struttura che la circonda.
Verifichiamo status code, meta robots, canonical, intestazioni e contenuto restituito dal server.
Controlliamo sitemap, link interni e percorsi con cui il crawler può raggiungere la URL.
Confrontiamo HTML iniziale e contenuto renderizzato quando JavaScript ha un ruolo rilevante.
Mettiamo in relazione lo stato della URL con ciò che il sito restituisce oggi, non con ciò che dovrebbe restituire.
Interveniamo solo sulla causa trovata e controlliamo che i segnali risultino coerenti dopo la modifica.
La checklist cambia in base al sito, ma questi sono i punti che controllo più spesso.
Nessuno può garantire che una URL venga indicizzata. Possiamo però eliminare errori tecnici e segnali incoerenti che rendono più difficile la scansione o la selezione della pagina.
Invia la URL e, se disponibile, lo stato mostrato da Search Console. Possiamo partire da lì.