Solution AEM pour empêcher l’indexation des moteurs de recherche à l’aide de Robots.txt et X-Robots-Tag Headers

Les environnements, les pages, les ressources et les points d’entrée générés d’Adobe Experience Manager as a Cloud Service peuvent apparaître dans les résultats de recherche lorsque des directives d’explore sont manquantes ou appliquées au mauvais calque. Vous pouvez empêcher l’indexation en configurant des robots.txt, en appliquant des en-têtes de réponse X-Robots-Tag et en utilisant des règles du Dispatcher ou du réseau CDN pour des chemins d’accès, des types de fichiers ou des points d’entrée *.plain.html spécifiques.

Description description

Environnement

Adobe Experience Manager as a Cloud Service

Problème/Symptômes

Certains environnements, pages, ressources ou points d’entrée générés par Adobe Experience Manager peuvent apparaître dans les résultats des moteurs de recherche lorsque des directives de blocage de moteurs de recherche sont manquantes, incomplètes ou appliquées au mauvais niveau. Cela est généralement observé dans les environnements hors production ou lorsque des ressources spécifiques telles que des fichiers PDF ou des points d’entrée générés sont toujours analysables.

  • Les domaines hors production apparaissent dans les résultats de recherche.
  • Des pages ou des ressources spécifiques, telles que des fichiers PDF, sont indexées même si des restrictions d’indexation étaient attendues.
  • L’en-tête de réponse X-Robots-Tag est manquant pour certaines URL.
  • Les points d’entrée générés par le système, tels que *.plain.html, ne renvoient pas les directives de moteur de recherche prévues.

Vous pouvez confirmer le problème en toute sécurité en vérifiant les URL affectées et les en-têtes de réponse :

  • Ouvrez le fichier /robots.txt du site et vérifiez que les directives d’explore attendues sont présentes.
  • Utilisez une vérification d’en-tête telle que curl -I https://<domain>/<path> pour vérifier si la réponse inclut des X-Robots-Tag.
  • Testez des URL représentatives pour chaque type de ressource affecté, comme des pages standard, des fichiers PDF, des chemins d’accès liés aux formulaires et des points d’entrée *.plain.html.
  • Comparez les résultats sur les URL qui doivent être bloquées et celles qui doivent rester analysables.

Résolution resolution

Essayez les étapes suivantes pour résoudre le problème :

  1. Identifiez les éléments qui doivent être bloqués de l’indexation, tels qu’un environnement hors production complet, des pages sélectionnées, des ressources PDF, des chemins d’accès liés aux formulaires ou des points d’entrée *.plain.html. Le résultat attendu est une liste claire des types d’URL concernés, que vous pouvez vérifier en vérifiant quelles URL apparaissent dans les résultats de recherche ou ne doivent pas être indexées.
  2. Configurez robots.txt pour le blocage à l’échelle de l’environnement, si nécessaire. Le résultat attendu est que https://<environment-domain>/robots.txt renvoie les directives d’explore prévues, que vous pouvez vérifier en ouvrant le fichier dynamique et en examinant son contenu.
  3. Appliquez un en-tête X-Robots-Tag par le biais de la configuration du Dispatcher ou du réseau CDN lorsque vous avez besoin d’un contrôle au niveau de la réponse pour des domaines, des chemins ou des types de ressources spécifiques. Le résultat attendu est que les réponses affectées incluent une directive telle que X-Robots-Tag: noindex, nofollow, que vous pouvez vérifier à l’aide d’une vérification d’en-tête sur les URL affectées.
  4. Utilisez des règles basées sur les chemins d’accès si seules des pages, des dossiers ou des types de fichiers sélectionnés doivent être exclus des résultats de la recherche au lieu de bloquer l’environnement complet. Le résultat attendu est que seules les ressources ciblées renvoient la directive de blocage, que vous pouvez vérifier en comparant les réponses pour les URL ciblées et non ciblées.
  5. Appliquez X-Robots-Tag règles aux fichiers PDF ou à d’autres ressources téléchargeables si ces ressources sont toujours en cours d’indexation. Le résultat attendu est que les URL de ressource correspondantes renvoient systématiquement l’en-tête « no-index », que vous pouvez vérifier en testant directement plusieurs URL de ressource.
  6. Excluez les chemins liés aux formulaires avec les directives robots.txt et la prise en charge des règles du Dispatcher ou du réseau CDN lorsque ces URL ne doivent pas être explorées. Il en résulte que les moteurs de recherche ont pour instruction de ne pas explorer à ces URL de formulaire. Vous pouvez vérifier cela en examinant les règles de Live robots.txt et les en-têtes de réponse associés.
  7. Utilisez des règles de réponse CDN pour les points d’entrée *.plain.html lorsque ces URL générées nécessitent des directives de blocage de moteur de recherche. Le résultat attendu est que ces points d’entrée renvoient la valeur de X-Robots-Tag prévue, que vous pouvez vérifier en vérifiant les en-têtes de réponse après le déploiement.
  8. Redéployez la configuration et testez à nouveau les URL affectées. Le résultat attendu est que les directives mises à jour sont visibles dans les réponses dynamiques et correspondent au comportement de blocage prévu, que vous pouvez vérifier en revérifiant à la fois la sortie des robots.txt dynamiques et les en-têtes de réponse.

Si les symptômes ci-dessous apparaissent et que les étapes de dépannage produisent les résultats suivants, envoyez une demande d’assistance à l’adresse Assistance ​ :

  • Le contenu robots.txt correct est déployé, mais l’environnement en ligne diffuse toujours des directives d’explore différentes.
  • L’en-tête X-Robots-Tag attendu est configuré, mais il n’apparaît pas dans les réponses actives après le redéploiement.
  • Seules certaines URL reçoivent l’en-tête attendu même si la même règle doit s’appliquer au chemin d’accès complet ou au modèle de fichier.
  • *.plain.html ou d’autres points d’entrée générés continuent de renvoyer des directives de moteur de recherche inattendues après les mises à jour de la configuration du réseau CDN.

Lorsque vous contactez l’assistance Adobe, incluez l’URL affectée, les en-têtes de réponse en direct, le contenu robots.txt actuel et le fragment de code de configuration Dispatcher ou CDN approprié.

Lecture connexe

recommendation-more-help
experience-cloud-kcs-help-kbarticles