Solución de AEM para evitar la indexación de motores de búsqueda mediante los encabezados Robots.txt y X-Robots-Tag

Los entornos, las páginas, los recursos y los extremos generados por Adobe Experience Manager as a Cloud Service pueden aparecer en los resultados de búsqueda cuando faltan directivas de rastrea o se aplican en el nivel incorrecto. Puede evitar la indexación configurando robots.txt, aplicando X-Robots-Tag encabezados de respuesta y utilizando reglas de Dispatcher o CDN para rutas, tipos de archivo o extremos *.plain.html específicos.

Descripción description

Entorno

Adobe Experience Manager as a Cloud Service

Problema/Síntomas

Algunos entornos, páginas, recursos o puntos de conexión generados por el sistema de Adobe Experience Manager pueden aparecer en los resultados del motor de búsqueda cuando faltan directivas de bloqueo del motor de búsqueda, están incompletas o se aplican en el nivel incorrecto. Esto suele observarse en entornos que no son de producción o cuando aún se pueden rastrear recursos específicos como archivos PDF o extremos generados.

  • Los dominios que no son de producción aparecen en los resultados de búsqueda.
  • Las páginas o recursos específicos, como los archivos PDF, se indexan aunque se esperaban restricciones de indexación.
  • Falta el encabezado de respuesta X-Robots-Tag para algunas direcciones URL.
  • Los extremos generados por el sistema como *.plain.html no devuelven las directivas de motor de búsqueda deseadas.

Puede confirmar el problema de forma segura comprobando las direcciones URL y los encabezados de respuesta afectados:

  • Abra el archivo /robots.txt del sitio y confirme que están presentes las directivas de rastrea esperadas.
  • Use una comprobación de encabezado como curl -I https://<domain>/<path> para comprobar si la respuesta incluye X-Robots-Tag.
  • Probar direcciones URL representativas para cada tipo de recurso afectado, como páginas estándar, archivos PDF, rutas relacionadas con formularios y *.plain.html extremos.
  • Compare los resultados entre las direcciones URL que deben bloquearse y las que deben permanecer rastreables.

Resolución resolution

Pruebe los siguientes pasos para resolver el problema:

  1. Identifique lo que debe bloquearse en la indexación, como un entorno sin producción completo, páginas seleccionadas, recursos de PDF, rutas relacionadas con formularios o *.plain.html extremos. El resultado esperado es una lista clara de los tipos de URL afectados, que puede verificar comprobando qué URL aparecen en los resultados de búsqueda o no deben indexarse.
  2. Configure robots.txt para el bloqueo de todo el entorno cuando sea necesario. El resultado esperado es que https://<environment-domain>/robots.txt devuelva las directivas rastree deseadas, que puede comprobar abriendo el archivo activo y revisando su contenido.
  3. Aplique un encabezado X-Robots-Tag a través de la configuración de Dispatcher o CDN cuando necesite control de nivel de respuesta para dominios, rutas o tipos de recursos específicos. El resultado esperado es que las respuestas afectadas incluyan una directiva como X-Robots-Tag: noindex, nofollow, que puede verificar con una comprobación de encabezado en las direcciones URL afectadas.
  4. Utilice reglas basadas en rutas si solo las páginas, carpetas o tipos de archivo seleccionados deben excluirse de los resultados de búsqueda en lugar de bloquear el entorno completo. El resultado esperado es que solo los recursos de destino devuelvan la directiva de bloqueo, que puede verificar comparando las respuestas para direcciones URL de destino y sin destino.
  5. Aplicar reglas X-Robots-Tag a archivos PDF u otros recursos descargables si esos recursos se siguen indizando. El resultado esperado es que las URL de recursos coincidentes devuelvan de forma coherente el encabezado sin índice, que puede verificar probando varias URL de recursos directamente.
  6. Excluya las rutas relacionadas con formularios con directivas robots.txt y admita reglas de Dispatcher o CDN cuando no se deban rastrear esas direcciones URL. El resultado esperado es que los motores de búsqueda reciban instrucciones para no rastrear esas direcciones URL de formulario, lo que se puede comprobar revisando las reglas de robots.txt activas y cualquier encabezado de respuesta relacionado.
  7. Utilice reglas de respuesta de CDN para *.plain.html extremos cuando esas direcciones URL generadas necesiten directivas de bloqueo de motores de búsqueda. El resultado esperado es que estos extremos devuelvan el valor X-Robots-Tag deseado, que puede comprobar comprobando los encabezados de respuesta después de la implementación.
  8. Vuelva a implementar la configuración y vuelva a probar las direcciones URL afectadas. El resultado esperado es que las directivas actualizadas estén visibles en las respuestas activas y coincidan con el comportamiento de bloqueo deseado, que puede verificar volviendo a comprobar los encabezados de salida y respuesta activos de robots.txt.

Si se producen los siguientes síntomas y los pasos para solucionar problemas producen los siguientes resultados, envíe una solicitud de asistencia en Soporte técnico de Adobe:

  • Se implementó el contenido correcto de robots.txt, pero el entorno en vivo sigue sirviendo directivas de rastrea diferentes.
  • El encabezado X-Robots-Tag esperado está configurado, pero no aparece en las respuestas activas después de la reimplementación.
  • Solo algunas direcciones URL reciben el encabezado esperado, aunque la misma regla debe aplicarse a la ruta de acceso completa o al patrón de archivo.
  • *.plain.html u otros extremos generados siguen devolviendo directivas de motor de búsqueda inesperadas después de actualizaciones de configuración de CDN.

Al ponerse en contacto con el Soporte de Adobe, incluya la dirección URL afectada, los encabezados de respuesta en directo, el contenido actual de robots.txt y el fragmento de configuración de CDN o Dispatcher correspondiente.

Lectura relacionada

recommendation-more-help
experience-cloud-kcs-help-kbarticles