Solução da AEM para impedir a indexação do mecanismo de pesquisa usando os cabeçalhos Robots.txt e X-Robots-Tag

Ambientes, páginas, ativos e endpoints gerados do Adobe Experience Manager as a Cloud Service podem aparecer nos resultados da pesquisa quando diretivas de rastreo estão ausentes ou são aplicadas na camada errada. Você pode impedir a indexação configurando robots.txt, aplicando X-Robots-Tag cabeçalhos de resposta e usando regras de Dispatcher ou CDN para caminhos, tipos de arquivos ou *.plain.html pontos de extremidade específicos.

Descrição description

Ambiente

Adobe Experience Manager as a Cloud Service

Problema/Sintomas

Alguns ambientes, páginas, ativos ou endpoints gerados pelo sistema do Adobe Experience Manager podem aparecer nos resultados do mecanismo de pesquisa quando as diretivas de bloqueio do mecanismo de pesquisa estão ausentes, incompletas ou aplicadas na camada errada. Isso geralmente é visto em ambientes que não sejam de produção ou quando recursos específicos, como arquivos PDF ou endpoints gerados, ainda são rastreáveis.

  • Os domínios de não produção aparecem nos resultados da pesquisa.
  • Páginas ou ativos específicos, como arquivos PDF, são indexados mesmo que as restrições de indexação fossem esperadas.
  • O cabeçalho de resposta X-Robots-Tag está ausente para algumas URLs.
  • Os pontos de extremidade gerados pelo sistema, como *.plain.html, não retornam as diretivas de mecanismo de pesquisa desejadas.

Você pode confirmar o problema com segurança verificando os URLs afetados e os cabeçalhos de resposta:

  • Abra o arquivo /robots.txt do site e confirme se as diretivas de rastreo esperadas estão presentes.
  • Use uma verificação de cabeçalho como curl -I https://<domain>/<path> para verificar se a resposta inclui X-Robots-Tag.
  • Teste URLs representativas para cada tipo de recurso afetado, como páginas padrão, arquivos PDF, caminhos relacionados a formulários e pontos de extremidade *.plain.html.
  • Compare os resultados entre os URLs que devem ser bloqueados e aqueles que devem permanecer rastreáveis.

Resolução resolution

Tente as seguintes etapas para resolver o problema:

  1. Identifique o que deve ser bloqueado para indexação, como um ambiente inteiro de não produção, páginas selecionadas, ativos do PDF, caminhos relacionados a formulários ou pontos de extremidade *.plain.html. O resultado esperado é uma lista clara de tipos de URL afetados, que você pode verificar verificando quais URLs aparecem ou não devem ser indexados nos resultados da pesquisa.
  2. Configure o robots.txt para bloqueio em todo o ambiente quando necessário. O resultado esperado é que https://<environment-domain>/robots.txt retorna as diretivas de rastreo pretendidas, que você pode verificar abrindo o arquivo ativo e revisando seu conteúdo.
  3. Aplique um cabeçalho X-Robots-Tag por meio do Dispatcher ou da configuração de CDN quando precisar de controle de nível de resposta para domínios, caminhos ou tipos de recursos específicos. O resultado esperado é que as respostas afetadas incluem uma diretiva como X-Robots-Tag: noindex, nofollow, que você pode verificar com uma verificação de cabeçalho nas URLs afetadas.
  4. Usar regras baseadas em caminho se somente as páginas, pastas ou tipos de arquivos selecionados precisarem ser excluídos dos resultados da pesquisa, em vez de bloquear o ambiente completo. O resultado esperado é que apenas os recursos de destino retornam a diretiva de bloqueio, que pode ser verificada ao comparar as respostas para URLs de destino e não destino.
  5. Aplique regras do X-Robots-Tag a arquivos do PDF ou outros ativos baixáveis se esses recursos ainda estiverem sendo indexados. O resultado esperado é que os URLs de ativos correspondentes retornem consistentemente o cabeçalho sem índice, que pode ser verificado ao testar vários URLs de ativos diretamente.
  6. Excluir caminhos relacionados a formulários com diretivas robots.txt e regras de Dispatcher ou CDN de suporte quando essas URLs não devem ser rastreadas. O resultado esperado é que os mecanismos de pesquisa sejam instruídos a não rastrear essas URLs de formulário, o que você pode verificar revisando as regras de robots.txt ativas e quaisquer cabeçalhos de resposta relacionados.
  7. Use regras de resposta CDN para pontos de extremidade *.plain.html quando essas URLs geradas precisarem de diretivas de bloqueio de mecanismo de pesquisa. O resultado esperado é que esses pontos de extremidade retornam o valor X-Robots-Tag pretendido, que pode ser verificado verificando os cabeçalhos de resposta após a implantação.
  8. Reimplante a configuração e teste novamente os URLs afetados. O resultado esperado é que as diretivas atualizadas estejam visíveis em respostas ativas e correspondam ao comportamento de bloqueio pretendido, que você pode verificar novamente verificando a saída robots.txt ativa e os cabeçalhos de resposta.

Se os seguintes sintomas ocorrerem e as etapas de solução de problemas produzirem os resultados a seguir, envie uma solicitação de suporte no Suporte da Adobe:

  • O conteúdo robots.txt correto está implantado, mas o ambiente ativo ainda serve diretivas de rastreo diferentes.
  • O cabeçalho esperado X-Robots-Tag está configurado, mas não aparece em respostas ativas após a reimplantação.
  • Somente alguns URLs recebem o cabeçalho esperado, embora a mesma regra deva se aplicar ao caminho completo ou padrão de arquivo.
  • *.plain.html ou outros pontos de extremidade gerados continuam a retornar diretivas de mecanismo de pesquisa inesperadas após as atualizações de configuração de CDN.

Ao entrar em contato com o Suporte da Adobe, inclua a URL afetada, os cabeçalhos de resposta ativa, o conteúdo atual do robots.txt e o trecho de configuração relevante do Dispatcher ou CDN.

Leitura relacionada

recommendation-more-help
experience-cloud-kcs-help-kbarticles