Robots.txt 및 X-Robots-Tag 헤더를 사용하여 검색 엔진 색인화를 방지하는 AEM 솔루션

Adobe Experience Manager as a Cloud Service 환경, 에셋 및 생성된 끝점은 크롤링 지시문이 누락되거나 잘못된 계층에서 적용된 경우 검색 결과에 나타날 수 있습니다. robots.txt을(를) 구성하고, X-Robots-Tag 응답 헤더를 적용하고, 특정 경로, 파일 형식 또는 *.plain.html 끝점에 대해 Dispatcher 또는 CDN 규칙을 사용하여 인덱싱을 방지할 수 있습니다.

설명 description

환경

Adobe Experience Manager as a Cloud Service

문제/증상

일부 Adobe Experience Manager 환경, 페이지, 에셋 또는 시스템 생성 끝점은 검색 엔진 차단 지시문이 없거나, 불완전하거나, 잘못된 계층에서 적용된 경우 검색 엔진 결과에 나타날 수 있습니다. 이는 비프로덕션 환경 또는 PDF 파일 또는 생성된 엔드포인트와 같은 특정 리소스가 여전히 크롤링할 수 있는 경우에 일반적으로 나타납니다.

  • 비프로덕션 도메인이 검색 결과에 표시됩니다.
  • 색인화 제한이 필요하지만 특정 페이지 또는 에셋(예: PDF 파일)은 색인화됩니다.
  • 일부 URL에 대한 X-Robots-Tag 응답 헤더가 없습니다.
  • *.plain.html과(와) 같은 시스템 생성 끝점은 의도한 검색 엔진 지침을 반환하지 않습니다.

영향을 받는 URL 및 응답 헤더를 확인하여 문제를 안전하게 확인할 수 있습니다.

  • 사이트의 /robots.txt 파일을 열고 예상되는 크롤링 지시문이 있는지 확인합니다.
  • curl -I https://<domain>/<path>과(와) 같은 헤더 검사를 사용하여 응답에 X-Robots-Tag이(가) 포함되어 있는지 확인합니다.
  • 표준 페이지, PDF 파일, 양식 관련 경로 및 *.plain.html 끝점과 같이 영향을 받는 각 리소스 유형의 대표 URL을 테스트합니다.
  • 차단해야 하는 URL과 크롤링 가능한 상태를 유지해야 하는 URL의 결과를 비교합니다.

해결 방법 resolution

문제를 해결하려면 다음 단계를 수행하십시오.

  1. 전체 비프로덕션 환경, 선택한 페이지, PDF 에셋, 양식 관련 경로 또는 *.plain.html 끝점과 같이 인덱싱에서 차단해야 하는 항목을 식별합니다. 예상되는 결과는 영향을 받는 URL 유형의 명확한 목록이며 검색 결과에 표시되거나 색인화되어서는 안 되는 URL을 확인하여 확인할 수 있습니다.
  2. 필요한 경우 환경 전체에 걸친 차단을 위해 robots.txt을(를) 구성하십시오. 예상되는 결과는 라이브 파일을 열고 내용을 검토하여 확인할 수 있는 크롤링 지시문 https://<environment-domain>/robots.txt을(를) 반환합니다.
  3. 특정 도메인, 경로 또는 리소스 유형에 대한 응답 수준 제어가 필요한 경우 Dispatcher 또는 CDN 구성을 통해 X-Robots-Tag 헤더를 적용합니다. 영향을 받는 응답에는 영향을 받는 URL에 대한 헤더 검사로 확인할 수 있는 X-Robots-Tag: noindex, nofollow과(와) 같은 지시문이 포함됩니다.
  4. 전체 환경을 차단하는 대신 선택한 페이지, 폴더 또는 파일 유형만 검색 결과에서 제외해야 하는 경우 경로 기반 규칙을 사용합니다. 예상된 결과는 타깃팅된 리소스만 차단 지시문을 반환하며, 이 지시문은 타깃팅된 URL과 타깃팅되지 않은 URL에 대한 응답을 비교하여 확인할 수 있습니다.
  5. 해당 리소스가 계속 인덱싱되는 경우 PDF 파일 또는 기타 다운로드 가능한 자산에 X-Robots-Tag 규칙을 적용합니다. 예상되는 결과는 일치하는 에셋 URL이 색인 없음 헤더를 일관되게 반환한다는 것입니다. 이 헤더는 여러 에셋 URL을 직접 테스트하여 확인할 수 있습니다.
  6. robots.txt 지시문이 있는 양식 관련 경로를 제외하고 이러한 URL이 크롤링과 관련되지 않아야 하는 경우 Dispatcher 또는 CDN 규칙을 지원합니다. 예상되는 결과는 URL의 크롤링이 아닌 검색 엔진에 지시됩니다. 이 검색 엔진은 라이브 robots.txt 규칙 및 관련 응답 헤더를 검토하여 확인할 수 있습니다.
  7. 생성된 URL에 검색 엔진 차단 지시문이 필요한 경우 *.plain.html 종단점에 대해 CDN 응답 규칙을 사용합니다. 예상 결과는 이러한 끝점이 의도한 X-Robots-Tag 값을 반환하므로 배포 후 응답 헤더를 확인하여 확인할 수 있습니다.
  8. 구성을 다시 배포하고 영향을 받는 URL을 다시 테스트합니다. 예상된 결과는 업데이트된 지시문이 실시간 응답에 표시되고 의도한 차단 동작과 일치하므로 실시간 robots.txt 출력 및 응답 헤더를 모두 다시 확인하여 확인할 수 있습니다.

다음 증상이 발생하고 문제 해결 단계에서 다음과 같은 결과가 발생하는 경우 Adobe 지원에서 지원 요청을 제출하십시오.

  • 올바른 컨텐츠가 배포되지만 라이브 환경은 여전히 서로 다른 robots.txt 지침을 제공합니다.
  • 필요한 X-Robots-Tag 헤더가 구성되었지만 다시 배포 후 실시간 응답에 표시되지 않습니다.
  • 동일한 규칙이 전체 경로 또는 파일 패턴에 적용되어야 하지만 일부 URL만 예상 헤더를 받습니다.
  • CDN 구성 업데이트 후 *.plain.html 또는 다른 생성된 끝점이 예기치 않은 검색 엔진 지시문을 계속 반환합니다.

Adobe 지원에 문의할 때 영향을 받는 URL, 라이브 응답 헤더, 현재 robots.txt 콘텐츠 및 관련 Dispatcher 또는 CDN 구성 코드 조각을 포함하십시오.

관련 읽기

recommendation-more-help
experience-cloud-kcs-help-kbarticles