Robots.txt 및 X-Robots-Tag 헤더를 사용하여 검색 엔진 색인화를 방지하는 AEM 솔루션
Adobe Experience Manager as a Cloud Service 환경, 에셋 및 생성된 끝점은 크롤링 지시문이 누락되거나 잘못된 계층에서 적용된 경우 검색 결과에 나타날 수 있습니다. robots.txt을(를) 구성하고, X-Robots-Tag 응답 헤더를 적용하고, 특정 경로, 파일 형식 또는 *.plain.html 끝점에 대해 Dispatcher 또는 CDN 규칙을 사용하여 인덱싱을 방지할 수 있습니다.
설명 description
환경
Adobe Experience Manager as a Cloud Service
문제/증상
일부 Adobe Experience Manager 환경, 페이지, 에셋 또는 시스템 생성 끝점은 검색 엔진 차단 지시문이 없거나, 불완전하거나, 잘못된 계층에서 적용된 경우 검색 엔진 결과에 나타날 수 있습니다. 이는 비프로덕션 환경 또는 PDF 파일 또는 생성된 엔드포인트와 같은 특정 리소스가 여전히 크롤링할 수 있는 경우에 일반적으로 나타납니다.
- 비프로덕션 도메인이 검색 결과에 표시됩니다.
- 색인화 제한이 필요하지만 특정 페이지 또는 에셋(예: PDF 파일)은 색인화됩니다.
- 일부 URL에 대한
X-Robots-Tag응답 헤더가 없습니다. *.plain.html과(와) 같은 시스템 생성 끝점은 의도한 검색 엔진 지침을 반환하지 않습니다.
영향을 받는 URL 및 응답 헤더를 확인하여 문제를 안전하게 확인할 수 있습니다.
- 사이트의
/robots.txt파일을 열고 예상되는 크롤링 지시문이 있는지 확인합니다. curl -I https://<domain>/<path>과(와) 같은 헤더 검사를 사용하여 응답에X-Robots-Tag이(가) 포함되어 있는지 확인합니다.- 표준 페이지, PDF 파일, 양식 관련 경로 및
*.plain.html끝점과 같이 영향을 받는 각 리소스 유형의 대표 URL을 테스트합니다. - 차단해야 하는 URL과 크롤링 가능한 상태를 유지해야 하는 URL의 결과를 비교합니다.
해결 방법 resolution
문제를 해결하려면 다음 단계를 수행하십시오.
- 전체 비프로덕션 환경, 선택한 페이지, PDF 에셋, 양식 관련 경로 또는
*.plain.html끝점과 같이 인덱싱에서 차단해야 하는 항목을 식별합니다. 예상되는 결과는 영향을 받는 URL 유형의 명확한 목록이며 검색 결과에 표시되거나 색인화되어서는 안 되는 URL을 확인하여 확인할 수 있습니다. - 필요한 경우 환경 전체에 걸친 차단을 위해
robots.txt을(를) 구성하십시오. 예상되는 결과는 라이브 파일을 열고 내용을 검토하여 확인할 수 있는 크롤링 지시문https://<environment-domain>/robots.txt을(를) 반환합니다. - 특정 도메인, 경로 또는 리소스 유형에 대한 응답 수준 제어가 필요한 경우 Dispatcher 또는 CDN 구성을 통해
X-Robots-Tag헤더를 적용합니다. 영향을 받는 응답에는 영향을 받는 URL에 대한 헤더 검사로 확인할 수 있는X-Robots-Tag: noindex, nofollow과(와) 같은 지시문이 포함됩니다. - 전체 환경을 차단하는 대신 선택한 페이지, 폴더 또는 파일 유형만 검색 결과에서 제외해야 하는 경우 경로 기반 규칙을 사용합니다. 예상된 결과는 타깃팅된 리소스만 차단 지시문을 반환하며, 이 지시문은 타깃팅된 URL과 타깃팅되지 않은 URL에 대한 응답을 비교하여 확인할 수 있습니다.
- 해당 리소스가 계속 인덱싱되는 경우 PDF 파일 또는 기타 다운로드 가능한 자산에
X-Robots-Tag규칙을 적용합니다. 예상되는 결과는 일치하는 에셋 URL이 색인 없음 헤더를 일관되게 반환한다는 것입니다. 이 헤더는 여러 에셋 URL을 직접 테스트하여 확인할 수 있습니다. robots.txt지시문이 있는 양식 관련 경로를 제외하고 이러한 URL이 크롤링과 관련되지 않아야 하는 경우 Dispatcher 또는 CDN 규칙을 지원합니다. 예상되는 결과는 URL의 크롤링이 아닌 검색 엔진에 지시됩니다. 이 검색 엔진은 라이브robots.txt규칙 및 관련 응답 헤더를 검토하여 확인할 수 있습니다.- 생성된 URL에 검색 엔진 차단 지시문이 필요한 경우
*.plain.html종단점에 대해 CDN 응답 규칙을 사용합니다. 예상 결과는 이러한 끝점이 의도한X-Robots-Tag값을 반환하므로 배포 후 응답 헤더를 확인하여 확인할 수 있습니다. - 구성을 다시 배포하고 영향을 받는 URL을 다시 테스트합니다. 예상된 결과는 업데이트된 지시문이 실시간 응답에 표시되고 의도한 차단 동작과 일치하므로 실시간
robots.txt출력 및 응답 헤더를 모두 다시 확인하여 확인할 수 있습니다.
다음 증상이 발생하고 문제 해결 단계에서 다음과 같은 결과가 발생하는 경우 Adobe 지원에서 지원 요청을 제출하십시오.
- 올바른 컨텐츠가 배포되지만 라이브 환경은 여전히 서로 다른
robots.txt지침을 제공합니다. - 필요한
X-Robots-Tag헤더가 구성되었지만 다시 배포 후 실시간 응답에 표시되지 않습니다. - 동일한 규칙이 전체 경로 또는 파일 패턴에 적용되어야 하지만 일부 URL만 예상 헤더를 받습니다.
- CDN 구성 업데이트 후
*.plain.html또는 다른 생성된 끝점이 예기치 않은 검색 엔진 지시문을 계속 반환합니다.
Adobe 지원에 문의할 때 영향을 받는 URL, 라이브 응답 헤더, 현재 robots.txt 콘텐츠 및 관련 Dispatcher 또는 CDN 구성 코드 조각을 포함하십시오.
관련 읽기
- Adobe Experience Manager as a Cloud Service에 대한 SEO 및 URL 관리 모범 사례
- SEO 및 URL 관리 모범 사례
recommendation-more-help
experience-cloud-kcs-help-kbarticles