防止使用Robots.txt和X-Robots-Tag Headers編制搜尋引擎索引的AEM解決方案
如果抓取指示遺失或在錯誤的圖層套用,Adobe Experience Manager as a Cloud Service環境、頁面、資產和產生的端點可能會出現在搜尋結果中。 您可以透過設定robots.txt、套用X-Robots-Tag回應標頭,並針對特定路徑、檔案型別或*.plain.html端點使用Dispatcher或CDN規則來防止建立索引。
說明 description
環境
Adobe Experience Manager as a Cloud Service
問題/症狀
搜尋引擎封鎖指示遺失、不完整或套用至錯誤的圖層時,某些Adobe Experience Manager環境、頁面、資產或系統產生的端點可能會出現在搜尋引擎結果中。 這通常會在非生產環境中或特定資源(例如PDF檔案或產生的端點)仍可編目時出現。
- 非生產網域會出現在搜尋結果中。
- 即使需要索引限制,特定頁面或資產(例如PDF檔案)也會索引。
- 某些URL缺少
X-Robots-Tag回應標頭。 - 系統產生的端點(例如
*.plain.html)未傳回預期的搜尋引擎指示。
您可以透過檢查受影響的URL和回應標題來安全地確認問題:
- 開啟網站的
/robots.txt檔案,並確認預期的抓取指示存在。 - 使用標頭檢查(例如
curl -I https://<domain>/<path>)來驗證回應是否包含X-Robots-Tag。 - 測試每個受影響資源型別的代表URL,例如標準頁面、PDF檔案、表單相關路徑和
*.plain.html端點。 - 比較應封鎖和應保持可編目的URL結果。
解決方法 resolution
請嘗試下列步驟來解決問題:
- 識別索引中必須封鎖的專案,例如整個非生產環境、選取的頁面、PDF資產、表單相關路徑或
*.plain.html端點。 預期的結果會清楚列出受影響的URL型別,您可檢查搜尋結果中顯示的URL或不應編制索引的URL來進行驗證。 - 視需要設定
robots.txt以進行全環境封鎖。 預期的結果是https://<environment-domain>/robots.txt會傳回預期的抓取指示,您可以透過開啟即時檔案並檢閱其內容來進行驗證。 - 當您需要特定網域、路徑或資源型別的回應層級控制時,透過Dispatcher或CDN設定套用
X-Robots-Tag標頭。 預期的結果是,受影響的回應包含X-Robots-Tag: noindex, nofollow之類的指示詞,您可以使用受影響URL上的標頭檢查來進行驗證。 - 如果只應將選取的頁面、資料夾或檔案型別從搜尋結果中排除,而非封鎖完整環境,請使用路徑型規則。 預期的結果是只有目標資源會傳回封鎖指令,您可透過比較目標和非目標URL的回應來進行驗證。
- 如果資源仍在編制索引,請套用
X-Robots-Tag規則至PDF檔案或其他可下載的資產。 預期的結果是相符的資產URL會一致地傳回無索引標頭,您可以直接測試數個資產URL來進行驗證。 - 排除含有
robots.txt指令且支援Dispatcher或CDN規則(若不應抓取這些URL)的表單相關路徑。 預期的結果是指示搜尋引擎不要抓取這些表單URL,您可以檢閱即時robots.txt規則和任何相關回應標頭來進行驗證。 - 當產生的URL需要搜尋引擎封鎖指示時,請對
*.plain.html個端點使用CDN回應規則。 預期的結果是,這些端點會傳回預期的X-Robots-Tag值,您可以在部署後檢查回應標頭以進行驗證。 - 重新部署設定並重新測試受影響的URL。 預期的結果是更新的指令會顯示在即時回應中,並符合預期的封鎖行為,您可以透過重新檢查即時
robots.txt輸出和回應標題來驗證此行為。
如果發生下列症狀且疑難排解步驟產生下列結果,請向Adobe支援提交支援要求:
- 已部署正確的
robots.txt內容,但即時環境仍提供不同的抓取指示。 - 預期的
X-Robots-Tag標頭已設定,但在重新部署後未出現在即時回應中。 - 只有部分URL會收到預期的標頭,即使相同的規則應套用至完整路徑或檔案模式。
- CDN設定更新後,
*.plain.html或其他產生的端點繼續傳回非預期的搜尋引擎指示。
聯絡Adobe支援時,請包含受影響的URL、即時回應標頭、目前的robots.txt內容,以及相關的Dispatcher或CDN設定程式碼片段。
相關閱讀
recommendation-more-help
experience-cloud-kcs-help-kbarticles