Robots.txtおよびX-Robots-Tag ヘッダーを使用して検索エンジンのインデックス作成を防止するためのAEM ソリューション

Adobe Experience Manager as a Cloud Service環境、ページ、アセット、生成されたエンドポイントは、クロールディレクティブがないか、誤ったレイヤーに適用されている場合に、検索結果に表示される可能性があります。 インデックス作成を防止するには、robots.txtを設定し、X-Robots-Tag応答ヘッダーを適用し、特定のパス、ファイルタイプ、または*.plain.html個のエンドポイントにDispatcherまたはCDN ルールを使用します。

説明 description

環境

Adobe Experience Manager as a Cloud Service

問題/症状

一部のAdobe Experience Manager環境、ページ、アセット、またはシステム生成エンドポイントは、検索エンジンのブロッキングディレクティブがないか、不完全であるか、または誤ったレイヤーに適用されている場合に、検索エンジンの結果に表示される可能性があります。 これは通常、実稼動以外の環境で見られますが、PDF ファイルや生成されたエンドポイントなどの特定のリソースがまだクロール可能な場合にも見られます。

  • 実稼動以外のドメインが検索結果に表示されます。
  • インデックス作成の制限が想定されていても、PDF ファイルなどの特定のページやアセットはインデックス作成されます。
  • 一部のURLにX-Robots-Tag応答ヘッダーがありません。
  • *.plain.htmlなどのシステム生成エンドポイントは、意図した検索エンジンディレクティブを返しません。

影響を受けるURLと応答ヘッダーを確認することで、問題を安全に確認できます。

  • サイトの/robots.txt ファイルを開き、想定されるクロールディレクティブが存在することを確認します。
  • curl -I https://<domain>/<path>などのヘッダーチェックを使用して、応答にX-Robots-Tagが含まれているかどうかを確認します。
  • 標準ページ、PDF ファイル、フォーム関連のパス、*.plain.html エンドポイントなど、影響を受ける各リソースタイプの代表URLをテストします。
  • ブロックする必要があるURLとクロール可能な状態を維持する必要があるURLの結果を比較します。

解決策 resolution

問題を解決するには、次の手順を試してください。

  1. 実稼動以外の環境全体、選択したページ、PDF アセット、フォーム関連のパス、*.plain.html個のエンドポイントなど、インデックス作成をブロックする必要があるものを特定します。 期待される結果は、影響を受けるURL タイプの明確なリストです。検索結果に表示されるURLやインデックスを作成しないURLを確認することで、確認できます。
  2. 必要に応じて、環境全体でのブロック用にrobots.txtを設定します。 予想される結果は、https://<environment-domain>/robots.txtが意図したクロールディレクティブを返すことです。ライブファイルを開き、その内容を確認することで確認できます。
  3. 特定のドメイン、パス、またはリソースタイプに対する応答レベルの制御が必要な場合は、DispatcherまたはCDN設定を介してX-Robots-Tag ヘッダーを適用します。 予想される結果は、影響を受ける応答にX-Robots-Tag: noindex, nofollowなどのディレクティブが含まれていることです。このディレクティブは、影響を受けるURLのヘッダーチェックで確認できます。
  4. 完全な環境をブロックするのではなく、選択したページ、フォルダー、またはファイルタイプのみを検索結果から除外する必要がある場合は、パスベースのルールを使用します。 期待される結果は、ターゲットリソースのみがブロッキングディレクティブを返すことであり、ターゲット URLと非ターゲティング URLの応答を比較することで確認できます。
  5. PDF ファイルまたはその他のダウンロード可能なアセットにX-Robots-Tag ルールを適用します。これらのリソースがまだインデックス作成されている場合です。 期待される結果は、一致するアセット URLが一貫してインデックスなしヘッダーを返すことです。これは、複数のアセット URLを直接テストすることで確認できます。
  6. これらのURLをクロールしない場合、robots.txt ディレクティブとサポートするDispatcherまたはCDN ルールを含むフォーム関連のパスを除外します。 期待される結果は、これらのフォーム URLをクロールしないように検索エンジンに指示されていることです。ライブのrobots.txt ルールと関連する応答ヘッダーを確認することで、確認できます。
  7. 生成されたURLに検索エンジンブロッキングディレクティブが必要な場合は、*.plain.html エンドポイントに対してCDN応答ルールを使用します。 期待される結果は、これらのエンドポイントが意図したX-Robots-Tag値を返すことです。デプロイメント後に応答ヘッダーを確認して確認できます。
  8. 設定を再デプロイし、影響を受けるURLを再テストします。 予想される結果は、更新されたディレクティブがライブ応答に表示され、意図されたブロック動作と一致することです。これは、ライブ robots.txt出力ヘッダーと応答ヘッダーの両方を再確認することで確認できます。

次の現象が発生し、トラブルシューティング手順で次の結果が得られた場合は、Adobe サポート ​でサポートリクエストを送信します。

  • 正しいrobots.txt コンテンツがデプロイされますが、ライブ環境は引き続き異なるクロールディレクティブを提供します。
  • 想定されるX-Robots-Tag ヘッダーは設定されていますが、再デプロイ後にライブ応答に表示されません。
  • 完全なパスまたはファイルパターンに同じルールを適用する必要がありますが、想定されるヘッダーを受け取るのは一部のURLのみです。
  • *.plain.htmlまたはその他の生成されたエンドポイントは、CDN設定の更新後も予期しない検索エンジンディレクティブを引き続き返します。

Adobe サポートに連絡する際は、影響を受けるURL、ライブ応答ヘッダー、現在のrobots.txt コンテンツ、および関連するDispatcherまたはCDN設定スニペットを含めてください。

関連トピックス

recommendation-more-help
experience-cloud-kcs-help-kbarticles