UIのクラウドストレージソースからバッチデータを取り込むためのデータフローの設定

このチュートリアルでは、クラウドストレージソースからAdobe Experience Platformにバッチデータを取り込むようにデータフローを設定する手順を説明します。

はじめに

NOTE
クラウドストレージからバッチデータを取り込むデータフローを作成するには、認証済みのクラウドストレージソースに既にアクセスできる必要があります。 アクセス権がない場合は、​ ソースの概要で、アカウントを作成できるクラウドストレージソースのリストを参照してください。

このチュートリアルは、 Experience Platform の次のコンポーネントを実際に利用および理解しているユーザーを対象としています。

サポートされているファイル形式

バッチデータのクラウドストレージソースは、取り込み用に次のファイル形式をサポートしています。

  • 区切り区切り値(DSV):任意の1文字の値をDSV形式のデータファイルの区切り文字として使用できます。
  • JavaScript Object Notation (JSON): JSON形式のデータファイルは、XDMに準拠している必要があります。
  • Apache Parquet: Parquet形式のデータ ファイルはXDMに準拠している必要があります。
  • 圧縮されたファイル:JSONおよび区切られたファイルは、bzip2gzipdeflatezipDeflatetarGzip、およびtarとして圧縮できます。

データの追加

クラウドストレージアカウントを作成すると、Add data​手順が表示され、クラウドストレージファイル階層を探索し、Experience Platformに取り込むフォルダーまたは特定のファイルを選択するためのインターフェイスが提供されます。

  • インターフェイスの左側はディレクトリブラウザーで、クラウドストレージファイルの階層が表示されます。
  • インターフェイスの右側では、互換性のあるフォルダーまたはファイルから最大100行のデータをプレビューできます。

フォルダー階層にアクセスするには、ルートフォルダーを選択します。 ここから、1つのフォルダーを選択して、フォルダー内のすべてのファイルを再帰的に取り込むことができます。 フォルダー全体を取り込む場合は、そのフォルダー内のすべてのファイルが同じデータ形式とスキーマを共有していることを確認する必要があります。

フォルダーを選択すると、右側のインターフェイスが更新され、選択したフォルダー内の最初のファイルの内容と構造のプレビューが表示されます。

この手順では、先に進む前に、データに対していくつかの設定を行うことができます。 まず、データ形式​を選択し、表示されるドロップダウンパネルでファイルに適したデータ形式を選択します。

次の表に、サポートされているファイル形式に適したデータ形式を示します。

ファイルタイプ
データ形式
CSV
区切り
JSON
JSON
PARQUET
XDM Parquet

列の区切り文字を選択

データ形式を設定した後、区切りファイルを取り込む際に列区切り文字を設定できます。 「区切り」オプションを選択し、ドロップダウンメニューから区切り文字を選択します。 メニューには、カンマ (,)、タブ (\t)、パイプ (|)など、区切り記号に最もよく使用されるオプションが表示されます。

カスタム区切り記号を使用する場合は、カスタム​を選択し、ポップアップ入力バーに任意の1文字の区切り記号を入力します。

圧縮ファイルの取り込み

圧縮タイプを指定して、圧縮されたJSONまたは区切りファイルを取り込むこともできます。

​ データを選択手順で、取り込む圧縮ファイルを選択し、そのファイルの種類と、XDMに準拠しているかどうかを選択します。 次に、圧縮タイプ​を選択し、ソースデータに適した圧縮ファイルタイプを選択します。

特定のファイルをExperience Platformに取り込むには、フォルダーを選択し、取り込むファイルを選択します。 この手順では、ファイル名の横にあるプレビューアイコンを使用して、特定のフォルダー内の他のファイルの内容をプレビューすることもできます。

完了したら、次へ​を選択します。

データフローの詳細を入力

​ データフローの詳細 ページでは、既存のデータセットを使用するか、新しいデータセットを使用するかを選択できます。 このプロセスでは、データをプロファイルに取り込むように設定し、​ エラー診断、部分取り込み、​ アラート ​などの設定を有効にすることもできます。

既存のデータセットを使用する

既存のデータセットにデータを取り込むには、既存のデータセット​を選択します。 詳細検索 オプションを使用するか、ドロップダウンメニューで既存のデータセットのリストをスクロールして、既存のデータセットを取得できます。 データセットを選択したら、データフローの名前と説明を入力します。

新しいデータセットの使用

新しいデータセットに取り込むには、新しいデータセット​を選択し、出力データセット名とオプションの説明を指定します。 次に、詳細検索 オプションを使用するか、ドロップダウンメニューで既存のスキーマのリストをスクロールして、マッピングするスキーマを選択します。 スキーマを選択したら、データフローの名前と説明を指定します。

プロファイルとエラー診断の有効化

次に、「プロファイルデータセット」トグルを選択して、プロファイルのデータセットを有効にします。 これにより、エンティティの属性と動作の全体像を把握できます。 プロファイルが有効なすべてのデータセットのデータはプロファイルに含まれ、データフローを保存すると変更が適用されます。

​ エラー診断を使用すると、データフロー内で発生する誤ったレコードに対して詳細なエラーメッセージを生成できます。また、部分取り込みを使用すると、エラーを含むデータを手動で定義した一定のしきい値まで取り込むことができます。 詳しくは、バッチ取り込みの概要を参照してください。

アラートの有効化

アラートを有効にすると、データフローのステータスに関する通知を受け取ることができます。 リストからアラートを選択して、データフローのステータスに関する通知を受け取るよう登録します。 アラートについて詳しくは、UI を使用したソースアラートの購読についてのガイドを参照してください。

データフローへの詳細の提供が完了したら、次へ​を選択します。

XDM スキーマへのデータフィールドのマッピング

​ マッピング ​手順が表示され、ソーススキーマのソースフィールドをターゲットスキーマの適切なターゲット XDM フィールドにマッピングするためのインターフェイスが表示されます。

Experience Platformでは、選択したターゲットスキーマまたはデータセットに基づいて、自動マッピングされたフィールドに関するインテリジェントな推奨事項が提供されます。 マッピングルールは、ユースケースに合わせて手動で調整できます。 必要に応じて、フィールドを直接マッピングするか、データ準備機能を使用してソースデータを変換して計算値を導き出すかを選択できます。 マッパーインターフェイスと計算フィールドの使用に関する包括的な手順については、​ データ準備UI ガイド ​を参照してください。

ソースデータが正常にマッピングされたら、次へ​を選択します。

取り込み実行のスケジュール

IMPORTANT
FTP ソース ​を使用する場合は、データフローを1回取り込むようにスケジュールすることを強くお勧めします。

​ スケジューリング ​手順が表示され、設定されたマッピングを使用して、選択したソースデータを自動的に取り込むように取り込みスケジュールを設定できます。 デフォルトでは、スケジュールはOnceに設定されています。 取り込み頻度を調整するには、頻度​を選択し、ドロップダウンメニューからオプションを選択します。

TIP
インターバルとバックフィルは、1回限りの取り込み中には表示されません。

​ スケジュール ​

取り込み頻度をMinuteHourDay、またはWeekに設定する場合は、取り込みごとに設定された時間枠を確立するための間隔を設定する必要があります。 例えば、取り込み頻度がDayに設定され、間隔が15に設定されている場合、データフローは15日ごとにデータを取り込むようにスケジュールされています。

この手順では、バックフィル​を有効にし、データの増分取り込み用の列を定義することもできます。 バックフィルは履歴データの取り込みに使用され、増分取り込みのために定義した列では、新しいデータを既存のデータと区別できます。

スケジュール設定について詳しくは、次の表を参照してください。

スケジュール設定
説明
頻度

データフローを実行する頻度を指定する頻度を設定します。 頻度は次のように設定できます。

  • 1回:1回限りの取り込みを作成するには、頻度をonceに設定します。 1回限りの取り込みデータフローを作成する場合、間隔とバックフィルの設定は使用できません。 デフォルトでは、スケジュール頻度は1回に設定されます。
  • :1分ごとにデータフローを取り込むようにスケジュールする頻度をminuteに設定します。
  • 時間:1時間ごとにデータを取り込むようにデータフローをスケジュールする頻度をhourに設定します。
  • : 1日ごとにデータフローを取り込むようにスケジュールする頻度をdayに設定します。
  • :週ごとにデータフローを取り込むようにスケジュールする頻度をweekに設定します。
間隔

頻度を選択したら、インターバル設定を設定して、取り込みごとに時間枠を設定できます。 例えば、頻度を1日に設定し、間隔を15に設定した場合、データフローは15日ごとに実行されます。 間隔を0に設定することはできません。 各周波数に対して許容される最小区間値は次のとおりです。

  • 1回:なし
  • : 15
  • 時間: 1
  • : 1
  • : 1
開始時間
予測された実行のタイムスタンプ。UTC タイムゾーンで表示されます。
バックフィル
バックフィルによって、最初に取り込むデータが決まります。 バックフィルが有効になっている場合、指定したパス内のすべての現在のファイルが、最初のスケジュールされた取り込み中に取り込まれます。 バックフィルが無効になっている場合、取り込みの最初の実行時から開始時までの間に読み込まれたファイルのみが取り込まれます。 開始時刻より前に読み込まれたファイルは取り込まれません。
NOTE
バッチ取り込みの場合、その後のデータフローでは、ソースから取り込まれるファイルが​ 最終変更日 ​のタイムスタンプに基づいて選択されます。 つまり、バッチデータフローでは、ソースから、新しいファイルまたは最後のフロー実行以降に変更されたファイルを選択します。 さらに、スケジュールされたフロー実行時間以前にクラウドストレージアカウントに完全にアップロードされていないファイルが取り込まれない可能性があるため、ファイルのアップロードとスケジュールされたフロー実行の間に十分な時間があることを確認する必要があります。

取り込みスケジュールの設定が完了したら、次へ​を選択します。

データフローのレビュー

レビュー​手順が表示され、新しいデータフローを作成する前に確認できます。 詳細は、次のカテゴリに分類されます。

  • 接続:ソースのタイプ、選択したソースファイルの関連パスおよびそのソースファイル内の列の数を表示します。
  • データセットの割り当てとフィールドのマッピング:ソースデータがどのデータセットに取り込まれるかを、そのデータセットが準拠するスキーマを含めて表示します。
  • スケジュール:取り込みスケジュールのアクティブな期間、頻度、間隔を表示します。

データフローをレビューしたら、終了​をクリックし、データフローの作成に時間を割いてください。

次の手順

このチュートリアルでは、外部クラウドストレージからデータを取り込むためのデータフローを正常に作成し、データセットのモニタリングに関するinsightを取得しました。 データフローの作成について詳しくは、以下のビデオを見て学習を補うことができます。 さらに、受信データは、Real-Time Customer ProfileやData Science Workspaceなどの下流Experience Platform サービスで使用できるようになりました。 詳しくは、次のドキュメントを参照してください。

WARNING
次のビデオに示す Experience Platform UI は旧式のものです。 最新の UI のスクリーンショットと機能については、上記のドキュメントを参照してください。

付録

次の節では、ソースコネクタの操作に関する追加情報を示します。

データフローの監視

データフローを作成したら、そのデータフローを通じて取り込まれるデータを監視し、取り込み率、成功、エラーに関する情報を表示できます。 データフローの監視方法について詳しくは、UIでのアカウントとデータフローの監視に関するチュートリアル ​を参照してください。

データフローの更新

データフローのスケジュール設定、マッピングおよび一般情報の設定を更新するには、UIでのソースデータフローの更新に関するチュートリアルを参照してください

データフローの削除

データフロー ワークスペースで使用できる​ 削除 ​関数を使用して、不要になった、または誤って作成されたデータフローを削除できます。 データフローの削除方法について詳しくは、UIでのデータフローの削除に関するチュートリアルを参照してください。

recommendation-more-help
experience-platform-help-sources