导出数据集
本文概述如何使用Customer Journey Analytics Export datasets实现以下数据导出用例:
- 数据备份
简介
使用Experience Platform Export datasets导出数据允许您将数据从Customer Journey Analytics数据视图导出到任何云存储目标。
与其他导出方法不同,导出数据集没有固定的行限制。 云存储目标的容量限制了导出大小,因此当您需要数据的完整原始副本时,这成为首选功能。
更多信息
要从Experience Platform中的数据湖导出原始数据集,请使用云存储目标。 在“Experience Platform目标”术语中,此导出称为“数据集导出目标” 。 有关概述,请参阅将数据集导出到云存储目标。
支持以下云存储目标:
EXPERIENCE PLATFORM UI
您可以通过Experience Platform UI导出和计划数据集的导出。 本节介绍所涉及的步骤。
选择目标
确定要将数据集导出到的云存储目标后,选择目标。 如果尚未为首选云存储配置目标,则必须创建新的目标连接。
在配置目标时,您可以定义:
- 文件类型(JSON或Parquet),
- 是否应该压缩结果文件,以及
- 是否应该包含清单文件。
选择数据集
选择目标后,在下一个 选择数据集 步骤中,您必须从数据集列表中选择数据集。 如果您创建了多个计划查询,并且希望将数据集发送到同一云存储目标,则可以选择相应的数据集。 有关详细信息,请参阅选择您的数据集。
计划数据集导出
最后,将您的数据集导出计划为 计划 步骤的一部分。 在该步骤中,定义计划以及数据集导出是否为增量导出。 有关详细信息,请参阅计划数据集导出。
最后步骤
审核您的选择,如果正确,则开始将数据集导出到云存储目标。
首先,您必须验证数据导出是否成功。 导出数据集时,Experience Platform会在目标存储位置创建一个或多个.json或.parquet文件。 根据您设置的导出计划,希望将新文件存储在您的存储位置。 Experience Platform会在您指定为选定目标一部分的存储位置中创建一个文件夹结构,用于存储导出的文件。 每次导出时都会创建一个新文件夹,其模式为: folder-name-you-provided/datasetID/exportTime=YYYYMMDDHHMM。 默认文件名是随机生成的,并确保导出的文件名是唯一的。
流服务API
或者,您可以使用API导出和计划数据集的导出。 使用流服务API🔗在导出数据集中记录了所涉及的步骤。
快速入门
要导出数据集,请确保您具有所需的权限。 还要验证目标是否支持导出数据集。 您可以将数据集发送到此目标。 然后,您必须收集在API调用中使用的必需和可选标头的值。 您还需要识别要将数据集导出到的目标的连接规范和流规范ID。
检索符合条件的数据集
您可以检索符合条件的数据集列表以供导出,并使用GET /connectionSpecs/{id}/configs API验证您的数据集是否属于该列表。
创建源连接
接下来,您必须使用要导出到云存储目标的数据集的唯一ID 为数据集创建源连接。 您使用POST /sourceConnections API。
向目标进行身份验证(创建基本连接)
要验证凭据并安全地存储到您的云存储目标,🔗使用POST /targetConnection API创建基本连接。
提供导出参数
接下来,您必须🔗创建其他目标连接,以便使用POST /targetConnection API存储数据集的导出参数。 这些导出参数包括位置、文件格式、压缩等。
设置数据流
为确保您的数据集导出到云存储目标,请🔗使用POST /flows API设置数据流。 在此步骤中,您可以使用scheduleParams参数定义导出的计划。
验证数据流
要检查数据流是否成功执行,请使用GET /runs API,将数据流ID指定为查询参数。 此数据流ID是您在设置数据流时返回的标识符。
验证数据导出是否成功。 导出数据集时,Experience Platform会在目标存储位置创建一个或多个.json或.parquet文件。 根据您设置的导出计划,希望将新文件存储在您的存储位置。 Experience Platform会在您指定为选定目标一部分的存储位置中创建一个文件夹结构,用于存储导出的文件。 每次导出时都会创建一个新文件夹,其模式为: folder-name-you-provided/datasetID/exportTime=YYYYMMDDHHMM。 默认文件名是随机生成的,并确保导出的文件名是唯一的。