内部爬虫流量和内容请求使用量计算
本文介绍了在使用情况计算中Adobe Experience Manager (AEM) as a Cloud Service如何识别和处理内部爬虫流量,并阐明了已有的排除机制。
描述 description
环境
Adobe Experience Manager as a Cloud Service
问题/症状
使用搜索解决方案的企业可能会运行索引AEM内容的内部爬虫。 这些爬虫可能会产生大量请求,这些请求可能会出现在流量日志中,并会让人担心它们对可计费使用计算的影响。
原因
内部爬虫通常使用不同的User-Agent字符串和已知的IP范围。 可能有人担心,此类系统到系统流量会被计入可计费的AEMaaCS内容请求,而不是被排除为非用户流量。
解决方法 resolution
要修复有关影响爬虫请求使用情况计算的内部Content Traffic的问题,请执行以下步骤:
- 确保您的内部爬虫使用不同的
User-Agent字符串,如果可能,则从已知的IP范围进行操作。 - 确认爬虫的请求路径与预期的爬虫活动(例如Sitemap驱动的URL)一致。
- 查看AEMaaCS使用报告和流量日志,以识别爬虫流量模式。
- Adobe的内容请求使用情况计算基于发布层流量。 某些已知机器人和系统流量会根据已识别的签名(
User-Agent或IP)从使用计算中排除。 - 仅当内部或客户特定的爬虫与已建立的排除模式匹配时,才会将其从使用计算中排除。 如果爬虫使用可识别的签名,则其流量不计入计费使用量。
- 如果您发现归因于您的爬虫的意外使用情况,请收集相关日志详细信息(如
User-Agent、IP范围和请求路径),并联系Adobe支持以进行进一步审查。
注意:在确认爬虫的签名后,请查看您的使用情况报告,以验证其流量是否从可计费内容请求计数中排除。
recommendation-more-help
experience-cloud-kcs-help-kbarticles