[레거시]{class="badge informative"}

개인화된 최적화 모델 personalized-optimization-model

TIP
Adobe Journey Optimizer의 새로운 의사 결정 기능인 [결정]을 이제 코드 기반 경험 및 이메일 채널을 통해 사용할 수 있습니다. 의사 결정에 대해 자세히 알아보기

개인화된 최적화를 통해 감독 머신 러닝 및 딥 러닝에서 최신 기술을 활용함으로써 비즈니스 사용자(마케터)는 비즈니스 목표를 정의하고 고객 데이터를 활용하여 비즈니스 지향 모델을 교육하여 개인화된 오퍼를 제공하고 KPI를 극대화할 수 있습니다.

각 오퍼의 글로벌 성과를 기반으로 최적화하는 비개인화 등급과 달리, 개인화된 최적화는 개별 고객의 속성과 해당 고객을 위해 선택한 KPI를 유도할 가능성이 가장 높은 오퍼 간의 관계를 학습합니다. 그 결과 모든 사용자에게 제공되는 하나의 최상의 오퍼가 아니라 각 프로필에 맞게 조정된 오퍼 선택이 이루어집니다.

개인화된 최적화 모델 애니메이션

사용 사례 및 이점 use-cases

개인화된 최적화는 다양한 고객이 사용 가능한 오퍼에 다르게 반응하고 오퍼 카탈로그가 의미있게 차별화되고 자주 변경되지 않는 의사 결정 시나리오에 적합합니다. 일반적인 사용 사례는 다음과 같습니다.

  • 다음 오퍼 선택: 각 고객에게 실시간으로 제공할 여러 경쟁 오퍼 또는 프로모션 중 하나를 선택합니다.
  • 콘텐츠 개인화: 웹, 모바일, 이메일 및 기타 채널에서 각 고객에 대한 콘텐츠(예: 배너, 크리에이티브) 또는 메시지 선택
  • 대상 인식 개인화: 권장 사항이 고객의 신원과 상호 작용의 컨텍스트를 반영하도록 대상 멤버십 및 컨텍스트 신호를 통합합니다.
  • 수익 및 가치 최적화: 클릭 수 및 전환 수와 같은 이진 결과뿐만 아니라 수익 또는 고객 생애 가치와 같은 지속적인 결과를 최적화합니다.

컨트롤 패널에서 제공되는 주요 이점은 다음과 같습니다.

  • 글로벌 최적 오퍼가 아닌 각 고객이 응답할 가능성이 가장 높은 오퍼를 제공하여 선택하는 비즈니스 KPI를 극대화합니다.
  • 새로운 상호 작용 데이터가 도착하면 지속적으로 적응하여 테스트되지 않은 오퍼에 대한 탐색과 검증된 수행자의 활용 사이에서 균형을 맞춥니다.
  • AI 모델 공식 빌더 표현식에서 직접 사용할 수 있는 등급 점수로 이진 및 연속 최적화 지표를 모두 지원합니다.
  • 고객 맞춤 오퍼를 자동으로 학습하여 A/B 테스트 및 규칙 작성의 수작업 부담을 줄여줍니다.

데이터 세트 요구 사항 dataset

개인화된 최적화 모델을 교육하려면, 지난 30일 이내에 데이터 세트에 250개 이상의 디스플레이 이벤트(예: 노출 횟수)와 하나의 성공 이벤트(예: 클릭 또는 전환)가 있는 오퍼가 두 개 이상 있어야 합니다.

지난 30일 내에 250개 미만의 표시 이벤트 및/또는 성공 이벤트가 없는 오퍼는 탐색 트래픽에 포함할 수 있습니다. 또한 개인화 트래픽에 포함할 수 있지만 필요한 최소 디스플레이/성공 이벤트를 충족하고 모델을 다시 교육할 때까지 의사 결정에서 예측된 오퍼가 가장 낮은 점수와 동등한 것으로 처리됩니다.

개인화된 최적화 모델이 처음 교육될 때까지 개인화된 최적화 모델을 활용하는 선택 전략 내의 오퍼가 임의로 제공됩니다.

작동 방식 how

이 모델은 오퍼, 사용자 정보 및 컨텍스트 정보 간의 복잡한 기능 상호 작용을 학습하여 최종 사용자에게 개인화된 오퍼를 추천합니다. 피쳐는 모델에 대한 입력입니다.

기능에는 세 가지 유형이 있습니다.

기능 유형
모델에 기능을 추가하는 방법
의사 결정 개체(placementID, activityID, decisionScopeID)
AEP에 전송된 의사 결정 관리 피드백 경험 이벤트의 일부
대상자
순위 AI 모델을 만들 때 0~50개의 대상을 기능으로 추가할 수 있습니다
컨텍스트 데이터
AEP에 전송된 의사 결정 피드백 경험 이벤트의 일부입니다. 스키마에 추가할 수 있는 컨텍스트 데이터: Commerce 세부 정보, 채널 세부 정보, 애플리케이션 세부 정보, 웹 세부 정보, 환경 세부 정보, 장치 세부 정보, placeContext

이 모델에는 다음 두 가지 단계가 있습니다.

  • 오프라인 모델 교육 단계에서는 이전 데이터의 기능 상호 작용을 학습하고 기억하여 모델을 교육합니다.
  • 온라인 추론 단계에서는 모델에서 생성한 실시간 점수를 기반으로 후보 오퍼의 순위가 지정됩니다. 개인화된 최적화는 사용자와 오퍼를 위한 기능을 포함하기 어려운 기존의 협업 필터링 기법과 달리, 딥러닝 기반의 추천 방법으로, 복잡하고 비선형적인 기능 상호 작용 패턴을 포함하고 학습할 수 있다.

이 모델은 이진 변수(예: 클릭 및 전환) 외에도 연속 변수(예: 수입 및 고객 라이프타임 값)의 최적화를 지원합니다. 클릭수와 같은 이진 지표에 대해 예측된 값은 항상 0과 1 사이입니다. 주문 값과 같은 연속 지표에 대한 예측된 값은 항상 0보다 크거나 같은 숫자일 것입니다. 등급 점수는 공식 또는 비교에 사용할 때 두 지표 유형 간에 일관된 비헤이비어를 보장하기 위해 표준화됩니다.

실례가 되는 예 illustrative-example

이진 응답(변환) binary-response

사용자와 오퍼 간의 이전 상호 작용 간소화된 데이터 세트를 고려하십시오. 각 행에는 표시된 오퍼와 충성도 계층 (높음 = 1) 및 고객이 최근 이메일을 열었는지 여부 (예 = 1) 와 고객이 전환했는지 여부 (예 = 1) 의 두 가지 고객 신호가 기록됩니다.

오퍼 A의 경우 두 신호가 모두 일치할 때(높거나 둘 다 낮음) 전환될 가능성이 더 높습니다. 오퍼 B의 경우 충성도 티어에 관계없이 이메일을 열었을 때 전환될 가능성이 더 큽니다. 모델은 학습된 패턴을 기반으로 각 고객의 신호를 기반으로 더 나은 오퍼를 예측할 수 있습니다.

고객 신호를 기반으로 하는 오퍼 A 및 오퍼 B에 대한 이진 변환 응답

그림 1: 강조 표시된 불일치 행에서 신호가 일치하지 않고 변환되지 않으면 오퍼 A가 표시됩니다. 학습된 패턴을 기반으로, 오퍼 B가 다음에 해당 고객에게 더 나은 추천이 될 수 있습니다.

이것이 접근 방식의 본질입니다. 역사적인 기능 상호 작용을 학습하고 기억하며 각 고객에 대한 개인화된 예측을 생성하기 위해 적용합니다.

지속적인 응답(매출) continuous-response

같은 생각은 지속적인 결과로 이어진다. 이 모델은 고객이 전환하는지 여부를 예측하는 대신 각 오퍼 및 고객 세그먼트에 대한 연속적인 값(예상 매출)을 예측하고 해당 예측된 값으로 오퍼의 등급을 지정합니다.

4개 고객 세그먼트 중 2개 오퍼에 대한 예상 매출

그림 2: 4개의 고객 세그먼트 중 2개의 오퍼에 대한 예상 매출액. 이메일을 연 충성도가 높은 고객의 경우 오퍼 A가 가장 많은 매출을 올릴 것으로 예상되며, 이메일을 연 충성도가 낮은 고객의 경우 오퍼 B가 더 강력한 선택입니다. 모델은 모든 고객에게 하나의 규칙을 적용하지 않고 각 세그먼트에 대해 예측값이 가장 높은 오퍼를 선택합니다.

앙상블 모델 구성 요소 ensemble

개인화된 최적화는 앙상블 모델로 제공됩니다. 여러 개의 보완 모델 팔이 함께 실행되며 감독 계층은 각 팔이 받는 라이브 트래픽의 양을 결정합니다. 이 디자인을 통해 시스템은 두 가지 목표를 동시에 추구할 수 있습니다. 즉, 성과가 가장 좋은 학습(탐색)과 성과가 좋은 것으로 이미 알려진 오퍼 제공(악용)입니다.

탐색 및 개발 균형 조정

모든 의사 결정 시스템은 테스트되지 않은 오퍼를 탐색하여 정보를 수집하고 입증된 오퍼를 활용하여 즉시 수익을 극대화할 수 있는 절충안에 직면해 있습니다. 탐색을 위해 너무 적은 트래픽을 예약하면 잠재적 오퍼가 검색되지 않습니다. 이미 수행하고 있는 오퍼에 너무 많은 희생을 예약하면 됩니다. 앙상블은 시간이 지남에 따라 남은 교통량을 더 나은 성능의 개인화된 무기 쪽으로 이동시키면서 최소 탐사 바닥을 잡아 이 균형을 자동으로 관리합니다.

앙상블은 4개의 교통 팔로 구성되어 있습니다.

균일 무작위(탐사대) uniform-random

균일 무작위 팔은 적격 오퍼 중에서 무작위로 고객에게 오퍼를 할당합니다. 어떤 제안도 선호하지 않기 때문에, 그것은 개인화된 팔이 배우는 원자재인 전체 카탈로그에서 고객이 어떻게 반응하는지에 대한 편견 없는 데이터를 생성합니다. 첫 번째 모델이 훈련되기 전에는 유일하게 활성화된 팔이며, 이후에는 최소 탐구장을 계속 유지해 시스템이 계속 학습하도록 한다.

  • 초기화 시: 트래픽의 100%.
  • 첫 번째 성공적인 교육 실행 후: 오퍼당 관찰된 노출 및 전환 이벤트 수에 따라 트래픽의 최소 5~20%, 최대 85%입니다.

신경망(개인화된 팔) neural-network

신경망은 속성 및 대상 멤버십을 기반으로 주어진 고객에게 최상의 오퍼를 예측하는 개인화된 팔입니다. 오퍼, 고객 기능 및 컨텍스트 간의 복잡하고 비선형적인 상호 작용을 학습하며, 다양한 기능에 걸쳐 미묘한 패턴을 캡처하는 데 적합합니다.

  • 초기화 시: 트래픽의 0%.
  • 첫 번째 성공적인 교육 실행 후: 트래픽의 최소 5%, 최대 85%.

컨텍스트 기반 bandit(개인화된 팔) contextual-bandit

상황에 맞는 밴딧은 고객 멤버십을 기반으로 각 고객을 위한 최상의 오퍼를 예측하는 두 번째 개인화된 팔로서, 제공되는 학습과 성능의 균형을 지속적으로 조정하는 밴딧 접근 방식을 사용합니다. 신경망과 함께 실행함으로써 앙상블은 두 가지의 개별적인 개인화된 방법의 장점을 끌어낼 수 있다.

  • 초기화 시: 트래픽의 0%.
  • 첫 번째 성공적인 교육 실행 후: 트래픽의 최소 5%, 최대 85%.

새로운 오퍼 부스터(개인화되지 않은 팔) new-offer-booster

새로운 오퍼 부스터는 모델 전환 확인 기간 내에 기록된 노출 이벤트가 거의 없는 오퍼의 성능에 대한 낙관적인 가정을 하는 전체 우승자인 Thompson 샘플링 bandit (개인화되지 않음)입니다. 이렇게 하면 모델이 충분히 많은 트래픽을 새로운 오퍼 또는 높은 성과를 보이지만 제한적인 혜택을 받는 오퍼로 유도하기 위해 어려움을 겪었던 것으로 알려진 콜드 스타트 단점을 해결하여, 스스로 입증하는 데 필요한 조기 노출을 약속하는 새로운 오퍼를 제공할 수 있습니다.

  • 실제 노출 및 전환 데이터가 수집되면 각 오퍼의 예상 성능은 실제 기본 성능에 빠르게 근접하며 낙관적 가정의 영향은 거의 0에 가깝습니다.
  • 비교적 새로운 오퍼가 없는 경우(예: 모든 오퍼에 유사한 노출 횟수가 있거나 모두 1,000회 이상 노출 횟수 있음), 낙관적 효과는 거의 0에 가깝고 이 팔은 개인화되지 않은 전체 승자 모델로 작동합니다.
  • 초기화 시: 트래픽의 0%.
  • 첫 번째 성공적인 교육 실행 후: 트래픽의 5%.

트래픽이 팔에서 할당되는 방식 traffic-allocation

초기화 시 아직 모델이 훈련되지 않았기 때문에 트래픽의 100%가 일정한 무작위 기준선으로 이동합니다. 이 기준선은 학습된 분포를 가진 유일한 팔입니다. 첫 번째 성공적인 교육 실행 후 각 팔은 최소 트래픽 플로어(5%)를 받고 감독 밴딧은 관찰된 성능을 기반으로 나머지 트래픽을 할당합니다. 모델이 연속적인 라운드를 통과하면서 트래픽은 최대 85%의 트래픽을 할당하여 최고 성능의 무기를 향해 수렴합니다.

연속 교육 라운드에 대한 네 개의 앙상블 팔에 걸친 트래픽 할당

그림 3: 초기화 시 네 개의 앙상블 팔과 연속 교육 라운드에서 가능한 트래픽 할당 궤적입니다. 초기화 시 모든 트래픽은 무작위 기준선으로 흐릅니다. 각 교육 실행 후 감독 Thompson Sampling bandit은 최소 5%의 트래픽을 유지하면서 더 나은 성과를 내는 무기로 할당을 전환합니다. 실제 할당은 관찰된 팔 성능에 따라 달라집니다.

주요 모델 가정 및 제한 사항 key

개인화된 최적화를 사용할 때의 이점을 극대화하기 위해 몇 가지 주요 가정과 알아 두어야 할 제한 사항이 있습니다.

  • 오퍼가 충분히 다르므로 사용자가 고려할 오퍼마다 다른 환경 설정을 사용할 수 있습니다. 오퍼가 너무 유사하면 응답이 무작위로 표시되므로 결과 모델의 영향이 줄어듭니다.
    예를 들어, 은행에 색상이 다른 두 개의 신용 카드 오퍼가 있는 경우 권장되는 카드가 중요하지 않을 수 있지만, 각 카드에 서로 다른 용어가 있는 경우 특정 고객이 하나를 선택하고 오퍼 간에 충분한 차이를 제공하여 보다 효과적인 모델을 구축하는 이유에 대한 근거를 제공합니다.
  • 사용자 트래픽 구성이 안정적입니다. 모델 교육 및 예측 중에 사용자 트래픽 구성이 크게 변경되면 모델 성능이 저하될 수 있습니다. 예를 들어 모델 교육 단계에서 대상 A의 사용자에 대한 데이터만 사용할 수 있지만 교육된 모델은 대상 B의 사용자에 대한 예측을 생성하는 데 사용된다고 가정할 경우 모델 성능에 영향을 줄 수 있습니다.
  • 이 모델이 매주 업데이트되고 모델 업데이트 시 성능 변경 사항이 전달되므로 오퍼 성능이 단기간에 크게 변경되지 않습니다. 예를 들어, 이전에는 제품이 매우 인기 있었지만, 공개 보고서를 통해 해당 제품이 우리 건강에 해롭다는 사실이 확인되어 이 제품이 매우 빠르게 인기 없게 됩니다. 이 시나리오에서는 모델이 사용자 동작의 변경으로 업데이트될 때까지 모델이 이 제품을 계속 예측할 수 있습니다.

콜드-스타트 문제 cold-start

콜드 스타트 문제는 권장 사항을 작성할 데이터가 충분하지 않을 때 발생합니다. 개인화된 최적화를 위해서는 네 가지 유형의 콜드 스타트 문제가 있다.

  • 내역 데이터가 없는 새 AI 모델을 만든 후 일정 기간 동안 오퍼가 임의로 제공되어 필요한 데이터를 수집한 다음 첫 번째 모델을 교육하는 데 사용됩니다.
  • 첫 번째 AI 모델이 출시된 후, 전체 트래픽의 일부는 균일한 무작위 탐색에 할당되고 나머지는 모델 추천에 사용됩니다. 탐색 및 개발 밴딧 구성 요소에 대한 트래픽 분포는 오퍼 수 및 성능 임계값과 같은 요소를 기반으로 자동으로 조정됩니다.
  • 새 오퍼가 오퍼 컬렉션에 추가된 후 AI 등급 모델과 관련된 전략에서 선택한 오퍼는 균일 무작위 및 새 오퍼 부스터 모델 무기(60분 이내)를 모두 사용하여 탐색할 수 있는 적격 후보가 됩니다. 예정된 다음 재교육 실행 중에 오퍼의 예상 성능은 새 오퍼 부스터 모델 팔에서 업데이트되고, 오퍼가 노출 및 클릭 임계값을 충족한 경우 개인화된 모델 팔에 포함될 수 있습니다.
  • AI 등급 모델에 연결된 선택 전략과 연결된 기존 대상자 집합에 새 프로필이 추가되면 대상자 집합 자체에서 개인화 특성을 상속합니다. 따라서 콜드 스타트 문제 없이 처음부터 이러한 속성에 따라 개인화된 오퍼를 받기 시작합니다.

재교육 re-training

모델은 최신 기능 상호 작용을 학습하고 매주 모델 성능 저하를 완화하도록 다시 교육됩니다.

recommendation-more-help
journey-optimizer-help