Modèle d’optimisation personnalisé personalized-optimization-model

Sur cette page : découvrez comment le modèle d’optimisation personnalisé utilise le machine learning pour apprendre à partir des données client, des données des offres et des données contextuelles, y compris ses cas d’utilisation, les composants de modèle d’ensemble, les exigences des jeux de données, les hypothèses et le comportement de démarrage à froid, afin de déterminer quand l’utiliser pour diffuser des offres personnalisées et optimiser vos KPI.

En tirant parti des technologies de pointe en matière de machine learning et de deep learning supervisés, l’optimisation personnalisée permet aux professionnels (responsables marketing) de définir des objectifs métiers et d’utiliser leurs données client pour entraîner des modèles orientés métier afin de diffuser des offres personnalisées et d’optimiser les KPI.

Contrairement au classement non personnalisé qui s’optimise en fonction des performances globales de chaque offre, l’optimisation personnalisée apprend la relation entre les attributs d’un client ou d’une cliente et les offres les plus susceptibles d’améliorer le KPI sélectionné pour cet individu. Elle permet ainsi de sélectionner des offres adaptées à chaque profil plutôt qu’une seule meilleure offre proposée à tout le monde.

Cas d’utilisation et avantages use-cases

L’optimisation personnalisée convient particulièrement aux scénarios de prise de décision où les clients et clientes réagissent différemment aux offres disponibles et où le catalogue d’offres est bien différencié et ne change pas souvent. Les cas d’utilisation les plus courants sont les suivants :

  • Sélection de la meilleure offre suivante : choisir quelle offre ou promotion concurrentes présenter à chaque client ou cliente en temps réel.
  • Personnalisation du contenu : choisir le contenu (par exemple, bannière, contenu créatif) ou le message pour chaque client ou client sur le canal web, appareil mobile, e-mail, etc.
  • Personnalisation tenant compte de l’audience : intégrer l’appartenance à l’audience et les signaux contextuels afin que les recommandations reflètent le profil du client ou de la cliente ainsi que le contexte de l’interaction.
  • Optimisation du chiffre d’affaires et de la valeur : optimiser des résultats continus tels que le chiffre d’affaires ou la valeur durée de vie client, en plus des résultats binaires tels que les clics et les conversions.

Principaux avantages :

  • Optimise les KPI métier que vous sélectionnez en diffusant l’offre à laquelle chaque client et cliente est le plus susceptible de répondre, plutôt qu’une seule offre optimale pour tout le monde.
  • S’adapte à mesure que de nouvelles données d’interaction arrivent,en équilibrant l’exploration d’offres sous-testées et l’exploitation d’offres déjà performantes.
  • Prend en charge les mesures d’optimisation binaires et continues, avec des scores de classement qui peuvent être utilisés directement dans les expressions du créateur de formules du modèle d’IA.
  • Réduit l’effort manuel pour les tests A/B et la création de règles en apprenant automatiquement quelles offrent correspondent le mieux à quelles personnes.

Exigences relatives aux jeux de données dataset

Pour entraîner un modèle d’optimisation personnalisé, le jeu de données doit comporter au moins deux offres avec au moins 250 événements d’affichage (par exemple, des impressions) et un événement de succès (par exemple, un clic ou une conversion) au cours des 30 derniers jours.

Les offres comportant moins de 250 événements d’affichage et/ou aucun événement de succès au cours des 30 derniers jours peuvent toujours être incluses dans le trafic d’exploration. Elles pourront également être incluses dans le trafic de personnalisation, mais seront traitées comme équivalentes à l’offre prédite de pire score dans la prise de décision, jusqu’à ce qu’elles atteignent les seuils minimaux requis d’événements d’affichage/de succès et que le modèle soit à nouveau entraîné.

Jusqu’au premier entraînement d’un modèle d’optimisation personnalisé, les offres d’une stratégie de sélection utilisant un modèle d’optimisation personnalisé sont diffusées de manière aléatoire.

Fonctionnement how

Le modèle apprend les interactions de fonctionnalités complexes entre les offres, les informations des utilisateurs et utilisatrices, ainsi que les informations contextuelles afin de recommander des offres personnalisées aux utilisateurs et utilisatrices finaux/finales. Les fonctionnalités sont des entrées dans le modèle.

Il existe trois types de fonctionnalités :

Types de fonctionnalités
Comment ajouter des fonctionnalités aux modèles
Objets de prise de décision (placementID, activityID, decisionScopeID)
Partie des événements d’expérience des commentaires sur la gestion des décisions envoyés à AEP
Audiences
Il est possible d’ajouter de 0 à 50 audiences en tant que fonctionnalités lors de la création du modèle d’IA dédiée au classement
Données contextuelles
Partie des événements d’expérience des commentaires sur la prise de décisions envoyés à AEP. Données contextuelles disponibles à ajouter au schéma : Détails du commerce, Détails du canal, Détails de l’application, Détails web, Détails de l’environnement, Détails de l’appareil, placeContext

Le modèle comporte deux phases :

  • Dans la phase d’entraînement de modèle hors ligne, un modèle est entraîné en apprenant et en mémorisant les interactions de fonctionnalités dans les données historiques.
  • Dans la phase d’inférence en ligne, les offres des candidats sont classées en fonction des scores en temps réel générés par le modèle. Contrairement aux techniques de filtrage collaboratif traditionnelles, pour lesquelles il est difficile d’inclure des caractéristiques relatives aux utilisateurs et utilisatrices et aux offres, l’optimisation personnalisée est une méthode de recommandation basée sur le deep learning qui permet d’inclure et d’apprendre des modèles d’interaction complexes et non linéaires entre les caractéristiques.

Le modèle prend en charge l’optimisation des variables continues (telles que le chiffre d’affaires et la valeur durée de vie client) en plus des variables binaires (telles que les clics et les conversions). Les valeurs prévues pour une mesure binaire telle que les clics seront toujours comprises entre 0 et 1. Les valeurs prévues pour une mesure continue telle que la valeur de commande seront toujours un nombre supérieur ou égal à zéro. Les scores de classement sont normalisés afin de garantir un comportement cohérent sur les deux types de mesures lorsqu’ils sont utilisés dans des formules ou des comparaisons.

Exemple illustrative-example

Réponse binaire (conversion) binary-response

Prenons un jeu de données simplifié d’interactions historiques entre les utilisateurs et utilisatrices et les offres. Chaque ligne enregistre une offre qui a été affichée, deux signaux client — niveau de fidélité (élevé = 1) et si la personne a ouvert un e-mail récent (oui = 1) — et si elle a converti (oui = 1).

Pour l’offre A, la conversion est plus probable lorsque les deux signaux concordent (tous les deux élevés ou tous les deux faibles). Pour l’offre B, la conversion est plus probable à l’ouverture de l’e-mail, quel que soit le niveau de fidélité. En fonction du modèle appris, le modèle peut prédire la meilleure offre pour chaque client et cliente en fonction de ces signaux.

Réponses de conversion binaires pour les offres A et B en fonction des signaux du client ou de la cliente

Figure 1 : sur la ligne de non-correspondance mise en surbrillance, l’offre A était affichée lorsque les signaux ne concordaient pas et qu’il n’y avait pas de conversion. Selon le modèle appris, l’offre B constitue la meilleure recommandation pour cette personne la prochaine fois.

C’est l’essence même de cette approche : apprendre et mémoriser les interactions des caractéristiques historiques et les appliquer pour générer des prédictions personnalisées pour chaque client et chaque cliente.

Réponse continue (chiffre d’affaires) continuous-response

La même idée s’applique aux résultats continus. Au lieu de prévoir si la personne effectuera une conversion, le modèle prédit une valeur continue (chiffre d’affaires attendu) pour chaque offre et segment client et classe les offres en fonction de cette estimation.

Chiffre d’affaires prévu pour deux offres sur quatre segments de clients et clientes

Figure 2 : chiffre d’affaires prévu pour deux offres sur quatre segments de clients et clientes. Pour les clients et clientes hautement fidèles qui ont ouvert l’e-mail, l’offre A est censée générer plus de chiffre d’affaire ; pour les clients et clientes peu fidèles qui ont ouvert l’e-mail, l’offre B constitue la meilleure option. Le modèle sélectionne l’offre avec l’estimation la plus élevée pour chaque segment plutôt que d’appliquer la même règle à tout le monde.

Composants de modèle d’ensemble ensemble

L’optimisation personnalisée est fournie sous la forme d’un modèle d’ensemble : plusieurs composants de modèle complémentaires s’exécutent en même temps, et une couche de supervision décide de la quantité de trafic réel que chaque composant reçoit. Cette conception permet au système de poursuivre deux objectifs : apprendre quelles offres sont les plus performantes (exploration) et diffuser les offres déjà performantes (exploitation).

Équilibre entre exploration et exploitation

Tout système de prise de décision doit trouver un compromis entre l’exploration des offres peu testées pour collecter des informations et l’exploitation des offres déjà performantes pour maximiser le retour immédiat. Le fait de réserver trop peu de trafic pour l’exploration ne permet pas de découvrir des offres à fort potentiel. Le fait de réserver trop de sacrifices augmente les offres déjà performantes. L’ensemble gère cet équilibre automatiquement en maintenant un niveau d’exploration minimal tout en orientant progressivement le trafic restant vers les composants personnalisés les plus performants.

L’ensemble est composé de quatre composants de trafic :

Aléatoire uniforme (composant d’exploration) uniform-random

Le composant aléatoire uniforme attribue des offres aux clients et clientes de manière aléatoire parmi les offres éligibles. Comme il ne favorise aucune offre, il produit des données impartiales sur la façon dont les clients et clientes réagissent à l’ensemble du catalogue ; la matière première à partir de laquelle les composants personnalisés apprennent. Il s’agit du seul composant actif avant l’entraînement du premier modèle. Il continue ensuite à maintenir un niveau d’exploration minimal afin que le système continue à apprendre.

  • À l’initialisation : 100 % du trafic.
  • Après la première exécution réussie de l’apprentissage : un minimum de 5 à 20 % du trafic en fonction du nombre d’événements d’impression et de conversion observés par offre, jusqu’à un maximum de 85 %.

Réseau neuronal (composant personnalisé) neural-network

Le réseau neuronal est un composant personnalisé qui prédit la meilleure offre pour une personne donnée en fonction de ses attributs et des appartenances aux audiences. Il apprend les interactions complexes et non linéaires entre les offres, les caractéristiques du client ou de la cliente et le contexte. Il convient particulièrement pour identifier des tendances subtiles parmi de nombreuses caractéristiques.

  • À l’initialisation : 0 % du trafic.
  • Après la première exécution d’entraînement réussie : un minimum de 5 % du trafic, jusqu’à un maximum de 85 %.

Bandit contextuel (composant personnalisé) contextual-bandit

Le bandit contextuel est un autre composant personnalisé qui prédit également la meilleure offre pour chaque client et chaque cliente en fonction de l’appartenance à l’audience, à l’aide d’une approche de bandit qui équilibre continuellement l’apprentissage et les performances. Combiné avec le réseau neuronal, il permet à l’ensemble de tirer parti du potentiel de deux méthodes de personnalisation distinctes.

  • À l’initialisation : 0 % du trafic.
  • Après la première exécution d’entraînement réussie : un minimum de 5 % du trafic, jusqu’à un maximum de 85 %.

Nouveau booster d’offre (composant non personnalisé) new-offer-booster

Le nouveau booster d’offre est un bandit d’échantillonnage de Thompson gagnant-gagnant (non personnalisé) qui émet des hypothèses optimistes sur les performances des nouvelles offres, c’est-à-dire celles qui présentent peu d’événements d’impression enregistrés au cours de la période analysée par le modèle. Cela permet aux nouvelles offres prometteuses de bénéficier de l’exposition initiale dont elles ont besoin pour faire leurs preuves, en comblant une lacune connue de démarrage à froid. Sans cela, le modèle avait du mal à attribuer suffisamment de trafic aux nouvelles offres et aux offres très performantes mais dont l’éligibilité était limitée.

  • À mesure que les données réelles d’affichage et de conversion sont collectées, les performances estimées de chaque offre se rapprochent rapidement des performances réelles sous-jacentes et l’impact des hypothèses optimistes tend vers zéro.
  • Lorsqu’aucune offre n’est relativement nouvelle (par exemple, lorsque toutes les offres ont un nombre d’impressions similaire ou ont toutes plus de 1 000 impressions), l’effet optimiste est proche de zéro et ce composant se comporte comme un modèle gagnant-gagnant non personnalisé.
  • À l’initialisation : 0 % du trafic.
  • Après la première exécution d’entraînement réussie : 5 % du trafic.

Répartition du trafic entre les composants traffic-allocation

Aucun modèle n’est entraîné à l’initialisation, de sorte que 100 % du trafic va à la ligne de base aléatoire uniforme, qui constitue le seul composant avec une distribution apprise à partir de laquelle effectuer un échantillonnage. Après la première exécution d’entraînement réussie, chaque composant reçoit un niveau minimal de trafic (5 %), et le bandit de supervision alloue le trafic restant en fonction des performances observées. À mesure que le modèle s’entraîne avec des cycles successifs, le trafic converge vers les composants les plus performants avec une attribution maximale possible de 85 % du trafic.

Répartition du trafic entre les quatre composants d’ensemble au cours de cycles d’entraînement successifs

Figure 3 : une trajectoire possible de répartition du trafic entre les quatre composants d’ensemble à l’initialisation et entre les cycles d’entraînement successifs. À l’initialisation, tout le trafic circule vers la ligne de base aléatoire. Après chaque exécution d’entraînement, le bandit d’échantillonnage de Thompson superviseur ajuste l’allocation en faveur des variantes les plus performantes, tout en maintenant un trafic minimum de 5 %. L’allocation réelle varie en fonction des performances observées des variantes.

Principales hypothèses et limites du modèle key

Afin de tirer pleinement parti de l’utilisation de l’optimisation personnalisée, il existe certaines hypothèses et limites clés à connaître.

  • Les offres sont suffisamment différentes pour que les utilisateurs aient des préférences différentes parmi les offres prises en compte. Si les offres sont trop similaires, le modèle obtenu a moins d’impact, car les réponses semblent aléatoires.
    Par exemple, si une banque propose deux offres de cartes bancaires dont la seule différence est la couleur, la carte conseillée n’a pas d’importance. Par contre, si chaque carte comporte des conditions différentes, cela explique pourquoi certains clients ou clientes en choisissent une, et cela fournit suffisamment de différence entre les offres pour créer un modèle plus performant.
  • La composition du trafic utilisateur est stable. Si la composition du trafic utilisateur change considérablement au cours de l’entraînement et de la prédiction du modèle, les performances de ce dernier peuvent se dégrader. Supposons, par exemple, que, lors de la phase d’entraînement du modèle, seules les données pour les utilisateurs et utilisatrices de l’audience A soient disponibles, mais que le modèle entraîné soit utilisé pour générer des prédictions pour les utilisateurs et utilisatrices de l’audience B, les performances du modèle pourraient alors être affectées.
  • Les performances des offres ne changent pas considérablement sur une courte période lorsque ce modèle est mis à jour chaque semaine et que les modifications apportées aux performances sont répercutées lors des mises à jour du modèle. Par exemple, un produit était très populaire auparavant, mais un rapport public identifie le produit comme nocif pour notre santé, et ce produit devient impopulaire extrêmement rapidement. Dans ce scénario, le modèle peut continuer à prédire ce produit jusqu’à ce que le modèle se mette à jour avec les changements de comportement de l’utilisateur.

Problème du démarrage à froid cold-start

Des problèmes de démarrage à froid se produisent lorsqu’il n’y a pas assez de données pour faire une recommandation. Pour l’optimisation personnalisée, il existe quatre types de problèmes de démarrage à froid.

  • Après avoir créé un nouveau modèle d’IA sans données historiques, les offres seront diffusées de manière aléatoire pendant une période afin de collecter les données requises, qui seront ensuite utilisées pour entraîner le premier modèle.
  • Une fois le premier modèle d’IA publié une partie du trafic total est allouée à une exploration aléatoire uniforme, tandis que le reste est utilisé pour les recommandations de modèle. La répartition du trafic sur les composants de bandit d’exploration et d’exploitation est automatiquement ajustée en fonction de facteurs tels que le nombre d’offres et leurs seuils de performances.
  • Une fois que de nouvelles offres ont été ajoutées à la collection d’offres sélectionnées dans la stratégie associée au modèle de classement IA, ces offres deviennent des candidats éligibles à l’exploration par les deux bras de modèle de rappel aléatoire uniforme et nouveau (dans un délai de 60 minutes). Lors du prochain cycle de réentraînement planifié, les performances estimées de l’offre seront mises à jour dans la nouvelle variante de modèle de rappel de l’offre et l’offre pourra être incluse dans les variantes de modèle personnalisées si elle a atteint le seuil d’impressions et de clics.
  • Une fois que de nouveaux profils sont ajoutés au jeu d’audiences existant associé à la stratégie de sélection liée au modèle de classement par IA, ils héritent des attributs de personnalisation du jeu d’audiences lui-même. Par conséquent, ils commenceront à recevoir des offres personnalisées basées sur ces attributs dès le départ, sans problème de démarrage à froid.

Nouvel entraînement re-training

Les modèles seront entraînés de nouveau afin d’apprendre les dernières interactions de fonctionnalités et d’atténuer chaque semaine la dégradation des performances de ceux-ci. Pour surveiller le statut de l’entraînement et les performances du modèle, consultez Surveillance de modèle d’IA.

recommendation-more-help
journey-optimizer-help