Comment construire une segmentation client utile ?

Questions d’entrevue Apprentissage non supervisé

Seniorsegmentationmetierclustering

C’est la question la plus révélatrice sur ce sujet, parce que l’échec typique n’est pas technique : la segmentation est correcte, personne ne s’en sert.

Partir de la décision, pas des données

La première question à poser au commanditaire : qu’allez-vous faire différemment selon le groupe ? Sans réponse, il n’y a pas de projet. Avec une réponse, elle détermine tout le reste :

  • adresser des messages différents — il faut des groupes qui diffèrent par leurs centres d’intérêt ;
  • ajuster les remises — il faut des groupes qui diffèrent par leur sensibilité au prix ;
  • prévenir la résiliation — il ne faut pas une segmentation mais un modèle supervisé de risque de départ, ce qu’il faut savoir dire.

Cette question détermine aussi le nombre de groupes : une équipe qui peut concevoir cinq campagnes a besoin de cinq groupes, pas de dix-sept.

Les variables

C’est là que se joue la qualité, bien avant l’algorithme. Le cadre récence-fréquence-montant reste la meilleure base sur des données transactionnelles, à enrichir de ce qui décrit un comportement : diversité des catégories achetées, part des achats en promotion, canal utilisé, régularité, ancienneté.

Trois précautions :

  • Écarter ce qui n’est pas actionnable. Segmenter sur des variables qu’on ne peut pas influencer produit une description, pas un levier.
  • Traiter l’asymétrie. Les montants et les fréquences ont des queues très longues ; sans passage au logarithme, quelques très gros clients dictent la géométrie entière et forment un groupe d’une personne.
  • Fixer la fenêtre temporelle, et la même pour tout le monde. Un client acquis le mois dernier et un client de dix ans n’ont pas des historiques comparables : il faut soit une fenêtre glissante, soit un traitement à part des nouveaux clients.

L’algorithme, et le reste du travail

k-means sur des variables normalisées et dé-asymétrisées suffit dans la grande majorité des cas. Ce qui vient après compte davantage :

Profiler chaque groupe. Moyenne de chaque variable dans le groupe, et écart à la moyenne générale. Un groupe se décrit alors en une phrase : « achète peu souvent, mais des paniers élevés, presque jamais en promotion ».

Le nommer. Si l’équipe métier ne parvient pas à nommer un groupe, il n’existera pas dans les décisions. Et si deux groupes se racontent de la même façon, il y en a un de trop.

Le valider sur une variable non utilisée. C’est le test qui convainc : segmenter sur le comportement d’achat, puis montrer que les taux de résiliation ou les marges diffèrent nettement entre groupes. La structure porte alors une information réelle, pas une découpe arbitraire.

Le mesurer par un essai. Deux campagnes, l’une segmentée, l’autre non, et un écart mesuré. C’est la seule preuve de valeur.

La contrainte qu’on oublie toujours

Une segmentation vit dans le temps. Les clients changent de groupe, et si les affectations basculent tous les mois, aucune action de long terme n’est possible. Il faut donc décider explicitement de la fréquence de recalcul, et surveiller le taux de migration entre groupes — un client qu’on traite comme « premium » un mois et « occasionnel » le suivant reçoit des messages incohérents, ce qui coûte plus cher que l’absence de segmentation.

Toutes les questions Apprentissage non supervisé