Comment détectez-vous des anomalies sans étiquettes ?

Questions d’entrevue Apprentissage non supervisé

Senioranomaliesevaluation

Le principe commun à toutes les méthodes : on modélise ce qui est normal, et l’anomalie est ce qui s’en écarte. Puisqu’il n’y a pas d’étiquette, on ne peut pas apprendre ce qu’est une anomalie — seulement ce qu’elle n’est pas.

Les quatre familles

Statistique, une variable à la fois. Score z, écart interquartile, quantiles extrêmes. Rudimentaire, et il faut le mentionner en premier parce qu’il traite une bonne part des cas réels pour un coût nul. Sa limite : il ne voit pas les anomalies combinées — une transaction de 50 euros n’a rien d’étrange, à 4 heures du matin depuis un autre pays non plus, la combinaison des trois oui.

Par isolation. L’Isolation Forest découpe l’espace au hasard et mesure combien de coupures sont nécessaires pour isoler chaque point. Un point atypique est isolé vite. Rapide, il supporte la grande dimension, et c’est le choix par défaut sur données tabulaires.

Par densité. Le facteur d’aberration local (LOF) compare la densité autour d’un point à celle autour de ses voisins. Il détecte les anomalies locales — un point normal dans l’absolu mais anormal dans son voisinage — ce que l’Isolation Forest rate. Coûteux, et sensible à la malédiction de la dimension.

Par reconstruction. On entraîne un auto-encodeur à reconstruire les données normales ; l’erreur de reconstruction devient le score d’anomalie. C’est ce qui traite les données complexes — images, signaux, séquences — et cela suppose un volume d’entraînement conséquent.

À part, le SVM à une classe, qui apprend une frontière enveloppant les données normales. Élégant, sensible à ses paramètres, et généralement dominé par l’Isolation Forest en pratique tabulaire.

La vraie difficulté : le seuil

Tous ces algorithmes produisent un score, pas une décision. Le seuil doit venir d’ailleurs, et c’est là que se joue l’utilité du système :

  • par capacité — les analystes traitent deux cents dossiers par jour, on leur envoie les deux cents plus élevés. C’est presque toujours la bonne réponse en entreprise ;
  • par taux de contamination attendu, si le métier sait estimer la proportion d’anomalies ;
  • par coût, quand on peut chiffrer une fausse alerte et une anomalie manquée.

Comment on évalue, puisqu’il n’y a pas de vérité

C’est la question qui suit toujours, et la réponse est un enchaînement :

  1. Faire étiqueter les cas signalés. Une revue humaine de quelques centaines d’alertes donne la précision dans le haut du classement — mesurable, contrairement au rappel.
  2. Injecter des anomalies connues. On introduit des cas synthétiques ou des cas historiques confirmés et on vérifie qu’ils remontent. Cela donne une estimation de rappel sur les anomalies de ce type.
  3. Suivre la stabilité du taux d’alerte. Une hausse soudaine signale plus souvent une dérive des données ou une panne en amont qu’une vague de vraies anomalies.

Et la remarque qui montre l’expérience : dès que quelques étiquettes existent, il faut passer en supervisé. Un classifieur entraîné sur trois cents fraudes confirmées bat presque toujours un détecteur non supervisé. La détection non supervisée est ce qu’on fait au démarrage, ou pour les anomalies d’un type jamais vu — et son sous-produit le plus précieux est justement de constituer les premières étiquettes.

Toutes les questions Apprentissage non supervisé