Le principe commun à toutes les méthodes : on modélise ce qui est normal, et l’anomalie est ce qui s’en écarte. Puisqu’il n’y a pas d’étiquette, on ne peut pas apprendre ce qu’est une anomalie — seulement ce qu’elle n’est pas.
Statistique, une variable à la fois. Score z, écart interquartile, quantiles extrêmes. Rudimentaire, et il faut le mentionner en premier parce qu’il traite une bonne part des cas réels pour un coût nul. Sa limite : il ne voit pas les anomalies combinées — une transaction de 50 euros n’a rien d’étrange, à 4 heures du matin depuis un autre pays non plus, la combinaison des trois oui.
Par isolation. L’Isolation Forest découpe l’espace au hasard et mesure combien de coupures sont nécessaires pour isoler chaque point. Un point atypique est isolé vite. Rapide, il supporte la grande dimension, et c’est le choix par défaut sur données tabulaires.
Par densité. Le facteur d’aberration local (LOF) compare la densité autour d’un point à celle autour de ses voisins. Il détecte les anomalies locales — un point normal dans l’absolu mais anormal dans son voisinage — ce que l’Isolation Forest rate. Coûteux, et sensible à la malédiction de la dimension.
Par reconstruction. On entraîne un auto-encodeur à reconstruire les données normales ; l’erreur de reconstruction devient le score d’anomalie. C’est ce qui traite les données complexes — images, signaux, séquences — et cela suppose un volume d’entraînement conséquent.
À part, le SVM à une classe, qui apprend une frontière enveloppant les données normales. Élégant, sensible à ses paramètres, et généralement dominé par l’Isolation Forest en pratique tabulaire.
Tous ces algorithmes produisent un score, pas une décision. Le seuil doit venir d’ailleurs, et c’est là que se joue l’utilité du système :
C’est la question qui suit toujours, et la réponse est un enchaînement :
Et la remarque qui montre l’expérience : dès que quelques étiquettes existent, il faut passer en supervisé. Un classifieur entraîné sur trois cents fraudes confirmées bat presque toujours un détecteur non supervisé. La détection non supervisée est ce qu’on fait au démarrage, ou pour les anomalies d’un type jamais vu — et son sous-produit le plus précieux est justement de constituer les premières étiquettes.