L’analyse en composantes principales change de repère. Elle cherche l’axe le long duquel les données varient le plus, puis le deuxième axe qui lui est perpendiculaire et porte le plus de variance restante, et ainsi de suite. Ces nouveaux axes sont les composantes principales.
En gardant les premières, on décrit les données avec moins de variables tout en conservant l’essentiel de leur variabilité.
Deux formulations à avoir pour la même chose, selon ce que l’intervieweur attend :
Il faut normaliser avant. L’ACP maximise la variance, or la variance dépend de l’unité. Sans mise à l’échelle, la composante principale est essentiellement la colonne exprimée dans les plus grands nombres — un résultat qui ne parle que des unités.
Les composantes ne s’interprètent pas facilement. Chacune est une combinaison de toutes les variables d’origine. On peut en lire le sens en examinant les coefficients — « cette composante oppose l’ancienneté au volume d’achat » — mais on perd la lisibilité directe des variables. C’est le vrai prix de la méthode, et c’est pourquoi une simple sélection de variables est parfois préférable.
Elle est linéaire. Elle ne capte que des directions droites. Une structure enroulée — les fameuses données en spirale — ne se déplie pas par ACP : il faut alors des méthodes non linéaires, noyau, UMAP ou auto-encodeur.
Elle est sensible aux valeurs extrêmes, puisque la variance l’est.
Et le point de méthode, qui est le même que pour toute transformation apprise : l’ACP s’ajuste sur l’entraînement seul, puis s’applique au test. Ajustée sur tout le jeu, elle fait fuiter la structure du test dans l’entraînement.