Qu’est-ce que l’ACP et que fait-elle exactement ?

Questions d’entrevue Apprentissage non supervisé

Junioracpreduction

L’analyse en composantes principales change de repère. Elle cherche l’axe le long duquel les données varient le plus, puis le deuxième axe qui lui est perpendiculaire et porte le plus de variance restante, et ainsi de suite. Ces nouveaux axes sont les composantes principales.

En gardant les premières, on décrit les données avec moins de variables tout en conservant l’essentiel de leur variabilité.

Deux formulations à avoir pour la même chose, selon ce que l’intervieweur attend :

  • Géométriquement : c’est une rotation du nuage de points, choisie pour que les axes soient alignés sur les directions d’étalement.
  • Algébriquement : ce sont les vecteurs propres de la matrice de covariance, classés par valeur propre décroissante — chaque valeur propre étant la variance portée par son axe.

Ce qu’elle sert à faire

  • Réduire la dimension avant un modèle ou un clustering, ce qui atténue la malédiction de la dimension et accélère les calculs.
  • Décorréler les variables, puisque les composantes sont orthogonales par construction. C’est utile pour les modèles que la colinéarité perturbe.
  • Visualiser un jeu de données en deux dimensions, honnêtement — les distances y sont interprétables, contrairement à celles d’un t-SNE.
  • Débruiter, en supprimant les dernières composantes, qui ne portent souvent que du bruit de mesure.

Ce qu’il faut savoir dire d’autre

Il faut normaliser avant. L’ACP maximise la variance, or la variance dépend de l’unité. Sans mise à l’échelle, la composante principale est essentiellement la colonne exprimée dans les plus grands nombres — un résultat qui ne parle que des unités.

Les composantes ne s’interprètent pas facilement. Chacune est une combinaison de toutes les variables d’origine. On peut en lire le sens en examinant les coefficients — « cette composante oppose l’ancienneté au volume d’achat » — mais on perd la lisibilité directe des variables. C’est le vrai prix de la méthode, et c’est pourquoi une simple sélection de variables est parfois préférable.

Elle est linéaire. Elle ne capte que des directions droites. Une structure enroulée — les fameuses données en spirale — ne se déplie pas par ACP : il faut alors des méthodes non linéaires, noyau, UMAP ou auto-encodeur.

Elle est sensible aux valeurs extrêmes, puisque la variance l’est.

Et le point de méthode, qui est le même que pour toute transformation apprise : l’ACP s’ajuste sur l’entraînement seul, puis s’applique au test. Ajustée sur tout le jeu, elle fait fuiter la structure du test dans l’entraînement.

Toutes les questions Apprentissage non supervisé