Expliquez le compromis biais-variance

Questions d’entrevue Apprentissage supervisé

Intermédiairebiais-variancefondamentauxsurapprentissage

L’erreur de prédiction se décompose en trois termes, et deux d’entre eux s’opposent :

  • Le biais est l’erreur due aux hypothèses du modèle. Une droite qui tente de suivre une courbe se trompe partout, quelles que soient les données qu’on lui donne.
  • La variance est la sensibilité du modèle au jeu d’entraînement particulier qu’il a reçu. Réentraîné sur un autre échantillon du même phénomène, il produirait des prédictions très différentes.
  • Le bruit irréductible est la part du phénomène qu’aucun modèle ne peut expliquer. C’est le plancher de l’erreur, et c’est pour cela qu’un score parfait doit inquiéter plutôt que réjouir.

Le compromis : à quantité de données fixée, réduire le biais en complexifiant le modèle augmente sa variance, et l’inverse est vrai aussi. Une droite a un biais fort et une variance faible ; un arbre profond, l’inverse.

Le diagnostic, qui est la vraie question posée

C’est ce qu’attend l’intervieweur, parce que c’est ce qui sert au quotidien :

Erreur d’entraînementErreur de validationDiagnosticRemède
élevéeélevée, prochebiais fortcomplexifier, ajouter des variables
faibleélevée, écart largevariance forteplus de données, régulariser, simplifier
faiblefaiblebon compromisfiger et passer en production
élevéefaibledécoupage suspectvérifier les jeux avant tout le reste

La ligne qui compte est la première : quand le biais domine, ajouter des données ne sert à rien. Un modèle trop simple reste trop simple avec dix fois plus d’exemples. C’est l’erreur de raisonnement la plus fréquente sur ce sujet, et savoir l’éviter vaut plus que réciter la décomposition.

Ce qui déplace le compromis

Deux leviers sortent du dilemme au lieu de le subir :

  • Les méthodes d’ensemble. Une forêt aléatoire moyenne des arbres profonds : chacun a une variance forte, la moyenne l’écrase sans toucher au biais. Le bagging attaque la variance, le boosting attaque le biais.
  • Plus de données. Elles réduisent la variance sans augmenter le biais, ce qui est la seule façon d’améliorer les deux termes à la fois.

La nuance moderne, qui fait bonne impression

La courbe en U enseignée avec ce compromis décrit bien les modèles classiques, et pas les réseaux de neurones surparamétrés. Au-delà du point d’interpolation — là où le modèle a assez de paramètres pour apprendre parfaitement l’entraînement — l’erreur de test peut redescendre au lieu de continuer à monter. C’est la double descente, et c’est pourquoi un grand réseau régularisé bat souvent un petit réseau bien dimensionné.

Le compromis reste le bon cadre de diagnostic ; ce n’est plus une loi universelle sur la complexité.

Toutes les questions Apprentissage supervisé