L’erreur de prédiction se décompose en trois termes, et deux d’entre eux s’opposent :
Le compromis : à quantité de données fixée, réduire le biais en complexifiant le modèle augmente sa variance, et l’inverse est vrai aussi. Une droite a un biais fort et une variance faible ; un arbre profond, l’inverse.
C’est ce qu’attend l’intervieweur, parce que c’est ce qui sert au quotidien :
| Erreur d’entraînement | Erreur de validation | Diagnostic | Remède |
|---|---|---|---|
| élevée | élevée, proche | biais fort | complexifier, ajouter des variables |
| faible | élevée, écart large | variance forte | plus de données, régulariser, simplifier |
| faible | faible | bon compromis | figer et passer en production |
| élevée | faible | découpage suspect | vérifier les jeux avant tout le reste |
La ligne qui compte est la première : quand le biais domine, ajouter des données ne sert à rien. Un modèle trop simple reste trop simple avec dix fois plus d’exemples. C’est l’erreur de raisonnement la plus fréquente sur ce sujet, et savoir l’éviter vaut plus que réciter la décomposition.
Deux leviers sortent du dilemme au lieu de le subir :
La courbe en U enseignée avec ce compromis décrit bien les modèles classiques, et pas les réseaux de neurones surparamétrés. Au-delà du point d’interpolation — là où le modèle a assez de paramètres pour apprendre parfaitement l’entraînement — l’erreur de test peut redescendre au lieu de continuer à monter. C’est la double descente, et c’est pourquoi un grand réseau régularisé bat souvent un petit réseau bien dimensionné.
Le compromis reste le bon cadre de diagnostic ; ce n’est plus une loi universelle sur la complexité.