Les deux assemblent des arbres, mais pas dans le même but : la forêt aléatoire réduit la variance, le gradient boosting réduit le biais. C’est la phrase qui structure toute la réponse.
| Forêt aléatoire | Gradient boosting | |
|---|---|---|
| Construction | arbres indépendants, en parallèle | arbres séquentiels, chacun corrige le précédent |
| Arbres | profonds, à forte variance | peu profonds, 3 à 6 niveaux |
| Attaque | la variance, par moyenne | le biais, par correction successive |
| Ajouter des arbres | ne dégrade jamais | finit par surapprendre |
| Réglage | tolérant | déterminant |
| Parallélisme | total | seulement à l’intérieur d’un arbre |
La forêt entraîne chaque arbre sur un échantillon tiré avec remise, et ne lui laisse qu’un sous-ensemble de variables à chaque coupure. Cette double injection de hasard décorrèle les arbres, ce qui est la condition pour que la moyenne réduise la variance. Des arbres identiques moyennés ne gagneraient rien.
Le boosting entraîne un premier arbre faible, mesure ce qu’il a raté, puis entraîne le suivant sur ces erreurs — sur le gradient de la perte, exactement. Chaque arbre est un petit pas dans la direction qui améliore la prédiction, et le taux d’apprentissage contrôle la taille de ce pas.
La forêt aléatoire quand on veut un résultat solide sans y passer la semaine : peu d’hyperparamètres qui comptent, et le principal — le nombre d’arbres — n’a pas de valeur optimale, il suffit d’en mettre assez. Elle est aussi le bon choix sur données bruitées, où le boosting a tendance à apprendre le bruit en le poursuivant.
Le gradient boosting quand la performance est l’objectif et qu’on accepte de régler. Sur données tabulaires, XGBoost, LightGBM ou CatBoost bien réglés battent presque toujours une forêt — de quelques points, ce qui est parfois décisif et souvent négligeable.
Les hyperparamètres du boosting, dans l’ordre où on les touche : le taux d’apprentissage et le nombre d’arbres, qui se compensent — un taux plus faible demande plus d’arbres et donne généralement un meilleur résultat ; puis la profondeur ; puis les taux d’échantillonnage des lignes et des colonnes.
L’arrêt anticipé est indispensable au boosting, et sans objet pour la forêt. Ajouter des arbres à une forêt fait converger sa performance ; ajouter des arbres à un boosting finit par dégrader la validation. On surveille donc un jeu de validation et on s’arrête au retournement.
Le score hors-sac de la forêt donne une estimation de généralisation sans jeu de validation, puisque chaque arbre n’a pas vu environ un tiers des exemples. C’est de la validation croisée gratuite, et peu de candidats y pensent.
Et la remarque de contexte, qui vaut mieux que de choisir un camp : sur données tabulaires, les deux battent régulièrement un réseau de neurones, pour beaucoup moins de travail. Le choix entre elles se joue sur quelques points de métrique ; le choix entre arbres et réseau se joue sur des semaines de temps d’ingénierie.