Descente de gradient et optimiseurs

2 min

Objectif : régler l'optimisation sans confondre vitesse d'apprentissage et qualité.

La descente de gradient met à jour les paramètres dans la direction opposée au gradient :

text
θ ← θ - η ∇L(θ)

η est le taux d'apprentissage. Trop petit : progression lente ou stagnation. Trop grand : oscillation, divergence ou NaN.

Les principaux optimiseurs

  • SGD : mise à jour directe ; simple et souvent très bonne généralisation.
  • Momentum : moyenne les directions récentes et réduit les oscillations.
  • Adam : adapte le pas par paramètre ; baseline efficace et rapide.
  • AdamW : découple correctement le weight decay ; très utilisé avec Transformers.
python
optimizer = torch.optim.AdamW(model.parameters(), lr=3e-4, weight_decay=1e-2)

Aperçu — la suite de la leçon est réservée aux inscrits.

Déjà inscrit avec un code ?

Votre accès est rattaché à votre compte, pas à ce lien. Connectez-vous avec le même courriel qu'en classe : votre cours vous attend, inutile de ré-entrer le code.

Se connecterPas encore de compte ? En créer un
Cette leçon fait partie du module « Faire apprendre le réseau »

Les premiers modules du cours sont en accès libre. Pour la suite, trois possibilités : acheter ce cours une fois pour toutes, vous abonner pour tout ouvrir, ou entrer le code si vous suivez le cours en classe.

M’abonner — 19 $ US/moisRetour au plan
Vous êtes étudiant du cours ?

Le code se rattache à votre compte : connectez-vous ou créez un compte, il sera validé automatiquement au retour.

Pas encore de compte ? En créer un