Objectif : régler l'optimisation sans confondre vitesse d'apprentissage et qualité.
La descente de gradient met à jour les paramètres dans la direction opposée au gradient :
θ ← θ - η ∇L(θ)η est le taux d'apprentissage. Trop petit : progression lente ou stagnation. Trop
grand : oscillation, divergence ou NaN.
optimizer = torch.optim.AdamW(model.parameters(), lr=3e-4, weight_decay=1e-2)Aperçu — la suite de la leçon est réservée aux inscrits.
Votre accès est rattaché à votre compte, pas à ce lien. Connectez-vous avec le même courriel qu'en classe : votre cours vous attend, inutile de ré-entrer le code.
Se connecterPas encore de compte ? En créer unLes premiers modules du cours sont en accès libre. Pour la suite, trois possibilités : acheter ce cours une fois pour toutes, vous abonner pour tout ouvrir, ou entrer le code si vous suivez le cours en classe.