Objectif : modéliser une séquence ordonnée et comprendre la mémoire récurrente.
Un réseau récurrent lit une séquence élément après élément. Son état caché résume le passé :
h_t = φ(W_x x_t + W_h h_{t-1} + b)Les mêmes poids sont réutilisés à chaque pas. Cette récurrence accepte des longueurs variables, mais rend les calculs temporels séquentiels et expose aux gradients évanescents.
Le LSTM ajoute un état mémoire et des portes d'entrée, d'oubli et de sortie. La GRU combine certaines portes et possède moins de paramètres. Ces portes apprennent quelle information conserver, modifier ou oublier.
from torch import nn
rnn = nn.GRU(input_size=64, hidden_size=128, num_layers=2,
batch_first=True, dropout=0.2, bidirectional=True)Aperçu — la suite de la leçon est réservée aux inscrits.
Votre accès est rattaché à votre compte, pas à ce lien. Connectez-vous avec le même courriel qu'en classe : votre cours vous attend, inutile de ré-entrer le code.
Se connecterPas encore de compte ? En créer unLes premiers modules du cours sont en accès libre. Pour la suite, trois possibilités : acheter ce cours une fois pour toutes, vous abonner pour tout ouvrir, ou entrer le code si vous suivez le cours en classe.