Séquences, RNN, LSTM et GRU

2 min

Objectif : modéliser une séquence ordonnée et comprendre la mémoire récurrente.

Un réseau récurrent lit une séquence élément après élément. Son état caché résume le passé :

text
h_t = φ(W_x x_t + W_h h_{t-1} + b)

Les mêmes poids sont réutilisés à chaque pas. Cette récurrence accepte des longueurs variables, mais rend les calculs temporels séquentiels et expose aux gradients évanescents.

LSTM et GRU

Le LSTM ajoute un état mémoire et des portes d'entrée, d'oubli et de sortie. La GRU combine certaines portes et possède moins de paramètres. Ces portes apprennent quelle information conserver, modifier ou oublier.

python
from torch import nn

rnn = nn.GRU(input_size=64, hidden_size=128, num_layers=2,
             batch_first=True, dropout=0.2, bidirectional=True)

Aperçu — la suite de la leçon est réservée aux inscrits.

Déjà inscrit avec un code ?

Votre accès est rattaché à votre compte, pas à ce lien. Connectez-vous avec le même courriel qu'en classe : votre cours vous attend, inutile de ré-entrer le code.

Se connecterPas encore de compte ? En créer un
Cette leçon fait partie du module « Architectures spécialisées »

Les premiers modules du cours sont en accès libre. Pour la suite, trois possibilités : acheter ce cours une fois pour toutes, vous abonner pour tout ouvrir, ou entrer le code si vous suivez le cours en classe.

M’abonner — 19 $ US/moisRetour au plan
Vous êtes étudiant du cours ?

Le code se rattache à votre compte : connectez-vous ou créez un compte, il sera validé automatiquement au retour.

Pas encore de compte ? En créer un