Objetivo: modelar una secuencia ordenada y entender la memoria recurrente.
Una red recurrente lee una secuencia elemento tras elemento. Su estado oculto resume el pasado:
h_t = φ(W_x x_t + W_h h_{t-1} + b)Los mismos pesos se reutilizan en cada paso. Esta recurrencia acepta longitudes variables, pero hace secuenciales los cálculos temporales y expone a los gradientes que se desvanecen.
La LSTM añade un estado de memoria y puertas de entrada, de olvido y de salida. La GRU combina algunas puertas y posee menos parámetros. Estas puertas aprenden qué información conservar, modificar u olvidar.
from torch import nn
rnn = nn.GRU(input_size=64, hidden_size=128, num_layers=2,
batch_first=True, dropout=0.2, bidirectional=True)Vista previa: el resto de la lección está reservado a los inscritos.
Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.
Iniciar sesión¿Aún no tienes cuenta? Crear unaLos primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.