Objetivo: modelar uma sequência ordenada e entender a memória recorrente.
Uma rede recorrente lê uma sequência elemento após elemento. Seu estado oculto resume o passado:
h_t = φ(W_x x_t + W_h h_{t-1} + b)Os mesmos pesos são reutilizados a cada passo. Essa recorrência aceita comprimentos variáveis, mas torna os cálculos temporais sequenciais e expõe aos gradientes evanescentes.
O LSTM adiciona um estado de memória e portas de entrada, de esquecimento e de saída. A GRU combina certas portas e possui menos parâmetros. Essas portas aprendem qual informação conservar, modificar ou esquecer.
from torch import nn
rnn = nn.GRU(input_size=64, hidden_size=128, num_layers=2,
batch_first=True, dropout=0.2, bidirectional=True)Pré-visualização — o resto da lição está reservado aos inscritos.
O seu acesso está ligado à sua conta, não a esta ligação. Inicie sessão com o mesmo e-mail usado na aula: o seu curso está à espera, não precisa de introduzir o código de novo.
Iniciar sessãoAinda não tem conta? Criar umaOs primeiros módulos do curso são de acesso livre. Para o resto há três possibilidades: comprar este curso de uma vez por todas, subscrever, ou introduzir o código entregue na aula.