Objetivo: entender como um erro final se torna uma correção local.
O gradiente reúne as derivadas da perda em relação aos parâmetros. Sua componente
∂L/∂w_i indica como um pequeno aumento do peso w_i faria a perda variar.
Se L depende de a, que depende de z, que depende de w:
∂L/∂w = ∂L/∂a × ∂a/∂z × ∂z/∂wA retropropagação aplica eficientemente essa regra da perda até cada parâmetro do grafo. Ela não constitui o otimizador: ela calcula os gradientes; o otimizador decide em seguida a atualização.
optimizer.zero_grad() # apagar os gradientes anteriores
logits = model(x)
loss = criterion(logits, y)
loss.backward() # calcular os gradientes
optimizer.step() # modificar os parâmetrosPré-visualização — o resto da lição está reservado aos inscritos.
O seu acesso está ligado à sua conta, não a esta ligação. Inicie sessão com o mesmo e-mail usado na aula: o seu curso está à espera, não precisa de introduzir o código de novo.
Iniciar sessãoAinda não tem conta? Criar umaOs primeiros módulos do curso são de acesso livre. Para o resto há três possibilidades: comprar este curso de uma vez por todas, subscrever, ou introduzir o código entregue na aula.