Objetivo: ajustar a otimização sem confundir velocidade de aprendizado e qualidade.
A descida do gradiente atualiza os parâmetros na direção oposta ao gradiente:
θ ← θ - η ∇L(θ)η é a taxa de aprendizado. Pequena demais: progressão lenta ou estagnação. Grande
demais: oscilação, divergência ou NaN.
optimizer = torch.optim.AdamW(model.parameters(), lr=3e-4, weight_decay=1e-2)Pré-visualização — o resto da lição está reservado aos inscritos.
O seu acesso está ligado à sua conta, não a esta ligação. Inicie sessão com o mesmo e-mail usado na aula: o seu curso está à espera, não precisa de introduzir o código de novo.
Iniciar sessãoAinda não tem conta? Criar umaOs primeiros módulos do curso são de acesso livre. Para o resto há três possibilidades: comprar este curso de uma vez por todas, subscrever, ou introduzir o código entregue na aula.