Descida de gradiente e otimizadores

2 min

Objetivo: ajustar a otimização sem confundir velocidade de aprendizado e qualidade.

A descida do gradiente atualiza os parâmetros na direção oposta ao gradiente:

text
θ ← θ - η ∇L(θ)

η é a taxa de aprendizado. Pequena demais: progressão lenta ou estagnação. Grande demais: oscilação, divergência ou NaN.

Os principais otimizadores

  • SGD: atualização direta; simples e frequentemente com muito boa generalização.
  • Momentum: faz a média das direções recentes e reduz as oscilações.
  • Adam: adapta o passo por parâmetro; baseline eficaz e rápida.
  • AdamW: desacopla corretamente o weight decay; muito usado com Transformers.
python
optimizer = torch.optim.AdamW(model.parameters(), lr=3e-4, weight_decay=1e-2)

Pré-visualização — o resto da lição está reservado aos inscritos.

Já se inscreveu com um código?

O seu acesso está ligado à sua conta, não a esta ligação. Inicie sessão com o mesmo e-mail usado na aula: o seu curso está à espera, não precisa de introduzir o código de novo.

Iniciar sessãoAinda não tem conta? Criar uma
Esta lição faz parte do módulo «Fazer a rede aprender»

Os primeiros módulos do curso são de acesso livre. Para o resto há três possibilidades: comprar este curso de uma vez por todas, subscrever, ou introduzir o código entregue na aula.

Subscrever — 19 $ US/mêsVoltar ao plano
É estudante do curso?

O código fica ligado à sua conta: inicie sessão ou crie uma conta e ele será aplicado automaticamente ao regressar.

Ainda não tem conta? Criar uma