Descenso de gradiente y optimizadores

2 min

Objetivo: ajustar la optimización sin confundir velocidad de aprendizaje y calidad.

El descenso de gradiente actualiza los parámetros en la dirección opuesta al gradiente:

text
θ ← θ - η ∇L(θ)

η es la tasa de aprendizaje. Demasiado pequeña: progresión lenta o estancamiento. Demasiado grande: oscilación, divergencia o NaN.

Los principales optimizadores

  • SGD: actualización directa; simple y a menudo con muy buena generalización.
  • Momentum: promedia las direcciones recientes y reduce las oscilaciones.
  • Adam: adapta el paso por parámetro; baseline eficaz y rápida.
  • AdamW: desacopla correctamente el weight decay; muy utilizado con Transformers.
python
optimizer = torch.optim.AdamW(model.parameters(), lr=3e-4, weight_decay=1e-2)

Vista previa: el resto de la lección está reservado a los inscritos.

¿Ya te inscribiste con un código?

Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.

Iniciar sesión¿Aún no tienes cuenta? Crear una
Esta lección forma parte del módulo «Hacer aprender la red»

Los primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.

Suscribirme — 19 $ US/mesVolver al plan
¿Eres estudiante del curso?

El código se vincula a tu cuenta: inicia sesión o crea una cuenta y se aplicará automáticamente al volver.

¿Aún no tienes cuenta? Crear una