Objetivo: ajustar la optimización sin confundir velocidad de aprendizaje y calidad.
El descenso de gradiente actualiza los parámetros en la dirección opuesta al gradiente:
θ ← θ - η ∇L(θ)η es la tasa de aprendizaje. Demasiado pequeña: progresión lenta o estancamiento. Demasiado
grande: oscilación, divergencia o NaN.
optimizer = torch.optim.AdamW(model.parameters(), lr=3e-4, weight_decay=1e-2)Vista previa: el resto de la lección está reservado a los inscritos.
Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.
Iniciar sesión¿Aún no tienes cuenta? Crear unaLos primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.