Objetivo: entender cómo un error final se convierte en una corrección local.
El gradiente reúne las derivadas de la pérdida respecto a los parámetros. Su componente
∂L/∂w_i indica cómo un pequeño aumento del peso w_i haría variar la pérdida.
Si L depende de a, que depende de z, que depende de w:
∂L/∂w = ∂L/∂a × ∂a/∂z × ∂z/∂wLa retropropagación aplica eficientemente esta regla desde la pérdida hacia cada parámetro del grafo. No constituye el optimizador: calcula los gradientes; el optimizador decide después la actualización.
optimizer.zero_grad() # borrar los gradientes anteriores
logits = model(x)
loss = criterion(logits, y)
loss.backward() # calcular los gradientes
optimizer.step() # modificar los parámetrosVista previa: el resto de la lección está reservado a los inscritos.
Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.
Iniciar sesión¿Aún no tienes cuenta? Crear unaLos primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.