Gradiente y retropropagación

2 min

Objetivo: entender cómo un error final se convierte en una corrección local.

El gradiente reúne las derivadas de la pérdida respecto a los parámetros. Su componente ∂L/∂w_i indica cómo un pequeño aumento del peso w_i haría variar la pérdida.

La regla de la cadena

Si L depende de a, que depende de z, que depende de w:

text
∂L/∂w = ∂L/∂a × ∂a/∂z × ∂z/∂w

La retropropagación aplica eficientemente esta regla desde la pérdida hacia cada parámetro del grafo. No constituye el optimizador: calcula los gradientes; el optimizador decide después la actualización.

python
optimizer.zero_grad()  # borrar los gradientes anteriores
logits = model(x)
loss = criterion(logits, y)
loss.backward()        # calcular los gradientes
optimizer.step()       # modificar los parámetros

Vista previa: el resto de la lección está reservado a los inscritos.

¿Ya te inscribiste con un código?

Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.

Iniciar sesión¿Aún no tienes cuenta? Crear una
Esta lección forma parte del módulo «Hacer aprender la red»

Los primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.

Suscribirme — 19 $ US/mesVolver al plan
¿Eres estudiante del curso?

El código se vincula a tu cuenta: inicia sesión o crea una cuenta y se aplicará automáticamente al volver.

¿Aún no tienes cuenta? Crear una