Inicialización y normalización

2 min

Objetivo: mantener activaciones y gradientes en una zona aprovechable.

No todos los pesos deben inicializarse a cero: las neuronas de una misma capa permanecerían simétricas y aprenderían lo mismo. La inicialización aleatoria rompe esa simetría, pero su escala debe preservar la señal.

Xavier y He

  • Xavier/Glorot conviene a las activaciones simétricas como tanh.
  • He/Kaiming está diseñada para ReLU y sus variantes.

PyTorch ya inicializa las capas usuales de forma razonable. Una inicialización manual debe tener una justificación y quedar registrada.

Batch Normalization

BatchNorm normaliza las activaciones con estadísticas del mini-batch, y luego aprende una escala y un desplazamiento. En validación, utiliza medias móviles aprendidas. Por eso el olvido de model.eval() cambia los resultados.

Vista previa: el resto de la lección está reservado a los inscritos.

¿Ya te inscribiste con un código?

Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.

Iniciar sesión¿Aún no tienes cuenta? Crear una
Esta lección forma parte del módulo «Hacer aprender la red»

Los primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.

Suscribirme — 19 $ US/mesVolver al plan
¿Eres estudiante del curso?

El código se vincula a tu cuenta: inicia sesión o crea una cuenta y se aplicará automáticamente al volver.

¿Aún no tienes cuenta? Crear una