Objetivo: mantener activaciones y gradientes en una zona aprovechable.
No todos los pesos deben inicializarse a cero: las neuronas de una misma capa permanecerían simétricas y aprenderían lo mismo. La inicialización aleatoria rompe esa simetría, pero su escala debe preservar la señal.
tanh.PyTorch ya inicializa las capas usuales de forma razonable. Una inicialización manual debe tener una justificación y quedar registrada.
BatchNorm normaliza las activaciones con estadísticas del mini-batch, y luego aprende una
escala y un desplazamiento. En validación, utiliza medias móviles aprendidas. Por eso
el olvido de model.eval() cambia los resultados.
Vista previa: el resto de la lección está reservado a los inscritos.
Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.
Iniciar sesión¿Aún no tienes cuenta? Crear unaLos primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.