Redes convolucionales para la visión

2 min

Objetivo: entender convolución, canales, pooling y campo receptivo.

Una capa densa ignora la estructura espacial y multiplica rápidamente los parámetros. Una convolución aplica el mismo pequeño núcleo a todas las posiciones. Este reparto de pesos explota la localidad y reduce fuertemente el número de parámetros.

Para una entrada C_in × H × W, un núcleo C_out × C_in × K × K contiene C_out(C_in K² + 1) parámetros con sesgo, independientemente del tamaño de la imagen.

python
from torch import nn

features = nn.Sequential(
    nn.Conv2d(3, 32, kernel_size=3, padding=1),
    nn.BatchNorm2d(32),
    nn.ReLU(),
    nn.MaxPool2d(2),
    nn.Conv2d(32, 64, kernel_size=3, padding=1),
    nn.ReLU(),
    nn.AdaptiveAvgPool2d((1, 1)),
)

Vista previa: el resto de la lección está reservado a los inscritos.

¿Ya te inscribiste con un código?

Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.

Iniciar sesión¿Aún no tienes cuenta? Crear una
Esta lección forma parte del módulo «Arquitecturas especializadas»

Los primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.

Suscribirme — 19 $ US/mesVolver al plan
¿Eres estudiante del curso?

El código se vincula a tu cuenta: inicia sesión o crea una cuenta y se aplicará automáticamente al volver.

¿Aún no tienes cuenta? Crear una