Objetivo: razonar sobre el costo antes de agrandar el modelo.
El tiempo no depende únicamente del número de parámetros: el tamaño de las activaciones, la longitud de secuencia, el batch, las operaciones y las transferencias de memoria también cuentan. Durante el entrenamiento, hay que almacenar pesos, gradientes, estados del optimizador y activaciones necesarias para el backward.
Una GPU acelera los cálculos paralelos suficientemente grandes. Batches pequeños, una carga de datos lenta o transferencias CPU↔GPU repetidas pueden dejarla inactiva.
loader = DataLoader(dataset, batch_size=128, shuffle=True,
num_workers=4, pin_memory=True)Vista previa: el resto de la lección está reservado a los inscritos.
Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.
Iniciar sesión¿Aún no tienes cuenta? Crear unaLos primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.