Entrenamiento distribuido y federado

2 min
  1. ¿Cuál es el batch global para 8 workers de batch 32 sin acumulación?
  2. ¿Para qué sirve un all-reduce de los gradientes?
  3. ¿Por qué el scheduler depende del número de workers?
  4. ¿Qué diferencia clave separa DDP y aprendizaje federado?
  5. [E] ¿Qué control valida un paso a distribuido?

Respuestas. 1. 256. 2. Para dar el mismo gradiente agregado a las réplicas. 3. El número de actualizaciones o el batch global puede cambiar. 4. Los clientes federados están separados, son parciales y a menudo no IID. 5. Una comparación con un solo worker sobre datos y batch global equivalentes.

Actividad — Equivalencia con un worker

Calcula el batch global para 8 workers, batch local 32 y acumulación 2. Escribe después una prueba que compare una actualización con un solo worker y una distribuida sobre los mismos datos. Éxito: brecha numérica explicada, semillas y orden de muestreo registrados.

Vista previa: el resto de la lección está reservado a los inscritos.

¿Ya te inscribiste con un código?

Tu acceso está vinculado a tu cuenta, no a este enlace. Inicia sesión con el mismo correo que usaste en clase: tu curso te espera, no hace falta volver a introducir el código.

Iniciar sesión¿Aún no tienes cuenta? Crear una
Esta lección forma parte del módulo «Profundizaciones modernas»

Los primeros módulos del curso son de acceso libre. Para el resto hay tres opciones: comprar este curso de una vez, suscribirte, o introducir el código entregado en clase.

Suscribirme — 19 $ US/mesVolver al plan
¿Eres estudiante del curso?

El código se vincula a tu cuenta: inicia sesión o crea una cuenta y se aplicará automáticamente al volver.

¿Aún no tienes cuenta? Crear una