Entraînement distribué et fédéré

2 min
  1. Quel est le batch global pour 8 workers de batch 32 sans accumulation ?
  2. À quoi sert un all-reduce des gradients ?
  3. Pourquoi le scheduler dépend-il du nombre de workers ?
  4. Quelle différence clé sépare DDP et apprentissage fédéré ?
  5. [E] Quel contrôle valide un passage distribué ?

Réponses. 1. 256. 2. À donner le même gradient agrégé aux répliques. 3. Le nombre de mises à jour ou le batch global peut changer. 4. Les clients fédérés sont séparés, partiels et souvent non-IID. 5. Une comparaison mono-worker sur données et batch global équivalents.

Activité — Équivalence à un worker

Calculez le batch global pour 8 workers, batch local 32 et accumulation 2. Écrivez ensuite un test comparant une mise à jour mono-worker et distribuée sur les mêmes données. Réussite : écart numérique expliqué, graines et ordre d'échantillonnage consignés.

Aperçu — la suite de la leçon est réservée aux inscrits.

Déjà inscrit avec un code ?

Votre accès est rattaché à votre compte, pas à ce lien. Connectez-vous avec le même courriel qu'en classe : votre cours vous attend, inutile de ré-entrer le code.

Se connecterPas encore de compte ? En créer un
Cette leçon fait partie du module « Approfondissements modernes »

Les premiers modules du cours sont en accès libre. Pour la suite, trois possibilités : acheter ce cours une fois pour toutes, vous abonner pour tout ouvrir, ou entrer le code si vous suivez le cours en classe.

M’abonner — 19 $ US/moisRetour au plan
Vous êtes étudiant du cours ?

Le code se rattache à votre compte : connectez-vous ou créez un compte, il sera validé automatiquement au retour.

Pas encore de compte ? En créer un