Treinamento distribuído e federado

2 min
  1. Qual é o batch global para 8 workers de batch 32 sem acumulação?
  2. Para que serve um all-reduce dos gradientes?
  3. Por que o scheduler depende do número de workers?
  4. Qual diferença chave separa DDP e aprendizado federado?
  5. [E] Qual controle valida uma passagem para o distribuído?

Respostas. 1. 256. 2. Para dar o mesmo gradiente agregado às réplicas. 3. O número de atualizações ou o batch global pode mudar. 4. Os clientes federados são separados, parciais e frequentemente não-IID. 5. Uma comparação mono-worker em dados e batch global equivalentes.

Atividade — Equivalência a um worker

Calcule o batch global para 8 workers, batch local 32 e acumulação 2. Em seguida, escreva um teste comparando uma atualização mono-worker e distribuída nos mesmos dados. Sucesso: diferença numérica explicada, sementes e ordem de amostragem registradas.

Pré-visualização — o resto da lição está reservado aos inscritos.

Já se inscreveu com um código?

O seu acesso está ligado à sua conta, não a esta ligação. Inicie sessão com o mesmo e-mail usado na aula: o seu curso está à espera, não precisa de introduzir o código de novo.

Iniciar sessãoAinda não tem conta? Criar uma
Esta lição faz parte do módulo «Aprofundamentos modernos»

Os primeiros módulos do curso são de acesso livre. Para o resto há três possibilidades: comprar este curso de uma vez por todas, subscrever, ou introduzir o código entregue na aula.

Subscrever — 19 $ US/mêsVoltar ao plano
É estudante do curso?

O código fica ligado à sua conta: inicie sessão ou crie uma conta e ele será aplicado automaticamente ao regressar.

Ainda não tem conta? Criar uma