Por que empilhar camadas?

2 min

Objetivo: entender capacidade, composição e aprendizado de representações.

Uma rede profunda compõe funções:

text
f(x) = f_L(f_{L-1}(...f_2(f_1(x))))

Cada camada transforma a representação recebida. Com ativações não lineares, essa composição pode aproximar relações complexas. Sem não linearidade, várias camadas densas se reduzem a uma única transformação afim: W3(W2(W1x)) = Wx.

Representação aprendida

Uma feature já não é obrigatoriamente uma coluna projetada à mão. Em uma CNN, um canal oculto pode reagir a uma diagonal; mais adiante, uma combinação de canais pode reagir a uma roda. O significado não é programado explicitamente: ele surge se essa organização reduz a função de perda.

Analogia — uma cadeia de especialistas

Um especialista verifica os contornos, outro agrupa as texturas, um terceiro reconhece partes. Nenhum decide sozinho; a composição deles produz a decisão final. Na realidade, os « especialistas » são matrizes de números, ajustadas em conjunto.

Profundidade, largura e capacidade

  • A profundidade é o número de etapas de cálculo parametrizadas.
  • A largura é o número de unidades ou canais de uma camada.
  • A capacidade descreve a riqueza das funções representáveis.

Aumentar a capacidade às vezes reduz o subajuste, mas aumenta o custo e o risco de memorização. A pergunta certa é: « qual capacidade generaliza sob minhas restrições? »

Quando a profundidade ajuda pouco

Em dados tabulares modestos, as árvores com boosting continuam frequentemente muito competitivas. Se o sinal é fraco, adicionar camadas não cria informação. Se os rótulos estão errados, a rede pode aprender esses erros com uma eficiência impressionante.

Verificação rápida

Por que é necessária uma ativação não linear entre duas camadas? Qual é a diferença entre largura e profundidade? O que acontece com uma rede se as entradas não contêm nenhum sinal?

Respostas

Sem não linearidade, a composição permanece afim. A largura conta as unidades de um estágio, a profundidade conta os estágios. Sem sinal, a rede só pode aprender acaso ou artefatos.

Atividade de domínio — Profundidade controlada

Desenhe dois modelos com orçamento paramétrico comparável: uma única camada larga e três camadas mais estreitas. Descreva uma função composta que o segundo representa naturalmente e indique o controle que distinguiria ganho de profundidade de simples ganho de computação.

Visualizar a hierarquia das representações

Leitura: cada estágio transforma a representação recebida e torna certos fatores mais fáceis de separar. A profundidade é útil quando essa composição corresponde à estrutura do problema. A principal armadilha é confundir « mais camadas » com « mais qualidade »: sem dados, regularização e protocolo honesto, a capacidade adicional aumenta sobretudo o risco de sobreajuste.