Objetivo: entender capacidade, composição e aprendizado de representações.
Uma rede profunda compõe funções:
f(x) = f_L(f_{L-1}(...f_2(f_1(x))))Cada camada transforma a representação recebida. Com ativações não lineares,
essa composição pode aproximar relações complexas. Sem não linearidade, várias
camadas densas se reduzem a uma única transformação afim: W3(W2(W1x)) = Wx.
Uma feature já não é obrigatoriamente uma coluna projetada à mão. Em uma CNN, um canal oculto pode reagir a uma diagonal; mais adiante, uma combinação de canais pode reagir a uma roda. O significado não é programado explicitamente: ele surge se essa organização reduz a função de perda.
Um especialista verifica os contornos, outro agrupa as texturas, um terceiro reconhece partes. Nenhum decide sozinho; a composição deles produz a decisão final. Na realidade, os « especialistas » são matrizes de números, ajustadas em conjunto.
Aumentar a capacidade às vezes reduz o subajuste, mas aumenta o custo e o risco de memorização. A pergunta certa é: « qual capacidade generaliza sob minhas restrições? »
Em dados tabulares modestos, as árvores com boosting continuam frequentemente muito competitivas. Se o sinal é fraco, adicionar camadas não cria informação. Se os rótulos estão errados, a rede pode aprender esses erros com uma eficiência impressionante.
Por que é necessária uma ativação não linear entre duas camadas? Qual é a diferença entre largura e profundidade? O que acontece com uma rede se as entradas não contêm nenhum sinal?
Sem não linearidade, a composição permanece afim. A largura conta as unidades de um estágio, a profundidade conta os estágios. Sem sinal, a rede só pode aprender acaso ou artefatos.
Desenhe dois modelos com orçamento paramétrico comparável: uma única camada larga e três camadas mais estreitas. Descreva uma função composta que o segundo representa naturalmente e indique o controle que distinguiria ganho de profundidade de simples ganho de computação.
Leitura: cada estágio transforma a representação recebida e torna certos fatores mais fáceis de separar. A profundidade é útil quando essa composição corresponde à estrutura do problema. A principal armadilha é confundir « mais camadas » com « mais qualidade »: sem dados, regularização e protocolo honesto, a capacidade adicional aumenta sobretudo o risco de sobreajuste.