¿Por qué apilar capas?

2 min

Objetivo: entender capacidad, composición y aprendizaje de representaciones.

Una red profunda compone funciones:

text
f(x) = f_L(f_{L-1}(...f_2(f_1(x))))

Cada capa transforma la representación recibida. Con activaciones no lineales, esta composición puede aproximar relaciones complejas. Sin no linealidad, varias capas densas se reducen a una sola transformación afín: W3(W2(W1x)) = Wx.

Representación aprendida

Una feature ya no es obligatoriamente una columna diseñada a mano. En una CNN, un canal oculto puede reaccionar ante una diagonal; más adelante, una combinación de canales puede reaccionar ante una rueda. El significado no se programa explícitamente: aparece si esa organización reduce la función de pérdida.

Analogía — una cadena de especialistas

Un especialista revisa los contornos, otro agrupa las texturas, un tercero reconoce partes. Ninguno decide solo; su composición produce la decisión final. En realidad, los «especialistas» son matrices de números, ajustadas conjuntamente.

Profundidad, anchura y capacidad

  • La profundidad es el número de etapas de cálculo parametrizadas.
  • La anchura es el número de unidades o canales de una capa.
  • La capacidad describe la riqueza de las funciones representables.

Aumentar la capacidad reduce a veces el subajuste, pero incrementa el costo y el riesgo de memorización. La pregunta correcta es: «¿qué capacidad generaliza bajo mis restricciones?»

Cuándo la profundidad ayuda poco

En datos tabulares modestos, los árboles con boosting siguen siendo a menudo muy competitivos. Si la señal es débil, añadir capas no crea información. Si las etiquetas son erróneas, la red puede aprender esos errores con una eficacia impresionante.

Comprobación rápida

¿Por qué hace falta una activación no lineal entre dos capas? ¿Qué diferencia hay entre anchura y profundidad? ¿Qué ocurre con una red si las entradas no contienen ninguna señal?

Respuestas

Sin no linealidad, la composición sigue siendo afín. La anchura cuenta las unidades de un nivel, la profundidad los niveles. Sin señal, la red solo puede aprender azar o artefactos.

Actividad de dominio — Profundidad controlada

Dibuja dos modelos con presupuesto paramétrico comparable: una sola capa ancha y tres capas más estrechas. Describe una función compuesta que el segundo represente de forma natural e indica el control que distinguiría la ganancia por profundidad de la simple ganancia por cálculo.

Visualizar la jerarquía de representaciones

Lectura: cada nivel transforma la representación recibida y hace que ciertos factores sean más fáciles de separar. La profundidad es útil cuando esta composición corresponde a la estructura del problema. La trampa principal es confundir «más capas» con «más calidad»: sin datos, regularización y un protocolo honesto, la capacidad adicional aumenta sobre todo el riesgo de sobreajuste.