Objetivo: entender capacidad, composición y aprendizaje de representaciones.
Una red profunda compone funciones:
f(x) = f_L(f_{L-1}(...f_2(f_1(x))))Cada capa transforma la representación recibida. Con activaciones no lineales,
esta composición puede aproximar relaciones complejas. Sin no linealidad, varias
capas densas se reducen a una sola transformación afín: W3(W2(W1x)) = Wx.
Una feature ya no es obligatoriamente una columna diseñada a mano. En una CNN, un canal oculto puede reaccionar ante una diagonal; más adelante, una combinación de canales puede reaccionar ante una rueda. El significado no se programa explícitamente: aparece si esa organización reduce la función de pérdida.
Un especialista revisa los contornos, otro agrupa las texturas, un tercero reconoce partes. Ninguno decide solo; su composición produce la decisión final. En realidad, los «especialistas» son matrices de números, ajustadas conjuntamente.
Aumentar la capacidad reduce a veces el subajuste, pero incrementa el costo y el riesgo de memorización. La pregunta correcta es: «¿qué capacidad generaliza bajo mis restricciones?»
En datos tabulares modestos, los árboles con boosting siguen siendo a menudo muy competitivos. Si la señal es débil, añadir capas no crea información. Si las etiquetas son erróneas, la red puede aprender esos errores con una eficacia impresionante.
¿Por qué hace falta una activación no lineal entre dos capas? ¿Qué diferencia hay entre anchura y profundidad? ¿Qué ocurre con una red si las entradas no contienen ninguna señal?
Sin no linealidad, la composición sigue siendo afín. La anchura cuenta las unidades de un nivel, la profundidad los niveles. Sin señal, la red solo puede aprender azar o artefactos.
Dibuja dos modelos con presupuesto paramétrico comparable: una sola capa ancha y tres capas más estrechas. Describe una función compuesta que el segundo represente de forma natural e indica el control que distinguiría la ganancia por profundidad de la simple ganancia por cálculo.
Lectura: cada nivel transforma la representación recibida y hace que ciertos factores sean más fáciles de separar. La profundidad es útil cuando esta composición corresponde a la estructura del problema. La trampa principal es confundir «más capas» con «más calidad»: sin datos, regularización y un protocolo honesto, la capacidad adicional aumenta sobre todo el riesgo de sobreajuste.