Funciones de activación

1 min

Objetivo: elegir una activación y entender saturación, gradientes y salida.

Activaciones ocultas

ActivaciónExpresión/ideaUso y vigilancia
ReLUmax(0, z)simple, rápida; posibles neuronas muertas
LeakyReLUpendiente pequeña si z<0reduce las unidades definitivamente nulas
tanhsalida [-1, 1]centrada, pero satura en los extremos
sigmoidsalida [0, 1]sobre todo salida binaria; saturación
GELUmodulación suavefrecuente en los Transformers

La derivada de ReLU vale 1 para z>0 y 0 para z<0. Una unidad que recibe siempre preactivaciones negativas deja de transmitir gradiente: está «muerta».

Salidas

  • Regresión no acotada: salida lineal.
  • Probabilidad binaria: sigmoid para la interpretación, pero logits para BCEWithLogitsLoss.
  • Clases exclusivas: softmax para leer las probabilidades, pero logits para CrossEntropyLoss.
  • Multietiqueta: una sigmoid independiente por etiqueta.

Softmax

softmax(z_i) = exp(z_i) / Σ_j exp(z_j) transforma K logits en números positivos cuya suma vale 1. Añadir una constante idéntica a todos los logits no cambia las probabilidades. Las implementaciones estables restan el máximo antes de la exponencial.

Regla práctica

Utiliza ReLU como baseline para un MLP/CNN, GELU para un Transformer, y coloca una activación de salida únicamente si la pérdida o la interfaz lo exigen explícitamente.

Comprobación rápida

¿Por qué las activaciones deben ser no lineales? ¿Qué activación produce probabilidades exclusivas?

Respuestas

De lo contrario toda la red se reduce a una transformación afín. Softmax produce una distribución sobre clases exclusivas.

Actividad de dominio — Elección y cálculo

Calcula ReLU y sigmoide para z = {-2, 0, 2}, y luego el softmax estable de [1000, 1001, 999]. Asocia después una salida a cuatro tareas: binaria, multiclase, multietiqueta y regresión no acotada. Éxito: ninguna doble activación antes de una pérdida sobre logits.

Elegir la activación en el lugar correcto

Lectura: la función de pérdida dicta a menudo el formato numérico esperado. Con las pérdidas estables que reciben logits, la sigmoide o el softmax sirven para la interpretación, no para la entrada de la pérdida. La trampa principal es por tanto la doble activación, que deteriora los gradientes y puede dar probabilidades engañosas.