Función de activación
Función no lineal aplicada a la salida de cada neurona en una red neuronal, que permite al modelo aprender patrones complejos más allá de las transformaciones lineales.
Una función de activación es una transformación no lineal aplicada a la salida lineal de una neurona z = Wx + b. Sin ella, apilar capas equivaldría a una única transformación lineal, haciendo imposible resolver problemas no lineales. La elección de la función de activación es uno de los factores que inciden en la velocidad de entrenamiento y en la precisión final.
En los modelos de visión por computadora, ReLU es una de las opciones representativas para las capas ocultas. Definida como f(x) = max(0, x), deja pasar los valores positivos sin cambios y anula los negativos. Sigmoid y tanh saturan el gradiente cuando la magnitud de la entrada es grande, mientras que ReLU mantiene un gradiente de 1 en el rango positivo, y su cálculo directo se reduce a una comparación.
- ReLU:
f(x) = max(0, x). De cálculo simple y sin saturación del gradiente en el lado positivo; una neurona que solo recibe entradas negativas tiene gradiente 0 y deja de actualizarse (problema de la ReLU muerta) - Leaky ReLU:
f(x) = max(0.01x, x). Asigna una pendiente pequeña al rango negativo (el 0.01 de la fórmula es un valor de coeficiente entre otros y varía según la implementación), de modo que el gradiente no es 0 con entradas negativas - GELU: Activación suave utilizada en Transformers, aproximada como x multiplicado por la CDF de la distribución normal estándar. Adoptada en BERT y Vision Transformer
- Softmax: Función de la capa de salida que produce distribuciones de probabilidad entre clases, aplicada a la salida en la clasificación de imágenes multiclase
Para superresolución y generación de imágenes, las capas de salida usan tanh (rango -1 a 1) o sigmoid (rango 0 a 1) para restringir los valores de píxel. El principio es: variantes de ReLU para capas ocultas, funciones específicas según la tarea para las salidas.