¿Qué es?
Las funciones no lineales que se aplican tras cada capa lineal. Sin ellas una red profunda se reduce a una sola aplicación lineal. Sus derivadas importan tanto como sus valores: las sigmoides se saturan (desvanecimiento del gradiente) y ReLU deja pasar el gradiente sin cambios donde está activa.
Fórmulas
¿Por qué importa?
El paso de la sigmoide a ReLU (hacia 2011) fue uno de los pequeños hechos de cálculo que hicieron entrenable el deep learning.
Las matemáticas que hay detrás
y : la retropropagación reutiliza el valor calculado hacia delante.
La sigmoide, la softmax y la tanh se construyen con .
Las activaciones deben ser continuas (y derivables casi en todas partes) para que funcione el entrenamiento por gradiente.
La activación escalón del perceptrón es discontinua; sustituirla por la sigmoide hizo posible la retropropagación.
ReLU tiene ; los frameworks simplemente eligen un valor (normalmente 0) en el pico.
comprime a y su derivada se calcula barato a partir de la salida.
El recorrido de la sigmoide, , es lo que permite leer su salida como una probabilidad.
La sigmoide se satura: cuando su pendiente tiende a 0, la raíz del desvanecimiento del gradiente.
¿Dónde se utiliza?
Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:
ℒ IA y machine learning
- Redes neuronales★★★★★
- Redes neuronales→Retropropagación (backpropagation)★★★★★
- Redes neuronales→Paisaje de la pérdida (loss landscape)★★★★★
- Redes neuronales→Retropropagación (backpropagation)→Deep learning (aprendizaje profundo)★★★★★
- Redes neuronales→Paisaje de la pérdida (loss landscape)→Optimización de segundo orden (con hessiano)★★★★★
- Redes neuronales→Retropropagación (backpropagation)→Deep learning (aprendizaje profundo)→Redes convolucionales (CNN)★★★★★
- +2
Qué depende de él
Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.