Funciones de activación

Nivel UniversitarioDificultad ★★★★★Aplicación⌖ Ver en el mapa

¿Qué es?

Las funciones no lineales que se aplican tras cada capa lineal. Sin ellas una red profunda se reduce a una sola aplicación lineal. Sus derivadas importan tanto como sus valores: las sigmoides se saturan (desvanecimiento del gradiente) y ReLU deja pasar el gradiente sin cambios donde está activa.

Fórmulas

σ(z)=11+e−z,tanh⁡z,ReLU⁡(z)=max⁡(0,z),GELU⁡(z)=z Φ(z)\sigma(z) = \frac{1}{1 + e^{-z}}, \quad \tanh z, \quad \operatorname{ReLU}(z) = \max(0, z), \quad \operatorname{GELU}(z) = z\,\Phi(z)
σ′=σ(1−σ)≤14,ReLU⁡′(z)=𝟏[z>0]\sigma' = \sigma(1-\sigma) \le \tfrac14, \qquad \operatorname{ReLU}'(z) = \mathbf 1[z > 0]

¿Por qué importa?

El paso de la sigmoide a ReLU (hacia 2011) fue uno de los pequeños hechos de cálculo que hicieron entrenable el deep learning.

Las matemáticas que hay detrás

  • Derivadas de funciones elementales★★★★★fundamental

    σ′=σ(1−σ)\sigma' = \sigma(1 - \sigma) y tanh⁡′=1−tanh⁡2\tanh' = 1 - \tanh^2: la retropropagación reutiliza el valor calculado hacia delante.

  • Funciones exponenciales★★★★★frecuente

    La sigmoide, la softmax y la tanh se construyen con exe^x.

  • Continuidad★★★★★fundamental

    Las activaciones deben ser continuas (y derivables casi en todas partes) para que funcione el entrenamiento por gradiente.

  • Discontinuidades★★★★★histórica

    La activación escalón del perceptrón es discontinua; sustituirla por la sigmoide hizo posible la retropropagación.

  • Derivabilidad y derivadas laterales★★★★★fundamental

    ReLU tiene f−′(0)=0≠1=f+′(0)f'_-(0) = 0 \ne 1 = f'_+(0); los frameworks simplemente eligen un valor (normalmente 0) en el pico.

  • Funciones hiperbólicas★★★★★frecuente

    tanh⁡\tanh comprime a (−1,1)(-1,1) y su derivada 1−tanh⁡21 - \tanh^2 se calcula barato a partir de la salida.

  • Dominio y recorrido★★★★★frecuente

    El recorrido de la sigmoide, (0,1)(0,1), es lo que permite leer su salida como una probabilidad.

  • Límites en el infinito★★★★★frecuente

    La sigmoide se satura: cuando ∣x∣→∞|x| \to \infty su pendiente tiende a 0, la raíz del desvanecimiento del gradiente.

¿Dónde se utiliza?

Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:

Qué depende de él

Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.

↑ ↓ para navegar · ↵ · Esc