Redes neuronales

Nivel AvanzadoDificultad ★★★★★Aplicación⌖ Ver en el mapa

¿Qué es?

Composiciones de aplicaciones afines y no linealidades, fθ=fL∘⋯∘f1f_\theta = f_L\circ\dots\circ f_1 con fℓ(a)=σ(Wℓa+bℓ)f_\ell(a) = \sigma(W_\ell a + b_\ell). Una función derivable con millones de parámetros ajustables, entrenada por descenso de gradiente.

¿Por qué existe?

Los modelos lineales no pueden representar el XOR, y mucho menos imágenes o lenguaje. Apilar capas derivables sencillas da una familia de funciones lo bastante flexible para aproximar casi cualquier cosa (aproximación universal) sin perder la propiedad que más importa: se puede calcular el gradiente de la pérdida respecto de cada parámetro.

Intuición

Cada capa dobla y pliega un poco el espacio: la aplicación lineal gira y estira, la activación recorta o comprime. Tras suficientes pliegues, clases que estaban enredadas pasan a ser separables por un plano. Una sola neurona σ(w⋅x+b)\sigma(w\cdot x + b) es un escalón suave a través de un hiperplano; sumas de muchos escalones así construyen cualquier bulto.

Definición formal

a(0)=x,z(ℓ)=W(ℓ)a(ℓ−1)+b(ℓ),a(ℓ)=σ(z(ℓ)),y^=a(L).a^{(0)} = x, \qquad z^{(\ell)} = W^{(\ell)}a^{(\ell-1)} + b^{(\ell)}, \qquad a^{(\ell)} = \sigma\big(z^{(\ell)}\big), \qquad \hat y = a^{(L)}.

Aproximación universal (Cybenko 1989, Hornik 1991): una capa oculta con suficientes neuronas y una activación no polinómica aproxima cualquier función continua en un compacto con la precisión que se quiera.

Fórmulas

y^=σ(Wx+b)\hat y = \sigma\big(W x + b\big)
una capa
fθ(x)=W3 σ(W2 σ(W1x+b1)+b2)+b3f_\theta(x) = W_3\,\sigma\big(W_2\,\sigma(W_1 x + b_1) + b_2\big) + b_3
un perceptrón de 3 capas

¿Por qué importa?

La visión, el habla, la traducción, el plegamiento de proteínas, los juegos y los modelos de lenguaje son redes neuronales. Matemáticamente son «solo» composiciones de funciones derivables, y precisamente por eso el cálculo puede entrenarlas.

Las matemáticas que hay detrás

  • Funciones★★★★★fundamental

    Una red es una función parametrizada fθ:ℝn→ℝmf_\theta : \R^n \to \R^m; entrenar es elegir θ\theta.

  • Composición★★★★★fundamental

    Una red profunda es la composición de sus capas, fL∘⋯∘f1f_L \circ \dots \circ f_1.

  • Vectores★★★★★fundamental

    Las entradas, activaciones y parámetros son vectores (y tensores) de ℝn\R^n.

  • Producto escalar★★★★★fundamental

    Cada neurona calcula w⋅x+bw \cdot x + b antes de su activación.

  • Matrices y aplicaciones lineales★★★★★fundamental

    Una capa densa es σ(Wx+b)\sigma(Wx + b); las GPU existen para multiplicar estas matrices deprisa.

  • Atractores★★★★★histórica

    Las redes de Hopfield almacenan recuerdos como atractores puntuales de una dinámica que baja la energía (Nobel de Física 2024).

  • Varianza★★★★★frecuente

    La inicialización de Xavier/He elige varianzas de los pesos para que las activaciones mantengan una varianza estable entre capas.

  • Sistemas dinámicos★★★★★avanzada

    Las redes recurrentes son sistemas dinámicos discretos ht+1=σ(Wht+Uxt)h_{t+1} = \sigma(Wh_t + Ux_t); la explosión y el desvanecimiento del gradiente son cuestiones de estabilidad.

  • Continuidad uniforme★★★★★avanzada

    Las demostraciones del teorema de aproximación universal usan la continuidad uniforme en compactos.

¿Dónde se utiliza?

Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:

Qué depende de él

Para seguir

↑ ↓ para navegar · ↵ · Esc