¿Qué es?
Composiciones de aplicaciones afines y no linealidades, con . Una función derivable con millones de parámetros ajustables, entrenada por descenso de gradiente.
¿Por qué existe?
Los modelos lineales no pueden representar el XOR, y mucho menos imágenes o lenguaje. Apilar capas derivables sencillas da una familia de funciones lo bastante flexible para aproximar casi cualquier cosa (aproximación universal) sin perder la propiedad que más importa: se puede calcular el gradiente de la pérdida respecto de cada parámetro.
Intuición
Cada capa dobla y pliega un poco el espacio: la aplicación lineal gira y estira, la activación recorta o comprime. Tras suficientes pliegues, clases que estaban enredadas pasan a ser separables por un plano. Una sola neurona es un escalón suave a través de un hiperplano; sumas de muchos escalones así construyen cualquier bulto.
Definición formal
Aproximación universal (Cybenko 1989, Hornik 1991): una capa oculta con suficientes neuronas y una activación no polinómica aproxima cualquier función continua en un compacto con la precisión que se quiera.
Fórmulas
- una capa
- un perceptrón de 3 capas
¿Por qué importa?
La visión, el habla, la traducción, el plegamiento de proteínas, los juegos y los modelos de lenguaje son redes neuronales. Matemáticamente son «solo» composiciones de funciones derivables, y precisamente por eso el cálculo puede entrenarlas.
Las matemáticas que hay detrás
Una red es una función parametrizada ; entrenar es elegir .
Una red profunda es la composición de sus capas, .
Las entradas, activaciones y parámetros son vectores (y tensores) de .
Cada neurona calcula antes de su activación.
Una capa densa es ; las GPU existen para multiplicar estas matrices deprisa.
Las redes de Hopfield almacenan recuerdos como atractores puntuales de una dinámica que baja la energía (Nobel de Física 2024).
La inicialización de Xavier/He elige varianzas de los pesos para que las activaciones mantengan una varianza estable entre capas.
Las redes recurrentes son sistemas dinámicos discretos ; la explosión y el desvanecimiento del gradiente son cuestiones de estabilidad.
Las demostraciones del teorema de aproximación universal usan la continuidad uniforme en compactos.
¿Dónde se utiliza?
Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:
ℒ IA y machine learning
- Retropropagación (backpropagation)★★★★★
- Paisaje de la pérdida (loss landscape)★★★★★
- Retropropagación (backpropagation)→Deep learning (aprendizaje profundo)★★★★★
- Paisaje de la pérdida (loss landscape)→Optimización de segundo orden (con hessiano)★★★★★
- Retropropagación (backpropagation)→Deep learning (aprendizaje profundo)→Redes convolucionales (CNN)★★★★★
- Retropropagación (backpropagation)→Deep learning (aprendizaje profundo)→Modelos generativos★★★★★
- +1