∇ Matemáticas para IA
El camino honesto más corto de las derivadas al deep learning: gradientes, optimización, verosimilitud y retropropagación.
- 01
Funciones
Una regla que asigna a cada entrada de un conjunto exactamente una salida de un conjunto . El cálculo estudia cómo cambian las salidas cuando cambian las entradas; computar es, literalmente, evaluar funciones.
- 02
Derivada
es la tasa de cambio instantánea de en : la pendiente de la recta tangente a la gráfica, definida como el límite de las pendientes de las rectas secantes.
- 03
Regla de la cadena
La derivada de una composición es el producto de las derivadas: . Las tasas de cambio se multiplican a lo largo de una cadena, y la retropropagación es esta regla aplicada, de forma muy eficiente, a una red neuronal.
- 04
Derivadas parciales
: la derivada respecto de una variable, dejando fijas las demás. Cada una responde a «¿cuánto depende la salida de esta entrada?»; en una red neuronal, de este peso.
- 05
Gradiente
: el vector de todas las derivadas parciales. Apunta en la dirección de máximo ascenso, su longitud es esa pendiente máxima y es perpendicular a los conjuntos de nivel. Si caminas en contra bajas lo más deprisa posible.
- 06
Regla de la cadena multivariable
Cuando una variable influye en la salida por varios caminos, se suman las aportaciones de cada camino, cada una producto de las derivadas locales a lo largo de él: . En forma matricial, las jacobianas se multiplican. Es exactamente lo que calcula la retropropagación sobre el grafo de una red.
- 07
Convexidad y concavidad
es convexa si la cuerda entre dos puntos cualesquiera de su gráfica queda por encima de la gráfica; para suave, equivalentemente, si . En las funciones convexas todo mínimo local es global, y por eso los problemas convexos son los que la optimización resuelve de forma fiable.
- 08
Descenso de gradiente
Repetir : dar un paso pequeño en contra del gradiente. Cauchy lo propuso en 1847; hoy (con sus variantes estocásticas y adaptativas) entrena prácticamente todas las redes neuronales.
- 09
Función de densidad de probabilidad
Una función con cuya integral sobre un conjunto es la probabilidad de ese conjunto. Una densidad no es una probabilidad: puede superar 1; es probabilidad por unidad de longitud.
- 10
Estimación por máxima verosimilitud
Elegir los parámetros que hacen más probables los datos observados: maximizar , es decir, minimizar . El error cuadrático, la entropía cruzada y el objetivo de entrenamiento de los modelos de lenguaje son todos log-verosimilitudes negativas.
- 11
Función de pérdida
Un único número que mide lo equivocado que está un modelo de parámetros sobre los datos. Aprender es minimizarlo. El error cuadrático medio para regresión y la entropía cruzada para clasificación son las dos que usa todo el mundo.
- 12
Redes neuronales
Composiciones de aplicaciones afines y no linealidades, con . Una función derivable con millones de parámetros ajustables, entrenada por descenso de gradiente.
- 13
Retropropagación (backpropagation)
El algoritmo que calcula y para cada capa de una red: una pasada hacia delante guardando los valores intermedios y otra hacia atrás aplicando la regla de la cadena desde la pérdida hasta las entradas. Coste: unas dos veces la pasada hacia delante, sea cual sea el número de parámetros.
- 14
Deep learning (aprendizaje profundo)
Entrenar redes muy profundas (CNN, transformers) con retropropagación y SGD adaptativo sobre conjuntos de datos enormes. El cálculo es el mismo que para una neurona; lo que cambió es la escala, la arquitectura (conexiones residuales, normalización, atención) y el hardware.