Probabilidad y cálculo
La probabilidad continua es cálculo: las densidades se integran para obtener probabilidades, las esperanzas son integrales y la máxima verosimilitud es anular una derivada. El núcleo matemático de la estadística y de la IA probabilística.
7 conceptos
Para resultados discretos la probabilidad es contar; para continuos (una temperatura, el valor de un píxel, los pesos de un modelo) los valores sueltos tienen probabilidad cero y todo se expresa con densidades e integrales. Por ahí entran las integrales en el aprendizaje automático: pérdidas esperadas, verosimilitudes, posteriores bayesianas y los calendarios de ruido de los modelos de difusión. Para la parte discreta y de teoría de la información, mira Math of AI · Probabilidad.
Conceptos
Variables aleatorias continuas
Una magnitud aleatoria que puede tomar cualquier valor de un intervalo. para cada concreto; solo los intervalos tienen probabilidad positiva, que se obtiene integrando una densidad.
Función de densidad de probabilidad
Una función con cuya integral sobre un conjunto es la probabilidad de ese conjunto. Una densidad no es una probabilidad: puede superar 1; es probabilidad por unidad de longitud.
Función de distribución acumulada
. Por el teorema fundamental, . Su inversa (la función cuantil) convierte números aleatorios uniformes en muestras de cualquier distribución.
Esperanza
: la media ponderada por la probabilidad, el centro de masas de la distribución. En general , y la pérdida esperada sobre la distribución de los datos es lo que de verdad minimiza el aprendizaje.
Varianza
: la distancia cuadrática media a la media. La varianza de una media de muestras independientes es : la ley de que gobierna el error de Monte Carlo, el tamaño de los lotes y los tests A/B.
Distribuciones continuas
Las de batalla: uniforme (generadores de números aleatorios), exponencial (tiempos de espera, sin memoria), normal (sumas de muchos efectos pequeños, por el teorema central del límite) y sus versiones multivariantes.
Estimación por máxima verosimilitud
Elegir los parámetros que hacen más probables los datos observados: maximizar , es decir, minimizar . El error cuadrático, la entropía cruzada y el objetivo de entrenamiento de los modelos de lenguaje son todos log-verosimilitudes negativas.
A dónde lleva esta área en informática
ℒ IA y machine learning ★★★★★
- Función de pérdida★★★★★←Función de densidad de probabilidad, Esperanza, Estimación por máxima verosimilitud
- Regresión logística★★★★★←Estimación por máxima verosimilitud
- Descenso de gradiente estocástico (SGD)★★★★★←Esperanza, Varianza
- Aprendizaje por refuerzo★★★★★←Esperanza
- Inferencia bayesiana★★★★★←Función de densidad de probabilidad
- Modelos generativos★★★★★←Variables aleatorias continuas, Función de densidad de probabilidad, Distribuciones continuas, Estimación por máxima verosimilitud
- Momento y Adam★★★★★←Varianza
- Redes neuronales★★★★★←Varianza