Probabilidad y cálculo

La probabilidad continua es cálculo: las densidades se integran para obtener probabilidades, las esperanzas son integrales y la máxima verosimilitud es anular una derivada. El núcleo matemático de la estadística y de la IA probabilística.

7 conceptos

Para resultados discretos la probabilidad es contar; para continuos (una temperatura, el valor de un píxel, los pesos de un modelo) los valores sueltos tienen probabilidad cero y todo se expresa con densidades e integrales. Por ahí entran las integrales en el aprendizaje automático: pérdidas esperadas, verosimilitudes, posteriores bayesianas y los calendarios de ruido de los modelos de difusión. Para la parte discreta y de teoría de la información, mira Math of AI · Probabilidad.

Conceptos

Variables aleatorias continuas

Una magnitud aleatoria que puede tomar cualquier valor de un intervalo. P(X=x)=0P(X = x) = 0 para cada xx concreto; solo los intervalos tienen probabilidad positiva, que se obtiene integrando una densidad.

Universitario

Función de densidad de probabilidad

Una función p(x)≥0p(x) \ge 0 con ∫p=1\int p = 1 cuya integral sobre un conjunto es la probabilidad de ese conjunto. Una densidad no es una probabilidad: puede superar 1; es probabilidad por unidad de longitud.

Universitario

Función de distribución acumulada

F(x)=P(X≤x)=∫−∞xp(t) dtF(x) = P(X \le x) = \int_{-\infty}^x p(t)\,\dd t. Por el teorema fundamental, F′=pF' = p. Su inversa (la función cuantil) convierte números aleatorios uniformes en muestras de cualquier distribución.

Universitario

Esperanza

𝔼[X]=∫x p(x) dx\E[X] = \int x\,p(x)\,\dd x: la media ponderada por la probabilidad, el centro de masas de la distribución. En general 𝔼[g(X)]=∫g(x) p(x) dx\E[g(X)] = \int g(x)\,p(x)\,\dd x, y la pérdida esperada sobre la distribución de los datos es lo que de verdad minimiza el aprendizaje.

Universitario

Varianza

Var⁡(X)=𝔼[(X−𝔼X)2]\Var(X) = \E[(X - \E X)^2]: la distancia cuadrática media a la media. La varianza de una media de NN muestras independientes es σ2/N\sigma^2/N: la ley de 1/N1/\sqrt N que gobierna el error de Monte Carlo, el tamaño de los lotes y los tests A/B.

Universitario

Distribuciones continuas

Las de batalla: uniforme (generadores de números aleatorios), exponencial (tiempos de espera, sin memoria), normal (sumas de muchos efectos pequeños, por el teorema central del límite) y sus versiones multivariantes.

Universitario

Estimación por máxima verosimilitud

Elegir los parámetros que hacen más probables los datos observados: maximizar ∏ip(xi∣θ)\prod_i p(x_i\mid\theta), es decir, minimizar −∑ilog⁡p(xi∣θ)-\sum_i\log p(x_i\mid\theta). El error cuadrático, la entropía cruzada y el objetivo de entrenamiento de los modelos de lenguaje son todos log-verosimilitudes negativas.

Avanzado

A dónde lleva esta área en informática

↑ ↓ para navegar · ↵ · Esc