Estimación por máxima verosimilitud

Nivel AvanzadoDificultad ★★★★★Concepto⌖ Ver en el mapa

¿Qué es?

Elegir los parámetros que hacen más probables los datos observados: maximizar ∏ip(xi∣θ)\prod_i p(x_i\mid\theta), es decir, minimizar −∑ilog⁡p(xi∣θ)-\sum_i\log p(x_i\mid\theta). El error cuadrático, la entropía cruzada y el objetivo de entrenamiento de los modelos de lenguaje son todos log-verosimilitudes negativas.

¿Por qué existe?

Hace falta una forma con fundamento de ajustar un modelo a los datos. La respuesta de Fisher (1922): un valor del parámetro es plausible en la medida en que predijo lo que de verdad ocurrió. En condiciones suaves el EMV es consistente y asintóticamente el estimador más eficiente.

Intuición

Desliza una gaussiana a izquierda y derecha sobre un conjunto de puntos: la posición donde el producto de las alturas en los puntos es máximo es la media muestral. Tomar logaritmos convierte el producto en una suma (numéricamente estable y fácil de derivar), y anular la derivada encuentra el pico.

Definición formal

Dados datos i.i.d. x1,…,xNx_1, \dots, x_N y un modelo p(x∣θ)p(x\mid\theta),

θ^EMV=arg⁡max⁡θ∑i=1Nlog⁡p(xi∣θ)=arg⁡min⁡θ(−1N∑i=1Nlog⁡p(xi∣θ)).\hat\theta_{\text{EMV}} = \arg\max_\theta\sum_{i=1}^N\log p(x_i\mid\theta) = \arg\min_\theta\Big(-\frac1N\sum_{i=1}^N\log p(x_i\mid\theta)\Big).

Normalmente se halla resolviendo ∇θ∑ilog⁡p(xi∣θ)=0\nabla_\theta\sum_i\log p(x_i\mid\theta) = 0, en forma cerrada o con métodos de gradiente.

Fórmulas

θ^=arg⁡max⁡θ∑ilog⁡p(xi∣θ)\hat\theta = \arg\max_\theta \sum_i \log p(x_i\mid\theta)
y=fθ(x)+ε, ε∼𝒩(0,σ2)  ⟹  −log⁡p=(y−fθ(x))22σ2+consty = f_\theta(x) + \varepsilon,\ \varepsilon\sim\mathcal N(0,\sigma^2) \implies -\log p = \frac{(y - f_\theta(x))^2}{2\sigma^2} + \text{const}
ruido gaussiano ⇒ error cuadrático
−∑tlog⁡pθ(wt∣w<t)-\sum_t \log p_\theta(w_t \mid w_{<t})
la pérdida de entrenamiento de un modelo de lenguaje

Ejemplo

Gaussiana de media desconocida y σ\sigma conocida: ℓ(μ)=−∑(xi−μ)22σ2+cte\ell(\mu) = -\sum\frac{(x_i - \mu)^2}{2\sigma^2} + \text{cte}; ℓ′(μ)=∑xi−μσ2=0⇒μ^=xˉ\ell'(\mu) = \sum\frac{x_i - \mu}{\sigma^2} = 0 \Rightarrow \hat\mu = \bar x. Moneda con kk caras en nn lanzamientos: ℓ(p)=kln⁡p+(n−k)ln⁡(1−p)\ell(p) = k\ln p + (n - k)\ln(1 - p), ℓ′(p)=0⇒p^=k/n\ell'(p) = 0 \Rightarrow \hat p = k/n.

¿Por qué importa?

La mayoría de las funciones de pérdida del aprendizaje automático son máxima verosimilitud disfrazada, lo que dice qué pérdida corresponde a qué hipótesis de ruido. La regresión logística, los clasificadores softmax, los modelos de lenguaje y los normalizing flows se entrenan por máxima verosimilitud; los modelos de difusión, con una cota de ella.

Dónde aparece en IA

  • Función de pérdida★★★★★fundamentalIA y machine learning

    El MSE y la entropía cruzada son log-verosimilitudes negativas bajo modelos gaussianos y categóricos.

  • Regresión logística★★★★★fundamentalIA y machine learning

    La regresión logística es el EMV de un modelo de Bernoulli con p=σ(w⋅x+b)p = \sigma(w\cdot x + b).

  • Modelos generativos★★★★★fundamentalIA y machine learning

    Los modelos autorregresivos y los flows maximizan la verosimilitud exactamente; los VAE y los modelos de difusión, una cota inferior (ELBO).

¿Dónde se utiliza?

Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:

Ejercicios

1Cálculo directo

Halla el EMV de λ\lambda para datos exponenciales x1,…,xNx_1, \dots, x_N.

Solución

ℓ(λ)=Nln⁡λ−λ∑xi\ell(\lambda) = N\ln\lambda - \lambda\sum x_i; ℓ′(λ)=N/λ−∑xi=0⇒λ^=1/xˉ\ell'(\lambda) = N/\lambda - \sum x_i = 0 \Rightarrow \hat\lambda = 1/\bar x.

2IA

Demuestra que si el ruido es de Laplace, p(ε)∝e−∣ε∣/bp(\varepsilon) \propto e^{-|\varepsilon|/b}, la regresión por máxima verosimilitud minimiza el error absoluto.

Solución

−log⁡p(y∣x)=∣y−fθ(x)∣/b+cte-\log p(y\mid x) = |y - f_\theta(x)|/b + \text{cte}; sumando sobre los datos, maximizar la verosimilitud es minimizar ∑∣yi−fθ(xi)∣\sum|y_i - f_\theta(x_i)|.

↑ ↓ para navegar · ↵ · Esc