¿Qué es?
Elegir los parámetros que hacen más probables los datos observados: maximizar , es decir, minimizar . El error cuadrático, la entropía cruzada y el objetivo de entrenamiento de los modelos de lenguaje son todos log-verosimilitudes negativas.
¿Por qué existe?
Hace falta una forma con fundamento de ajustar un modelo a los datos. La respuesta de Fisher (1922): un valor del parámetro es plausible en la medida en que predijo lo que de verdad ocurrió. En condiciones suaves el EMV es consistente y asintóticamente el estimador más eficiente.
Intuición
Desliza una gaussiana a izquierda y derecha sobre un conjunto de puntos: la posición donde el producto de las alturas en los puntos es máximo es la media muestral. Tomar logaritmos convierte el producto en una suma (numéricamente estable y fácil de derivar), y anular la derivada encuentra el pico.
Definición formal
Dados datos i.i.d. y un modelo ,
Normalmente se halla resolviendo , en forma cerrada o con métodos de gradiente.
Fórmulas
- ruido gaussiano ⇒ error cuadrático
- la pérdida de entrenamiento de un modelo de lenguaje
Ejemplo
Gaussiana de media desconocida y conocida: ; . Moneda con caras en lanzamientos: , .
¿Por qué importa?
La mayoría de las funciones de pérdida del aprendizaje automático son máxima verosimilitud disfrazada, lo que dice qué pérdida corresponde a qué hipótesis de ruido. La regresión logística, los clasificadores softmax, los modelos de lenguaje y los normalizing flows se entrenan por máxima verosimilitud; los modelos de difusión, con una cota de ella.
Dónde aparece en IA
El MSE y la entropía cruzada son log-verosimilitudes negativas bajo modelos gaussianos y categóricos.
La regresión logística es el EMV de un modelo de Bernoulli con .
Los modelos autorregresivos y los flows maximizan la verosimilitud exactamente; los VAE y los modelos de difusión, una cota inferior (ELBO).
¿Dónde se utiliza?
Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:
Ejercicios
Halla el EMV de para datos exponenciales .
Solución
; .
Demuestra que si el ruido es de Laplace, , la regresión por máxima verosimilitud minimiza el error absoluto.
Solución
; sumando sobre los datos, maximizar la verosimilitud es minimizar .