¿Qué es?
Un único número que mide lo equivocado que está un modelo de parámetros sobre los datos. Aprender es minimizarlo. El error cuadrático medio para regresión y la entropía cruzada para clasificación son las dos que usa todo el mundo.
¿Por qué existe?
«Que el modelo sea bueno» no es algo que un algoritmo pueda optimizar; «que este número derivable sea pequeño», sí. La pérdida convierte el objetivo en una función de los parámetros, para que el cálculo (derivadas, gradientes, convexidad) tome el relevo.
Intuición
Un paisaje sobre el espacio de parámetros: altura = error. Cada punto es un modelo posible; entrenar es bajar. La forma de la pérdida decide qué significa «equivocarse»: el error cuadrático castiga mucho los errores grandes, el absoluto es robusto a valores atípicos y la entropía cruzada castiga sin límite las probabilidades equivocadas y seguras.
Definición formal
Riesgo empírico sobre un conjunto de datos :
una estimación del riesgo esperado .
Fórmulas
- softmax + entropía cruzada: el gradiente es simplemente «predicción menos objetivo»
¿Por qué importa?
Elegir la pérdida es elegir en qué será bueno el modelo. Tiene que ser derivable (casi en todas partes) para entrenar por gradiente, y numéricamente estable; por eso los frameworks fusionan softmax y entropía cruzada en una sola operación.
Las matemáticas que hay detrás
La entropía cruzada es una log-verosimilitud negativa; el log convierte el producto sobre muestras en una suma.
Entrenar es buscar los parámetros que minimizan la pérdida; en la práctica, un buen mínimo local.
El error cuadrático y la entropía cruzada son convexos en las predicciones; en modelos lineales, también en los parámetros.
Una pérdida es una función escalar de todos los parámetros del modelo.
El objetivo del aprendizaje es la pérdida esperada (riesgo) sobre la distribución de los datos.
El MSE y la entropía cruzada son log-verosimilitudes negativas bajo modelos gaussianos y categóricos.
Las librerías fusionan softmax y entropía cruzada (log-sum-exp) porque la composición ingenua desborda.
Las pérdidas de regresión son log-densidades negativas: error cuadrático ↔ ruido gaussiano, error absoluto ↔ ruido de Laplace.
La pérdida L1 o error absoluto medio es robusta a valores atípicos pero no es derivable en 0.
Las pérdidas L1 y hinge no son derivables en un punto y se optimizan con subgradientes.
El riesgo verdadero es una integral; la pérdida de entrenamiento es su media muestral.
¿Dónde se utiliza?
Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:
Qué depende de él
Ejercicios
Un clasificador da a la clase verdadera. ¿Cuál es su entropía cruzada? ¿Y con ?
Solución
frente a . Las predicciones equivocadas y seguras se castigan unas 44 veces más.