Función de pérdida

Nivel UniversitarioDificultad ★★★★★Aplicación⌖ Ver en el mapa

¿Qué es?

Un único número L(θ)L(\theta) que mide lo equivocado que está un modelo de parámetros θ\theta sobre los datos. Aprender es minimizarlo. El error cuadrático medio para regresión y la entropía cruzada para clasificación son las dos que usa todo el mundo.

¿Por qué existe?

«Que el modelo sea bueno» no es algo que un algoritmo pueda optimizar; «que este número derivable sea pequeño», sí. La pérdida convierte el objetivo en una función de los parámetros, para que el cálculo (derivadas, gradientes, convexidad) tome el relevo.

Intuición

Un paisaje sobre el espacio de parámetros: altura = error. Cada punto es un modelo posible; entrenar es bajar. La forma de la pérdida decide qué significa «equivocarse»: el error cuadrático castiga mucho los errores grandes, el absoluto es robusto a valores atípicos y la entropía cruzada castiga sin límite las probabilidades equivocadas y seguras.

Definición formal

Riesgo empírico sobre un conjunto de datos {(xi,yi)}i=1N\{(x_i, y_i)\}_{i=1}^N:

L(θ)=1N∑i=1Nℓ(fθ(xi),yi),L(\theta) = \frac1N\sum_{i=1}^N \ell\big(f_\theta(x_i), y_i\big),

una estimación del riesgo esperado 𝔼(x,y)∼P[ℓ(fθ(x),y)]\E_{(x,y)\sim P}[\ell(f_\theta(x), y)].

Fórmulas

MSE=1N∑i(y^i−yi)2\text{MSE} = \frac1N\sum_i\big(\hat y_i - y_i\big)^2
CE=−1N∑i∑kyiklog⁡p^ik,p^=softmax⁡(z)\text{CE} = -\frac1N\sum_i\sum_k y_{ik}\log\hat p_{ik}, \qquad \hat p = \operatorname{softmax}(z)
∂ CE∂zk=p^k−yk\frac{\partial\,\text{CE}}{\partial z_k} = \hat p_k - y_k
softmax + entropía cruzada: el gradiente es simplemente «predicción menos objetivo»

¿Por qué importa?

Elegir la pérdida es elegir en qué será bueno el modelo. Tiene que ser derivable (casi en todas partes) para entrenar por gradiente, y numéricamente estable; por eso los frameworks fusionan softmax y entropía cruzada en una sola operación.

Las matemáticas que hay detrás

  • Funciones logarítmicas★★★★★fundamental

    La entropía cruzada es una log-verosimilitud negativa; el log convierte el producto sobre muestras en una suma.

  • Máximos y mínimos★★★★★fundamental

    Entrenar es buscar los parámetros que minimizan la pérdida; en la práctica, un buen mínimo local.

  • Convexidad y concavidad★★★★★fundamental

    El error cuadrático y la entropía cruzada son convexos en las predicciones; en modelos lineales, también en los parámetros.

  • Funciones de varias variables★★★★★fundamental

    Una pérdida es una función escalar de todos los parámetros del modelo.

  • Esperanza★★★★★fundamental

    El objetivo del aprendizaje es la pérdida esperada (riesgo) sobre la distribución de los datos.

  • Estimación por máxima verosimilitud★★★★★fundamental

    El MSE y la entropía cruzada son log-verosimilitudes negativas bajo modelos gaussianos y categóricos.

  • Estabilidad numérica★★★★★frecuente

    Las librerías fusionan softmax y entropía cruzada (log-sum-exp) porque la composición ingenua desborda.

  • Función de densidad de probabilidad★★★★★fundamental

    Las pérdidas de regresión son log-densidades negativas: error cuadrático ↔ ruido gaussiano, error absoluto ↔ ruido de Laplace.

  • Valor absoluto★★★★★frecuente

    La pérdida L1 o error absoluto medio 1n∑∣yi−y^i∣\frac1n\sum|y_i - \hat y_i| es robusta a valores atípicos pero no es derivable en 0.

  • Derivabilidad y derivadas laterales★★★★★frecuente

    Las pérdidas L1 y hinge no son derivables en un punto y se optimizan con subgradientes.

  • Integral definida★★★★★frecuente

    El riesgo verdadero 𝔼[ℓ]=∫ℓ dP\E[\ell] = \int \ell\,\dd P es una integral; la pérdida de entrenamiento es su media muestral.

¿Dónde se utiliza?

Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:

Qué depende de él

Ejercicios

1IA

Un clasificador da p^=0,01\hat p = 0{,}01 a la clase verdadera. ¿Cuál es su entropía cruzada? ¿Y con p^=0,9\hat p = 0{,}9?

Solución

−ln⁡0,01≈4,6-\ln 0{,}01 \approx 4{,}6 frente a −ln⁡0,9≈0,105-\ln 0{,}9 \approx 0{,}105. Las predicciones equivocadas y seguras se castigan unas 44 veces más.

↑ ↓ para navegar · ↵ · Esc