¿Qué es?
: la media ponderada por la probabilidad, el centro de masas de la distribución. En general , y la pérdida esperada sobre la distribución de los datos es lo que de verdad minimiza el aprendizaje.
¿Por qué existe?
Para resumir una magnitud aleatoria con un número que se porta bien: es lineal, es aquello a lo que convergen las medias de muchas muestras (ley de los grandes números), y las decisiones que maximizan el valor esperado son óptimas a largo plazo.
Intuición
Equilibra la gráfica de la densidad sobre el filo de un cuchillo: se equilibra en . Y la media de muestras independientes la estima con un error del orden de , el principio detrás de Monte Carlo, de los gradientes por mini-lotes y de los tests A/B.
Definición formal
cuando la integral converge absolutamente. Linealidad: (siempre, incluso con variables dependientes). Ley de los grandes números: para muestras i.i.d.
Fórmulas
- riesgo esperado y su estimación con un mini-lote
- por qué los gradientes estocásticos son insesgados
¿Por qué importa?
Entrenar minimiza una esperanza que no se puede calcular, siguiendo estimaciones ruidosas e insesgadas de su gradiente (SGD). El aprendizaje por refuerzo maximiza el retorno esperado. El renderizado de Monte Carlo calcula el color de los píxeles como esperanzas sobre caminos de luz aleatorios.
Aplicaciones en informática
Monte Carlo estima esperanzas con medias muestrales.
La ley de Little relaciona la longitud media de la cola con el tiempo medio de espera.
Dónde aparece en IA
El objetivo del aprendizaje es la pérdida esperada (riesgo) sobre la distribución de los datos.
El gradiente de un mini-lote es una estimación insesgada del gradiente esperado.
Los agentes maximizan el retorno descontado esperado; los gradientes de política derivan una esperanza.
¿Dónde se utiliza?
Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:
Qué depende de él
Ejercicios
Calcula para la densidad exponencial , .
Solución
Por partes: .
¿Por qué el gradiente de la pérdida de un mini-lote aleatorio es una estimación insesgada del gradiente completo? ¿Qué hipótesis hace falta?
Solución
Si el lote se elige uniformemente al azar, por la linealidad de la esperanza (e intercambiando gradiente y esperanza, lo que exige algo de suavidad). Los lotes no aleatorios (por ejemplo, datos ordenados) lo rompen.