Esperanza

Nivel UniversitarioDificultad ★★★★★Concepto⌖ Ver en el mapa

¿Qué es?

𝔼[X]=∫x p(x) dx\E[X] = \int x\,p(x)\,\dd x: la media ponderada por la probabilidad, el centro de masas de la distribución. En general 𝔼[g(X)]=∫g(x) p(x) dx\E[g(X)] = \int g(x)\,p(x)\,\dd x, y la pérdida esperada sobre la distribución de los datos es lo que de verdad minimiza el aprendizaje.

¿Por qué existe?

Para resumir una magnitud aleatoria con un número que se porta bien: es lineal, es aquello a lo que convergen las medias de muchas muestras (ley de los grandes números), y las decisiones que maximizan el valor esperado son óptimas a largo plazo.

Intuición

Equilibra la gráfica de la densidad sobre el filo de un cuchillo: se equilibra en 𝔼[X]\E[X]. Y la media de NN muestras independientes la estima con un error del orden de σ/N\sigma/\sqrt N, el principio detrás de Monte Carlo, de los gradientes por mini-lotes y de los tests A/B.

Definición formal

𝔼[g(X)]=∫−∞∞g(x) p(x) dx\E[g(X)] = \int_{-\infty}^{\infty} g(x)\,p(x)\,\dd x cuando la integral converge absolutamente. Linealidad: 𝔼[aX+bY]=a𝔼[X]+b𝔼[Y]\E[aX + bY] = a\E[X] + b\E[Y] (siempre, incluso con variables dependientes). Ley de los grandes números: 1N∑i=1Ng(Xi)→𝔼[g(X)]\frac1N\sum_{i=1}^N g(X_i) \to \E[g(X)] para muestras i.i.d.

Fórmulas

𝔼[g(X)]=∫g(x) p(x) dx≈1N∑i=1Ng(xi)\E[g(X)] = \int g(x)\,p(x)\,\dd x \approx \frac1N\sum_{i=1}^{N} g(x_i)
R(θ)=𝔼(x,y)∼P[ℓ(fθ(x),y)]≈1∣B∣∑(x,y)∈Bℓ(fθ(x),y)R(\theta) = \E_{(x,y)\sim P}\big[\ell(f_\theta(x), y)\big] \approx \frac{1}{|B|}\sum_{(x,y)\in B}\ell(f_\theta(x), y)
riesgo esperado y su estimación con un mini-lote
∇θ 𝔼[ℓ]=𝔼[∇θ ℓ]\nabla_\theta\,\E[\ell] = \E[\nabla_\theta\,\ell]
por qué los gradientes estocásticos son insesgados

¿Por qué importa?

Entrenar minimiza una esperanza que no se puede calcular, siguiendo estimaciones ruidosas e insesgadas de su gradiente (SGD). El aprendizaje por refuerzo maximiza el retorno esperado. El renderizado de Monte Carlo calcula el color de los píxeles como esperanzas sobre caminos de luz aleatorios.

Aplicaciones en informática

  • Métodos de Monte Carlo★★★★★fundamentalComputación científica y algoritmos

    Monte Carlo estima esperanzas con medias muestrales.

  • Teoría de colas y rendimiento★★★★★frecuenteOptimización y sistemas

    La ley de Little L=λWL = \lambda W relaciona la longitud media de la cola con el tiempo medio de espera.

Dónde aparece en IA

  • Función de pérdida★★★★★fundamentalIA y machine learning

    El objetivo del aprendizaje es la pérdida esperada (riesgo) sobre la distribución de los datos.

  • Descenso de gradiente estocástico (SGD)★★★★★fundamentalIA y machine learning

    El gradiente de un mini-lote es una estimación insesgada del gradiente esperado.

  • Aprendizaje por refuerzo★★★★★fundamentalIA y machine learning

    Los agentes maximizan el retorno descontado esperado; los gradientes de política derivan una esperanza.

¿Dónde se utiliza?

Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:

Qué depende de él

Ejercicios

1Cálculo directo

Calcula 𝔼[X]\E[X] para la densidad exponencial p(x)=λe−λxp(x) = \lambda e^{-\lambda x}, x≥0x \ge 0.

Solución

Por partes: ∫0∞xλe−λx dx=[−xe−λx]0∞+∫0∞e−λx dx=1λ\int_0^\infty x\lambda e^{-\lambda x}\,\dd x = \big[-xe^{-\lambda x}\big]_0^\infty + \int_0^\infty e^{-\lambda x}\,\dd x = \frac1\lambda.

2IA

¿Por qué el gradiente de la pérdida de un mini-lote aleatorio es una estimación insesgada del gradiente completo? ¿Qué hipótesis hace falta?

Solución

Si el lote se elige uniformemente al azar, 𝔼[1∣B∣∑i∈B∇ℓi]=1N∑i∇ℓi\E[\frac1{|B|}\sum_{i\in B}\nabla\ell_i] = \frac1N\sum_i\nabla\ell_i por la linealidad de la esperanza (e intercambiando gradiente y esperanza, lo que exige algo de suavidad). Los lotes no aleatorios (por ejemplo, datos ordenados) lo rompen.

↑ ↓ para navegar · ↵ · Esc