Descenso de gradiente estocástico (SGD)

Nivel AvanzadoDificultad ★★★★★Aplicación⌖ Ver en el mapa

¿Qué es?

Usar el gradiente de un lote pequeño aleatorio en vez del de todo el conjunto de datos: una estimación ruidosa pero insesgada, miles de veces más barata. El ruido incluso ayuda a escapar de sillas y de mínimos estrechos.

Fórmulas

θk+1=θk−ηk 1∣Bk∣∑i∈Bk∇ℓi(θk)\theta_{k+1} = \theta_k - \eta_k\,\frac{1}{|B_k|}\sum_{i\in B_k}\nabla\ell_i(\theta_k)
∑kηk=∞,∑kηk2<∞\sum_k\eta_k = \infty, \qquad \sum_k\eta_k^2 < \infty
condiciones de Robbins–Monro sobre el paso para converger

Las matemáticas que hay detrás

  • Esperanza★★★★★fundamental

    El gradiente de un mini-lote es una estimación insesgada del gradiente esperado.

  • Varianza★★★★★frecuente

    La varianza del ruido del gradiente cae como 1/∣B∣1/|B|; fija el learning rate y el tamaño de lote útiles.

¿Dónde se utiliza?

Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:

Qué depende de él

Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.

↑ ↓ para navegar · ↵ · Esc