¿Qué es?
Usar el gradiente de un lote pequeño aleatorio en vez del de todo el conjunto de datos: una estimación ruidosa pero insesgada, miles de veces más barata. El ruido incluso ayuda a escapar de sillas y de mínimos estrechos.
Fórmulas
- condiciones de Robbins–Monro sobre el paso para converger
Las matemáticas que hay detrás
El gradiente de un mini-lote es una estimación insesgada del gradiente esperado.
La varianza del ruido del gradiente cae como ; fija el learning rate y el tamaño de lote útiles.
¿Dónde se utiliza?
Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:
ℒ IA y machine learning
- Momento y Adam★★★★★
- Momento y Adam→Deep learning (aprendizaje profundo)★★★★★
- Momento y Adam→Deep learning (aprendizaje profundo)→Redes convolucionales (CNN)★★★★★
- Momento y Adam→Deep learning (aprendizaje profundo)→Modelos generativos★★★★★
- Momento y Adam→Deep learning (aprendizaje profundo)→Neural ODE★★★★★
Qué depende de él
Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.