¿Qué es?
El momento promedia gradientes pasados (una bola pesada que sigue rodando por los barrancos); RMSProp divide por la media cuadrática móvil del gradiente (pasos por parámetro). Adam combina ambos y es el optimizador por defecto del deep learning.
Fórmulas
- Adam (con correcciones de sesgo )
Las matemáticas que hay detrás
Adam divide por una estimación móvil del segundo momento del gradiente.
El descenso de gradiente con momento es un oscilador amortiguado discretizado (EDO de la bola pesada) rodando por el paisaje de pérdida.
¿Dónde se utiliza?
Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:
Qué depende de él
Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.