Momento y Adam

Nivel AvanzadoDificultad ★★★★★Aplicación⌖ Ver en el mapa

¿Qué es?

El momento promedia gradientes pasados (una bola pesada que sigue rodando por los barrancos); RMSProp divide por la media cuadrática móvil del gradiente (pasos por parámetro). Adam combina ambos y es el optimizador por defecto del deep learning.

Fórmulas

mt=β1mt−1+(1−β1)gt,vt=β2vt−1+(1−β2)gt2,θt=θt−1−η m^tv^t+ϵm_t = \beta_1 m_{t-1} + (1-\beta_1)g_t, \quad v_t = \beta_2 v_{t-1} + (1-\beta_2)g_t^2, \quad \theta_t = \theta_{t-1} - \eta\,\frac{\hat m_t}{\sqrt{\hat v_t} + \epsilon}
Adam (con correcciones de sesgo m^,v^\hat m, \hat v)

Las matemáticas que hay detrás

  • Varianza★★★★★frecuente

    Adam divide por una estimación móvil del segundo momento del gradiente.

  • El descenso de gradiente con momento es un oscilador amortiguado discretizado (EDO de la bola pesada) rodando por el paisaje de pérdida.

¿Dónde se utiliza?

Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:

Qué depende de él

Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.

↑ ↓ para navegar · ↵ · Esc