Optimización de segundo orden (con hessiano)

Nivel EspecializaciónDificultad ★★★★★Aplicación⌖ Ver en el mapa

¿Qué es?

Usar la curvatura para elegir el paso: θ←θ−H−1∇L\theta \leftarrow \theta - H^{-1}\nabla L. Convergencia cuadrática cerca de un mínimo e inmune al mal condicionamiento, pero el hessiano de un modelo grande ni siquiera se puede almacenar; por eso en la práctica se usan aproximaciones (L-BFGS, Gauss–Newton, K-FAC, Shampoo).

Fórmulas

θk+1=θk−(∇2L(θk))−1∇L(θk)\theta_{k+1} = \theta_k - \big(\nabla^2 L(\theta_k)\big)^{-1}\nabla L(\theta_k)

Las matemáticas que hay detrás

  • Método de Newton★★★★★fundamental

    Newton sobre ∇f=0\nabla f = 0 usa el hessiano: x←x−H−1∇fx \leftarrow x - H^{-1}\nabla f.

  • Polinomio de Taylor★★★★★fundamental

    Los métodos de Newton y de región de confianza minimizan el modelo de Taylor cuadrático f+g𝖳h+12h𝖳Hhf + g^{\mathsf T}h + \frac12 h^{\mathsf T}Hh.

  • Matriz hessiana★★★★★fundamental

    Newton, Gauss–Newton, el gradiente natural y K-FAC usan el hessiano o una aproximación suya.

  • Derivadas de orden superior★★★★★fundamental

    Las segundas derivadas miden la curvatura; los métodos tipo Newton las usan para elegir el paso.

Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.

↑ ↓ para navegar · ↵ · Esc