¿Qué es?
La matriz de segundas derivadas parciales : la curvatura de en todas las direcciones. Sus valores propios clasifican los puntos críticos (mínimo, máximo, silla) y controlan lo deprisa que pueden ir los optimizadores.
¿Por qué existe?
El gradiente dice hacia dónde es cuesta abajo, pero no cómo cambia la pendiente: si el valle es un cuenco suave, un barranco estrecho o una silla de montar. Esa información de segundo orden decide si un punto crítico es un mínimo y qué tamaño de paso es seguro.
Intuición
Cerca de un punto crítico, : un cuenco cuadrático cuyos ejes son los vectores propios de y cuya inclinación en cada eje es el valor propio. Todos positivos: un cuenco (mínimo). Todos negativos: una cúpula. Signos mezclados: una silla. Valores propios muy distintos: un barranco estrecho donde el descenso de gradiente rebota de pared a pared.
Definición formal
Para , , simétrica por Schwarz. En un punto crítico : (definida positiva) ⇒ mínimo local estricto; ⇒ máximo local estricto; indefinida ⇒ punto de silla.
Fórmulas
- condicionamiento y mayor learning rate estable en una cuadrática
Ejemplo
: en el origen, , indefinida: una silla (una patata Pringles). El descenso de gradiente iniciado justo sobre el eje converge a ella; cualquier perturbación mínima en escapa. Por eso los puntos de silla ralentizan el entrenamiento pero rara vez lo atrapan.
¿Por qué importa?
El método de Newton usa ; los métodos cuasi-Newton (BFGS, L-BFGS) la aproximan; Adam y otros optimizadores adaptativos se pueden leer como aproximaciones diagonales baratas de la curvatura. En deep learning la «nitidez» (el mayor valor propio del hessiano) está ligada a la generalización y al fenómeno del borde de la estabilidad. La hessiana completa de un modelo de mil millones de parámetros nunca se forma, pero los productos hessiana–vector son baratos con diferenciación automática.
Aplicaciones en informática
Los detectores basados en el hessiano (determinante del hessiano en SURF, vesselness de Frangi) encuentran manchas y crestas.
Dónde aparece en IA
Newton, Gauss–Newton, el gradiente natural y K-FAC usan el hessiano o una aproximación suya.
Los valores propios del hessiano miden la nitidez, detectan sillas y fijan el learning rate estable .
¿Dónde se utiliza?
Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:
ℒ IA y machine learning
- Paisaje de la pérdida (loss landscape)★★★★★
- Optimización de segundo orden (con hessiano)★★★★★
- Extremos en varias variables→Regresión lineal★★★★★
- Extremos en varias variables→Regresión lineal→Regresión logística★★★★★
- Extremos en varias variables→Regresión lineal→Regresión logística→Redes neuronales★★★★★
- Extremos en varias variables→Regresión lineal→Regresión logística→Redes neuronales→Retropropagación (backpropagation)★★★★★
Qué depende de él
Ejercicios
Clasifica los puntos críticos de .
Solución
en . : en definida positiva → mínimo; en indefinida → silla.
En , ¿cuál es el mayor learning rate con el que converge el descenso de gradiente? ¿Cuántos pasos para reducir el error en a con ese ritmo?
Solución
, así que . En cada paso multiplica el error por : . El número de condición 100 lo hace lento.