¿Qué es?
La geometría de sobre el espacio de parámetros: valles, mesetas, puntos de silla y barrancos. Su curvatura (hessiano) controla lo deprisa y lo estable que se mueven los optimizadores, y los mínimos planos tienden a generalizar mejor que los agudos.
Fórmulas
- nitidez (sharpness)
- el borde de la estabilidad, donde tiende a asentarse el entrenamiento con lote completo
¿Por qué importa?
Entender por qué funciona tan bien un entrenamiento no convexo es una de las preguntas abiertas de la teoría del deep learning.
Las matemáticas que hay detrás
Los valores propios del hessiano miden la nitidez, detectan sillas y fijan el learning rate estable .
Mínimos, máximos y (sobre todo) puntos de silla dan forma al paisaje que deben cruzar los optimizadores.
Las pérdidas de las redes profundas no son convexas: muchos mínimos y sillas, aunque en la práctica es fácil encontrar mínimos buenos.
Un hessiano con número de condición grande hace zigzaguear al descenso de gradiente; el precondicionamiento (Adam, capas de normalización) ayuda.
Los mapas de contorno de una pérdida a lo largo de dos direcciones son la forma estándar de visualizar su paisaje.
En dimensión alta, la mayoría de puntos críticos de una pérdida de aspecto aleatorio son sillas, no mínimos.
¿Dónde se utiliza?
Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:
Qué depende de él
Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.