¿Qué es?
Repetir : dar un paso pequeño en contra del gradiente. Cauchy lo propuso en 1847; hoy (con sus variantes estocásticas y adaptativas) entrena prácticamente todas las redes neuronales.
¿Por qué existe?
Anular y despejar es imposible para una red con millones de parámetros y una pérdida no lineal. Pero evaluar en un punto es barato (retropropagación), y el gradiente dice en qué dirección baja más deprisa la pérdida. Se itera.
Intuición
Una bola que baja una ladera con niebla, paso a paso. El learning rate es la longitud del paso: demasiado pequeño y avanza a paso de tortuga; demasiado grande y se pasa, rebotando entre las paredes del valle o saliendo disparada. En un valle estrecho el gradiente apunta a través del valle y no a lo largo, así que el camino zigzaguea; prueba el cuenco alargado de la demo.
Definición formal
Si es -lipschitziano y , entonces (lema de descenso): la pérdida baja en cada paso y . Si es -fuertemente convexa, la convergencia es lineal con razón .
Fórmulas
- por qué funciona: Taylor de primer orden
¿Cómo se calcula?
θ = valor inicial
para k en 1..K:
g = ∇L(θ) # retropropagación
θ = θ − η · g
si ‖g‖ < tol: parar
Visualización interactiva
¿Por qué importa?
Es el bucle interno de la industria de la IA: billones de pasos de gradiente al día. Todos los optimizadores usados en la práctica (SGD, momento, Adam) son modificaciones de esta línea.
Las matemáticas que hay detrás
Cada paso mueve el parámetro en contra de la derivada de la pérdida: .
La actualización es el gradiente usado como dirección.
El learning rate seguro lo fija la constante de Lipschitz del gradiente: .
Los teoremas de convergencia garantizan bajo condiciones sobre el tamaño de paso.
El descenso de gradiente se detiene donde se anula la derivada: en un punto crítico.
En problemas fuertemente convexos el descenso de gradiente converge linealmente, a un ritmo fijado por el número de condición .
El modelo de primer orden es la razón de que un paso pequeño cuesta abajo reduzca .
Entre los pasos unitarios, minimiza : la justificación del método.
El descenso de gradiente es Euler explícito sobre ; el learning rate es el paso de tiempo y hereda su límite de estabilidad.
Los mínimos estrictos son puntos fijos estables del descenso de gradiente exactamente cuando .
Con un paso suficientemente pequeño la pérdida decrece de forma monótona y está acotada inferiormente, así que sus valores convergen.
Las pruebas de convergencia acotan el descenso por paso aplicando el TVM al gradiente.
¿Dónde se utiliza?
Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:
Qué depende de él
Ejercicios
Para , demuestra que el descenso de gradiente converge si y solo si . ¿Qué pasa con ?
Solución
, que tiende a 0 si y solo si . Con salta al mínimo en un paso.