Continuidad de Lipschitz

Nivel AvanzadoDificultad ★★★★★Concepto⌖ Ver en el mapa

¿Qué es?

∣f(x)−f(y)∣≤L ∣x−y∣|f(x) - f(y)| \le L\,|x - y|: la función nunca cambia más deprisa que a ritmo LL. Cuando el gradiente es LL-lipschitziano, el descenso de gradiente con paso η<2/L\eta < 2/L tiene garantizado bajar la pérdida.

Fórmulas

∣f(x)−f(y)∣≤L ∣x−y∣|f(x) - f(y)| \le L\,|x - y|
∥∇f(x)−∇f(y)∥≤L∥x−y∥  ⟹  f(y)≤f(x)+∇f(x)⋅(y−x)+L2∥y−x∥2\norm{\nabla f(x) - \nabla f(y)} \le L\norm{x - y} \implies f(y) \le f(x) + \nabla f(x)\cdot(y - x) + \tfrac L2\norm{y - x}^2
lema de descenso

Dónde aparece en IA

  • Descenso de gradiente★★★★★fundamentalIA y machine learning

    El learning rate seguro lo fija la constante de Lipschitz del gradiente: η<2/L\eta < 2/L.

  • Modelos generativos★★★★★avanzadaIA y machine learning

    Las Wasserstein GAN necesitan un crítico 1-lipschitziano, impuesto con recorte de pesos, penalización de gradiente o normalización espectral.

¿Dónde se utiliza?

Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:

Qué depende de él

Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.

↑ ↓ para navegar · ↵ · Esc