Regularización

Nivel AvanzadoDificultad ★★★★★Aplicación⌖ Ver en el mapa

¿Qué es?

Añadir una penalización a la pérdida, L+λ∥θ∥2L + \lambda\norm\theta^2 (decaimiento de pesos) o λ∥θ∥1\lambda\norm\theta_1 (dispersión), para preferir modelos más sencillos y reducir el sobreajuste. Su gradiente 2λθ2\lambda\theta encoge un poco cada peso en cada paso.

Fórmulas

∇(L+λ∥θ∥2)=∇L+2λθ\nabla\big(L + \lambda\norm\theta^2\big) = \nabla L + 2\lambda\theta
wridge∗=(X𝖳X+λI)−1X𝖳yw^\ast_{\text{ridge}} = (X^{\mathsf T}X + \lambda I)^{-1}X^{\mathsf T}y
la regresión ridge también cura el mal condicionamiento

Las matemáticas que hay detrás

  • Multiplicadores de Lagrange★★★★★avanzada

    Entrenar con penalización L+λ∥w∥2L + \lambda\norm w^2 es el lagrangiano de entrenar con una restricción de norma ∥w∥≤r\norm w \le r.

¿Dónde se utiliza?

Temas de informática a los que se llega desde aquí, con la cadena de ideas que lleva a ellos:

Qué depende de él

Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.

↑ ↓ para navegar · ↵ · Esc