Modelos generativos

Nivel EspecializaciónDificultad ★★★★★Aplicación⌖ Ver en el mapa

¿Qué es?

Modelos que aprenden una densidad de probabilidad de los datos y muestrean de ella. El cálculo está por todas partes: cambio de variables y determinantes jacobianos (flows), integrales ELBO (VAE), críticos lipschitzianos (WGAN) y ecuaciones diferenciales estocásticas u ordinarias integradas hacia atrás en el tiempo (difusión).

Fórmulas

dx=[f(x,t)−g(t)2 ∇xlog⁡pt(x)] dt+g(t) dwˉ\dd x = \big[f(x,t) - g(t)^2\,\nabla_x\log p_t(x)\big]\,\dd t + g(t)\,\dd\bar w
EDE en tiempo inverso de la difusión basada en score
log⁡pX(x)=log⁡pZ(f−1(x))+log⁡∣det⁡Jf−1(x)∣\log p_X(x) = \log p_Z\big(f^{-1}(x)\big) + \log\big|\det J_{f^{-1}}(x)\big|
verosimilitud de un normalizing flow

Las matemáticas que hay detrás

  • Matriz jacobiana★★★★★fundamental

    Los normalizing flows calculan verosimilitudes exactas con log⁡pX=log⁡pZ+log⁡∣det⁡J∣\log p_X = \log p_Z + \log|\det J|, diseñando capas con determinantes baratos.

  • Función de densidad de probabilidad★★★★★fundamental

    Los modelos generativos aprenden densidades; los de difusión aprenden el score ∇xlog⁡pt(x)\nabla_x\log p_t(x).

  • Estimación por máxima verosimilitud★★★★★fundamental

    Los modelos autorregresivos y los flows maximizan la verosimilitud exactamente; los VAE y los modelos de difusión, una cota inferior (ELBO).

  • Funciones inversas★★★★★avanzada

    Los normalizing flows son redes invertibles: se muestrea con ff y se evalúan densidades con f−1f^{-1}.

  • Cambio de variable★★★★★avanzada

    En 1D, un normalizing flow es exactamente la fórmula de cambio de variable para densidades.

  • Las verosimilitudes de los modelos generativos continuos son integrales múltiples; los flows usan la fórmula del cambio de variables.

  • Variables aleatorias continuas★★★★★frecuente

    Los modelos generativos son variables aleatorias continuas cuya distribución imita la de los datos.

  • Distribuciones continuas★★★★★frecuente

    Los modelos de difusión añaden ruido gaussiano; los VAE usan variables latentes gaussianas.

  • Divergencia★★★★★avanzada

    Los normalizing flows continuos siguen la log-densidad con la divergencia del campo de velocidades (cambio de variables instantáneo).

  • Método de Euler★★★★★avanzada

    Los muestreadores de difusión y flow matching integran una EDO/EDE aprendida con pasos tipo Euler.

  • Continuidad de Lipschitz★★★★★avanzada

    Las Wasserstein GAN necesitan un crítico 1-lipschitziano, impuesto con recorte de pesos, penalización de gradiente o normalización espectral.

  • Los modelos de difusión están ligados a la EDP de Fokker–Planck de un proceso de ruido, que se invierte aprendiendo el score ∇log⁡p\nabla\log p.

  • Puntos de equilibrio y estabilidad★★★★★avanzada

    La dinámica de entrenamiento de las GAN puede girar alrededor de los equilibrios en vez de converger; los trucos de estabilización apuntan a eso.

Esta página tiene lo esencial. Un desarrollo más completo (intuición, definición formal, ejemplo resuelto) está en camino.

↑ ↓ para navegar · ↵ · Esc