∇ Matemáticas para IA

El camino honesto más corto de las derivadas al deep learning: gradientes, optimización, verosimilitud y retropropagación.

0/14
  1. 01

    Funciones

    Una regla ff que asigna a cada entrada xx de un conjunto AA exactamente una salida f(x)f(x) de un conjunto BB. El cálculo estudia cómo cambian las salidas cuando cambian las entradas; computar es, literalmente, evaluar funciones.

    FundamentalFundamentos
  2. 02

    Derivada

    f′(a)f'(a) es la tasa de cambio instantánea de ff en aa: la pendiente de la recta tangente a la gráfica, definida como el límite de las pendientes de las rectas secantes.

    FundamentalDerivadas
  3. 03

    Regla de la cadena

    La derivada de una composición es el producto de las derivadas: (g∘f)′(x)=g′(f(x)) f′(x)(g\circ f)'(x) = g'(f(x))\,f'(x). Las tasas de cambio se multiplican a lo largo de una cadena, y la retropropagación es esta regla aplicada, de forma muy eficiente, a una red neuronal.

    FundamentalDerivadas
  4. 04

    Derivadas parciales

    ∂f∂xi\frac{\partial f}{\partial x_i}: la derivada respecto de una variable, dejando fijas las demás. Cada una responde a «¿cuánto depende la salida de esta entrada?»; en una red neuronal, de este peso.

    UniversitarioCálculo multivariable
  5. 05

    Gradiente

    ∇f=(∂f∂x1,…,∂f∂xn)\nabla f = \left(\frac{\partial f}{\partial x_1}, \dots, \frac{\partial f}{\partial x_n}\right): el vector de todas las derivadas parciales. Apunta en la dirección de máximo ascenso, su longitud es esa pendiente máxima y es perpendicular a los conjuntos de nivel. Si caminas en contra bajas lo más deprisa posible.

    UniversitarioCálculo multivariable
  6. 06

    Regla de la cadena multivariable

    Cuando una variable influye en la salida por varios caminos, se suman las aportaciones de cada camino, cada una producto de las derivadas locales a lo largo de él: ∂z∂x=∑i∂z∂ui∂ui∂x\frac{\partial z}{\partial x} = \sum_i \frac{\partial z}{\partial u_i}\frac{\partial u_i}{\partial x}. En forma matricial, las jacobianas se multiplican. Es exactamente lo que calcula la retropropagación sobre el grafo de una red.

    UniversitarioCálculo multivariable
  7. 07

    Convexidad y concavidad

    ff es convexa si la cuerda entre dos puntos cualesquiera de su gráfica queda por encima de la gráfica; para ff suave, equivalentemente, si f′′≥0f'' \ge 0. En las funciones convexas todo mínimo local es global, y por eso los problemas convexos son los que la optimización resuelve de forma fiable.

    UniversitarioExtremos y optimización
  8. 08

    Descenso de gradiente

    Repetir θ←θ−η ∇L(θ)\theta \leftarrow \theta - \eta\,\nabla L(\theta): dar un paso pequeño en contra del gradiente. Cauchy lo propuso en 1847; hoy (con sus variantes estocásticas y adaptativas) entrena prácticamente todas las redes neuronales.

    UniversitarioIA y machine learning
  9. 09

    Función de densidad de probabilidad

    Una función p(x)≥0p(x) \ge 0 con ∫p=1\int p = 1 cuya integral sobre un conjunto es la probabilidad de ese conjunto. Una densidad no es una probabilidad: puede superar 1; es probabilidad por unidad de longitud.

    UniversitarioProbabilidad y cálculo
  10. 10

    Estimación por máxima verosimilitud

    Elegir los parámetros que hacen más probables los datos observados: maximizar ∏ip(xi∣θ)\prod_i p(x_i\mid\theta), es decir, minimizar −∑ilog⁡p(xi∣θ)-\sum_i\log p(x_i\mid\theta). El error cuadrático, la entropía cruzada y el objetivo de entrenamiento de los modelos de lenguaje son todos log-verosimilitudes negativas.

    AvanzadoProbabilidad y cálculo
  11. 11

    Función de pérdida

    Un único número L(θ)L(\theta) que mide lo equivocado que está un modelo de parámetros θ\theta sobre los datos. Aprender es minimizarlo. El error cuadrático medio para regresión y la entropía cruzada para clasificación son las dos que usa todo el mundo.

    UniversitarioIA y machine learning
  12. 12

    Redes neuronales

    Composiciones de aplicaciones afines y no linealidades, fθ=fL∘⋯∘f1f_\theta = f_L\circ\dots\circ f_1 con fℓ(a)=σ(Wℓa+bℓ)f_\ell(a) = \sigma(W_\ell a + b_\ell). Una función derivable con millones de parámetros ajustables, entrenada por descenso de gradiente.

    AvanzadoIA y machine learning
  13. 13

    Retropropagación (backpropagation)

    El algoritmo que calcula ∂L/∂W\partial L/\partial W y ∂L/∂b\partial L/\partial b para cada capa de una red: una pasada hacia delante guardando los valores intermedios y otra hacia atrás aplicando la regla de la cadena desde la pérdida hasta las entradas. Coste: unas dos veces la pasada hacia delante, sea cual sea el número de parámetros.

    AvanzadoIA y machine learning
  14. 14

    Deep learning (aprendizaje profundo)

    Entrenar redes muy profundas (CNN, transformers) con retropropagación y SGD adaptativo sobre conjuntos de datos enormes. El cálculo es el mismo que para una neurona; lo que cambió es la escala, la arquitectura (conexiones residuales, normalización, atención) y el hardware.

    AvanzadoIA y machine learning
↑ ↓ para navegar · ↵ · Esc