Introducción

¿Por qué funciona la IA?

ChatGPT no tiene detrás una única teoría, sino la convergencia de muchas: lógica, probabilidad, información, álgebra lineal, cálculo, optimización… Esta web las recorre en orden, de Boole y Turing a los Transformers, con los teoremas que importan, la historia de quienes los descubrieron y una figura interactiva en cada paso.

Empezar por el principio →Ver la línea temporal

Así «escribe» un modelo de lenguaje: en cada paso calcula una distribución de probabilidad sobre la palabra siguiente y elige una. Elige palabras o deja que el azar lo haga, y fíjate en tres números: la entropía (cuánta incertidumbre hay antes de elegir), la sorpresa de lo elegido y la probabilidad de la frase, que es el producto de las probabilidades de cada paso. Toda la web explica de dónde salen esos números y por qué funcionan.

Una idea en una frase

Un modelo de lenguaje aprende a predecir qué información es más probable que aparezca después. No necesita una definición explícita de lo que es un gato para completar «El gato está sentado en el…». Le basta con haber estimado, a partir de cantidades enormes de texto, una distribución de probabilidad extraordinariamente detallada. Que algo tan simple de enunciar dé resultados tan asombrosos tiene explicaciones matemáticas precisas (y algunas preguntas todavía abiertas). Este es el recorrido:

  1. 00 Conmutar 1854 – 1959 ¿Cómo calcula una máquina, por dentro? Debajo de cualquier programa hay interruptores. El álgebra de Boole, unas pocas puertas lógicas y un poco de memoria bastan para construir un sumador, un autómata finito y, al final, un procesador. Por el camino aparece el primer límite: hay patrones que ninguna máquina con memoria finita puede reconocer.
    • Completitud funcional de NAND
    • Teorema de Kleene
    • Construcción de subconjuntos
    • Lema de bombeo
    • Jerarquía de Chomsky
  2. 01 Computar 1928 – 1950 ¿Qué puede calcular una máquina? Antes de preguntarse si una máquina puede pensar hubo que definir qué significa calcular. Alan Turing lo hizo con una cinta, un cabezal y una tabla de reglas, y de paso descubrió que hay preguntas que ningún ordenador podrá responder nunca.
    • Máquina universal
    • Indecidibilidad de la parada
    • Tesis de Church-Turing
  3. 02 Deducir 1854 – 1992 ¿Puede razonar una máquina? El primer plan para la inteligencia artificial no fue aprender sino deducir: escribir el conocimiento como fórmulas lógicas y dejar que la máquina sacara las consecuencias. Dejó una teoría preciosa, un lenguaje de programación en el que se describe el problema en vez de la solución, y una lección sobre sus límites.
    • Completitud de Gödel
    • Unificador más general
    • Completitud de la resolución
    • Mínimo modelo de Herbrand
    • Completitud de la resolución SLD
  4. 03 Probabilidad 1654 – 1922 Aprender de los datos La probabilidad pone números a la incertidumbre. Dos resultados del siglo XVIII, la ley de los grandes números y el teorema de Bayes, explican por qué más datos nos acercan a la verdad y cómo actualizar lo que creemos al ver cada uno.
    • Ley de los grandes números
    • Teorema de Bayes
    • Máxima verosimilitud
    • Regla de la cadena
  5. 04 Información 1948 – 1952 Medir la sorpresa En 1948 Claude Shannon convirtió la información en una cantidad medible. Con una sola fórmula, la entropía, explicó cuánto se puede comprimir un mensaje y cómo medir lo lejos que está un modelo de la realidad. Esa medida es, literalmente, la función que minimiza cualquier LLM al entrenarse.
    • Entropía de Shannon
    • Teorema de codificación de fuente
    • Desigualdad de Gibbs
    • Entropía cruzada
  6. 05 Vectores 1844 – 2013 Palabras convertidas en flechas Un ordenador no sabe qué es un gato, pero sabe multiplicar matrices a una velocidad enorme. El álgebra lineal permite representar palabras, imágenes y conceptos como vectores, y medir su parecido con un simple producto escalar.
    • Desigualdad de Cauchy-Schwarz
    • Lema de Johnson-Lindenstrauss
    • Descomposición en valores singulares
  7. 06 Derivadas 1676 – 1986 ¿Hacia dónde se mueve el error? Una red neuronal tiene miles de millones de perillas. Para saber cuál girar y en qué sentido hay que saber cómo cambia el error al mover cada una: su derivada. La regla de la cadena, que Leibniz escribió en 1676, permite calcularlas todas a la vez. Ese algoritmo se llama backpropagation.
    • Regla de la cadena
    • Dirección de máximo ascenso
    • Principio del gradiente barato
  8. 07 Optimizar 1847 – 2014 Bajar la montaña a ciegas Entrenar un modelo es buscar el punto más bajo de un paisaje con miles de millones de dimensiones, en plena niebla y sintiendo solo la pendiente bajo los pies. El descenso de gradiente, que Cauchy inventó en 1847 para calcular órbitas, sigue siendo el algoritmo que entrena todos los LLM.
    • Convergencia del descenso de gradiente
    • Mínimos de funciones convexas
    • Condiciones de Robbins-Monro
    • Cota de Nesterov
  9. 08 Neuronas 1943 – 2012 Del perceptrón a la aproximación universal En 1958 una máquina de la Marina de EE. UU. aprendió a distinguir tarjetas marcadas a izquierda y derecha, y la prensa anunció que pronto andaría, hablaría y sería consciente de su existencia. Once años después, un libro demostró que no podía calcular algo tan simple como el «o exclusivo». Esta es la historia de cómo una sola capa oculta lo arregló todo.
    • Convergencia del perceptrón
    • XOR no es linealmente separable
    • Aproximación universal
  10. 09 Generalizar 1971 – 2019 ¿Por qué funciona con datos que nunca ha visto? Memorizar los ejemplos es fácil; acertar con los que no has visto, no. La teoría del aprendizaje estudia cuándo y por qué un modelo entrenado con unos datos generaliza a otros. Sus teoremas clásicos son elegantes… y las redes profundas los desafían.
    • Cota de generalización (clase finita)
    • Dimensión VC
    • Teorema fundamental del aprendizaje PAC
    • No free lunch
  11. 10 Atención 1990 – 2017 Atención: cada palabra mira a todas las demás En 2017 ocho investigadores de Google publicaron un artículo con un título provocador: «Attention Is All You Need». Su arquitectura, el Transformer, sustituyó la lectura palabra a palabra por una operación en la que cada palabra decide, con un producto escalar y un softmax, en qué otras debe fijarse.
    • Atención como búsqueda suave
    • Varianza del producto escalar (dk)
    • Aproximación universal de secuencias
  12. 11 LLM 2018 – hoy Predecir la siguiente palabra, a escala planetaria Un LLM es un Transformer entrenado para minimizar la entropía cruzada de Shannon sobre billones de palabras. Este capítulo junta todas las piezas: cómo genera texto, por qué mejora de forma predecible al crecer, cómo se convierte en un asistente como ChatGPT y por qué a veces se inventa cosas.
    • Softmax como máxima entropía
    • Leyes de escalado
    • Política óptima con KL
    • Calibración y alucinaciones

Muchas teorías, una cadena

Cada capítulo responde a una pregunta y deja planteada la siguiente. Varias ramas de las matemáticas y la informática aparecen por el camino:

TeoríaQué aporta a la IA modernaDónde
Álgebra de Boole y autómatasCircuitos, memoria finita y lo que no puede reconocer00
Teoría de la computaciónQué puede calcular una máquina y con qué coste01
LógicaDeducción, resolución y programación lógica02
Probabilidad y estadísticaPredicción, incertidumbre y aprendizaje a partir de datos03
Teoría de la informaciónEntropía, compresión y la función de pérdida de los LLM04
Álgebra linealVectores, matrices y embeddings: el espacio donde vive el significado05
CálculoDerivadas, regla de la cadena y retropropagación06
Teoría de grafosGrafos computacionales sobre los que fluye el gradiente06
OptimizaciónEntrenamiento mediante descenso de gradiente07
Redes neuronalesFunciones capaces de aproximar casi cualquier cosa08
Teoría del aprendizajePor qué y cuándo una máquina generaliza09
Información y atenciónEl mecanismo central del Transformer10
Juegos y aprendizaje por refuerzoAgentes que aprenden de recompensas: RLHF11

Cómo leer esta web

Puedes leerla en orden, como un libro corto, o saltar al capítulo que te interese: cada uno se sostiene por sí mismo y enlaza con los anteriores cuando hace falta. Las demostraciones están plegadas para no interrumpir la lectura; ábrelas si quieres ver por qué algo es cierto. Las figuras son interactivas y se ejecutan en tu navegador, sin servidores ni rastreadores. Basta con bachillerato de ciencias para seguir el hilo, y el que quiera más detalle encontrará en cada capítulo las referencias originales.

Capítulo 00: ¿Cómo calcula una máquina, por dentro? →