Introducción
¿Por qué funciona la IA?
ChatGPT no tiene detrás una única teoría, sino la convergencia de muchas: lógica, probabilidad, información, álgebra lineal, cálculo, optimización… Esta web las recorre en orden, de Boole y Turing a los Transformers, con los teoremas que importan, la historia de quienes los descubrieron y una figura interactiva en cada paso.
Empezar por el principio →Ver la línea temporal
Una idea en una frase
Un modelo de lenguaje aprende a predecir qué información es más probable que aparezca después. No necesita una definición explícita de lo que es un gato para completar «El gato está sentado en el…». Le basta con haber estimado, a partir de cantidades enormes de texto, una distribución de probabilidad extraordinariamente detallada. Que algo tan simple de enunciar dé resultados tan asombrosos tiene explicaciones matemáticas precisas (y algunas preguntas todavía abiertas). Este es el recorrido:
-
00
Conmutar 1854 – 1959
¿Cómo calcula una máquina, por dentro?
Debajo de cualquier programa hay interruptores. El álgebra de Boole, unas pocas puertas lógicas y un poco de memoria bastan para construir un sumador, un autómata finito y, al final, un procesador. Por el camino aparece el primer límite: hay patrones que ninguna máquina con memoria finita puede reconocer.
- Completitud funcional de NAND
- Teorema de Kleene
- Construcción de subconjuntos
- Lema de bombeo
- Jerarquía de Chomsky
-
01
Computar 1928 – 1950
¿Qué puede calcular una máquina?
Antes de preguntarse si una máquina puede pensar hubo que definir qué significa calcular. Alan Turing lo hizo con una cinta, un cabezal y una tabla de reglas, y de paso descubrió que hay preguntas que ningún ordenador podrá responder nunca.
- Máquina universal
- Indecidibilidad de la parada
- Tesis de Church-Turing
-
02
Deducir 1854 – 1992
¿Puede razonar una máquina?
El primer plan para la inteligencia artificial no fue aprender sino deducir: escribir el conocimiento como fórmulas lógicas y dejar que la máquina sacara las consecuencias. Dejó una teoría preciosa, un lenguaje de programación en el que se describe el problema en vez de la solución, y una lección sobre sus límites.
- Completitud de Gödel
- Unificador más general
- Completitud de la resolución
- Mínimo modelo de Herbrand
- Completitud de la resolución SLD
-
03
Probabilidad 1654 – 1922
Aprender de los datos
La probabilidad pone números a la incertidumbre. Dos resultados del siglo XVIII, la ley de los grandes números y el teorema de Bayes, explican por qué más datos nos acercan a la verdad y cómo actualizar lo que creemos al ver cada uno.
- Ley de los grandes números
- Teorema de Bayes
- Máxima verosimilitud
- Regla de la cadena
-
04
Información 1948 – 1952
Medir la sorpresa
En 1948 Claude Shannon convirtió la información en una cantidad medible. Con una sola fórmula, la entropía, explicó cuánto se puede comprimir un mensaje y cómo medir lo lejos que está un modelo de la realidad. Esa medida es, literalmente, la función que minimiza cualquier LLM al entrenarse.
- Entropía de Shannon
- Teorema de codificación de fuente
- Desigualdad de Gibbs
- Entropía cruzada
-
05
Vectores 1844 – 2013
Palabras convertidas en flechas
Un ordenador no sabe qué es un gato, pero sabe multiplicar matrices a una velocidad enorme. El álgebra lineal permite representar palabras, imágenes y conceptos como vectores, y medir su parecido con un simple producto escalar.
- Desigualdad de Cauchy-Schwarz
- Lema de Johnson-Lindenstrauss
- Descomposición en valores singulares
-
06
Derivadas 1676 – 1986
¿Hacia dónde se mueve el error?
Una red neuronal tiene miles de millones de perillas. Para saber cuál girar y en qué sentido hay que saber cómo cambia el error al mover cada una: su derivada. La regla de la cadena, que Leibniz escribió en 1676, permite calcularlas todas a la vez. Ese algoritmo se llama backpropagation.
- Regla de la cadena
- Dirección de máximo ascenso
- Principio del gradiente barato
-
07
Optimizar 1847 – 2014
Bajar la montaña a ciegas
Entrenar un modelo es buscar el punto más bajo de un paisaje con miles de millones de dimensiones, en plena niebla y sintiendo solo la pendiente bajo los pies. El descenso de gradiente, que Cauchy inventó en 1847 para calcular órbitas, sigue siendo el algoritmo que entrena todos los LLM.
- Convergencia del descenso de gradiente
- Mínimos de funciones convexas
- Condiciones de Robbins-Monro
- Cota de Nesterov
-
08
Neuronas 1943 – 2012
Del perceptrón a la aproximación universal
En 1958 una máquina de la Marina de EE. UU. aprendió a distinguir tarjetas marcadas a izquierda y derecha, y la prensa anunció que pronto andaría, hablaría y sería consciente de su existencia. Once años después, un libro demostró que no podía calcular algo tan simple como el «o exclusivo». Esta es la historia de cómo una sola capa oculta lo arregló todo.
- Convergencia del perceptrón
- XOR no es linealmente separable
- Aproximación universal
-
09
Generalizar 1971 – 2019
¿Por qué funciona con datos que nunca ha visto?
Memorizar los ejemplos es fácil; acertar con los que no has visto, no. La teoría del aprendizaje estudia cuándo y por qué un modelo entrenado con unos datos generaliza a otros. Sus teoremas clásicos son elegantes… y las redes profundas los desafían.
- Cota de generalización (clase finita)
- Dimensión VC
- Teorema fundamental del aprendizaje PAC
- No free lunch
-
10
Atención 1990 – 2017
Atención: cada palabra mira a todas las demás
En 2017 ocho investigadores de Google publicaron un artículo con un título provocador: «Attention Is All You Need». Su arquitectura, el Transformer, sustituyó la lectura palabra a palabra por una operación en la que cada palabra decide, con un producto escalar y un softmax, en qué otras debe fijarse.
- Atención como búsqueda suave
- Varianza del producto escalar ()
- Aproximación universal de secuencias
-
11
LLM 2018 – hoy
Predecir la siguiente palabra, a escala planetaria
Un LLM es un Transformer entrenado para minimizar la entropía cruzada de Shannon sobre billones de palabras. Este capítulo junta todas las piezas: cómo genera texto, por qué mejora de forma predecible al crecer, cómo se convierte en un asistente como ChatGPT y por qué a veces se inventa cosas.
- Softmax como máxima entropía
- Leyes de escalado
- Política óptima con KL
- Calibración y alucinaciones
Muchas teorías, una cadena
Cada capítulo responde a una pregunta y deja planteada la siguiente. Varias ramas de las matemáticas y la informática aparecen por el camino:
| Teoría | Qué aporta a la IA moderna | Dónde |
|---|---|---|
| Álgebra de Boole y autómatas | Circuitos, memoria finita y lo que no puede reconocer | 00 |
| Teoría de la computación | Qué puede calcular una máquina y con qué coste | 01 |
| Lógica | Deducción, resolución y programación lógica | 02 |
| Probabilidad y estadística | Predicción, incertidumbre y aprendizaje a partir de datos | 03 |
| Teoría de la información | Entropía, compresión y la función de pérdida de los LLM | 04 |
| Álgebra lineal | Vectores, matrices y embeddings: el espacio donde vive el significado | 05 |
| Cálculo | Derivadas, regla de la cadena y retropropagación | 06 |
| Teoría de grafos | Grafos computacionales sobre los que fluye el gradiente | 06 |
| Optimización | Entrenamiento mediante descenso de gradiente | 07 |
| Redes neuronales | Funciones capaces de aproximar casi cualquier cosa | 08 |
| Teoría del aprendizaje | Por qué y cuándo una máquina generaliza | 09 |
| Información y atención | El mecanismo central del Transformer | 10 |
| Juegos y aprendizaje por refuerzo | Agentes que aprenden de recompensas: RLHF | 11 |
Cómo leer esta web
Puedes leerla en orden, como un libro corto, o saltar al capítulo que te interese: cada uno se sostiene por sí mismo y enlaza con los anteriores cuando hace falta. Las demostraciones están plegadas para no interrumpir la lectura; ábrelas si quieres ver por qué algo es cierto. Las figuras son interactivas y se ejecutan en tu navegador, sin servidores ni rastreadores. Basta con bachillerato de ciencias para seguir el hilo, y el que quiera más detalle encontrará en cada capítulo las referencias originales.