Línea temporal
Cuatro siglos hasta ChatGPT
La IA moderna es la confluencia de ideas que nacieron con siglos de diferencia y por motivos muy distintos: repartir apuestas, calcular órbitas, transmitir mensajes por teléfono. Aquí están ordenadas, con dos inviernos incluidos. Filtra por capítulo para seguir el hilo de cada teoría.
1654 – 1927
Los cimientos
Probabilidad, cálculo y álgebra lineal: herramientas creadas para el juego, la física y la astronomía, que tres siglos después servirán para aprender de datos.
-
1654
Pascal y Fermat inventan la probabilidad
Blaise Pascal, Pierre de Fermat
Una correspondencia sobre cómo repartir el bote de una partida interrumpida funda el cálculo de probabilidades.
Capítulo 03 · Probabilidad → -
1676
La regla de la cadena
Gottfried W. Leibniz
Leibniz deriva funciones compuestas en sus notas. Tres siglos después, la retropropagación será esta regla aplicada de forma sistemática.
Capítulo 06 · Cálculo → -
1713
Ley de los grandes números
Jakob Bernoulli
Se publica póstumamente Ars Conjectandi: la frecuencia observada converge a la probabilidad real.
Capítulo 03 · Probabilidad → -
1763
El teorema de Bayes
Thomas Bayes, Richard Price
Price publica el ensayo póstumo de Bayes sobre cómo razonar desde los efectos hacia las causas.
Capítulo 03 · Probabilidad → -
1805
Mínimos cuadrados
Adrien-Marie Legendre, Carl F. Gauss
Legendre publica el método para ajustar las órbitas de los cometas. Gauss lo había usado para reencontrar el planeta enano Ceres en 1801. Es la primera «función de pérdida».
Capítulo 07 · Optimización → -
1844
Espacios de dimensión arbitraria
Hermann Grassmann
Die lineale Ausdehnungslehre introduce los espacios vectoriales con cualquier número de dimensiones.
Capítulo 05 · Álgebra lineal → -
1847
El descenso de gradiente
Augustin-Louis Cauchy
Para resolver ecuaciones astronómicas, Cauchy propone bajar paso a paso en la dirección de mayor pendiente.
Capítulo 07 · Optimización → -
1854
Las leyes del pensamiento
George Boole
Boole escribe la lógica como álgebra: variables que valen 0 o 1 y operaciones que cumplen leyes como las de los números.
Capítulo 00 · Circuitos y autómatas → -
1858
La teoría de matrices
Arthur Cayley
Cayley define el producto de matrices y las trata como objetos algebraicos por derecho propio.
Capítulo 05 · Álgebra lineal → -
1879
La Begriffsschrift
Gottlob Frege
El primer lenguaje formal completo para las matemáticas, con variables, cuantificadores y reglas de inferencia.
Capítulo 02 · Lógica → -
1922
Máxima verosimilitud
Ronald A. Fisher
Fisher formaliza el principio de elegir los parámetros que hacen más probables los datos: el objetivo con el que se entrena cualquier LLM.
Capítulo 03 · Probabilidad →
1928 – 1955
Nacen la computación y la información
Turing define qué es calcular, Shannon qué es la información y McCulloch y Pitts imaginan neuronas que calculan.
-
1928
El problema de la decisión
David Hilbert, Wilhelm Ackermann
¿Existe un procedimiento mecánico que decida si cualquier enunciado lógico es demostrable?
Capítulo 01 · Computación → -
1929
El teorema de completitud
Kurt Gödel
En la lógica de primer orden, todo lo que es verdadero en todos los modelos se puede demostrar: verdad y demostración coinciden.
Capítulo 02 · Lógica → -
1931
Los teoremas de incompletitud
Kurt Gödel
Todo sistema formal suficientemente potente y consistente contiene verdades que no puede demostrar.
Capítulo 01 · Computación → -
1936
La máquina de Turing
Alan Turing, Alonzo Church
Turing define la computación con una cinta y una tabla de reglas, describe la máquina universal y demuestra que el problema de la parada es indecidible.
Capítulo 01 · Computación → -
1937
Los circuitos obedecen el álgebra de Boole
Claude Shannon
En su tesis de máster, Shannon muestra que los circuitos de relés calculan funciones booleanas, y que diseñarlos es manipular fórmulas.
Capítulo 00 · Circuitos y autómatas → -
1943
La neurona lógica
Warren McCulloch, Walter Pitts
Primer modelo matemático de una red de neuronas: umbrales que calculan funciones lógicas.
Capítulo 08 · Redes neuronales → -
1945
El ordenador de programa almacenado
John von Neumann
El informe del EDVAC describe la arquitectura en la que programa y datos comparten memoria.
Capítulo 01 · Computación → -
1948
Una teoría matemática de la comunicación
Claude Shannon
Shannon define la entropía, demuestra los límites de la compresión y genera texto con modelos de -gramas.
Capítulo 04 · Información → -
1948
El Baby de Mánchester
Frederic Williams, Tom Kilburn, Geoff Tootill
El 21 de junio, el primer ordenador que ejecuta un programa guardado en su propia memoria.
Capítulo 00 · Circuitos y autómatas → -
1949
La regla de Hebb
Donald Hebb
«Las neuronas que se activan juntas se conectan»: la primera hipótesis sobre cómo aprende una red.
Capítulo 08 · Redes neuronales → -
1950
El juego de la imitación
Alan Turing
«Computing Machinery and Intelligence» propone el test de Turing y sugiere construir máquinas que aprendan como un niño.
Capítulo 01 · Computación → -
1951
La aproximación estocástica
Herbert Robbins, Sutton Monro
Se puede optimizar con estimaciones ruidosas del gradiente si la tasa de aprendizaje decrece adecuadamente.
Capítulo 07 · Optimización → -
1951
La divergencia de Kullback-Leibler
Solomon Kullback, Richard Leibler
Una medida de la distancia entre distribuciones que reaparece en el entrenamiento y en el RLHF.
Capítulo 04 · Información → -
1951
Los sucesos regulares
Stephen Kleene
Analizando las redes de McCulloch y Pitts, Kleene caracteriza lo que reconocen los autómatas finitos: los lenguajes de las expresiones regulares.
Capítulo 00 · Circuitos y autómatas → -
1952
Códigos de Huffman
David Huffman
Un algoritmo sencillo construye el código sin prefijos óptimo para una distribución dada.
Capítulo 04 · Información →
1956 – 1973
La primera primavera
La IA recibe su nombre. Optimismo desbordante: perceptrones, programas que juegan a las damas y chatbots que imitan a un psicoterapeuta.
-
1956
Nace la «inteligencia artificial»
John McCarthy, Marvin Minsky, Nathaniel Rochester, Claude Shannon
El taller de verano de Dartmouth da nombre al campo. La propuesta (1955) estimaba que un grupo selecto haría «avances significativos» en dos meses.
-
1956
El Logic Theorist
Allen Newell, Herbert Simon, Cliff Shaw
El primer programa que demuestra teoremas: 38 de los 52 primeros del capítulo 2 de los Principia Mathematica.
Capítulo 02 · Lógica → -
1956
Tres modelos para el lenguaje
Noam Chomsky
Chomsky compara autómatas finitos y gramáticas como modelos del lenguaje; en 1959 forman su jerarquía de cuatro niveles.
Capítulo 00 · Circuitos y autómatas → -
1957
El perceptrón
Frank Rosenblatt
Una neurona artificial con una regla de aprendizaje. Al año siguiente se presenta el Mark I Perceptron.
Capítulo 08 · Redes neuronales → -
1957
Programación dinámica
Richard Bellman
La ecuación de Bellman funda la toma de decisiones secuenciales, la base del aprendizaje por refuerzo.
Capítulo 11 · Modelos de lenguaje → -
1957
El principio de máxima entropía
Edwin T. Jaynes
La distribución menos comprometida compatible con lo que sabemos es exponencial: el softmax con temperatura.
Capítulo 11 · Modelos de lenguaje → -
1959
«Aprendizaje automático»
Arthur Samuel
Un programa de damas que mejora jugando contra sí mismo populariza la expresión machine learning.
Capítulo 09 · Teoría del aprendizaje → -
1959
Autómatas no deterministas
Michael Rabin, Dana Scott
Autómatas que adivinan, y la construcción de subconjuntos que demuestra que no reconocen nada nuevo. Premio Turing en 1976.
Capítulo 00 · Circuitos y autómatas → -
1962
Convergencia del perceptrón
Albert Novikoff
Si los datos son separables con margen , el perceptrón comete como mucho errores.
Capítulo 08 · Redes neuronales → -
1964
La bola pesada
Boris Polyak
El método del momento acelera el descenso de gradiente en valles alargados.
Capítulo 07 · Optimización → -
1965
Resolución y unificación
John Alan Robinson
Una sola regla de inferencia, hecha para máquinas, basta para demostrar cualquier consecuencia en la lógica de primer orden.
Capítulo 02 · Lógica → -
1966
ELIZA
Joseph Weizenbaum
Un programa de reglas simples que imita a un psicoterapeuta. Muchos usuarios le atribuyen comprensión real, para alarma de su autor.
-
1969
Perceptrons
Marvin Minsky, Seymour Papert
Un análisis riguroso de las limitaciones del perceptrón de una capa, con el XOR como ejemplo célebre.
Capítulo 08 · Redes neuronales → -
1970
Diferenciación automática en modo inverso
Seppo Linnainmaa
Una tesis de máster finlandesa describe el algoritmo que hoy llamamos retropropagación.
Capítulo 06 · Cálculo → -
1971
La dimensión VC
Vladimir Vapnik, Alexey Chervonenkis
Una medida combinatoria de la capacidad de una clase de modelos que determina cuándo es posible generalizar.
Capítulo 09 · Teoría del aprendizaje → -
1972
Prolog
Alain Colmerauer, Philippe Roussel, Robert Kowalski
Programar en lógica: un programa es un conjunto de cláusulas de Horn, y ejecutarlo es buscar una demostración.
Capítulo 02 · Lógica → -
1973
El informe Lighthill
James Lighthill
Un informe muy crítico para el Gobierno británico desencadena recortes de financiación en la investigación en IA.
1974 – 1979
El primer invierno
Las promesas no se cumplen, la financiación se recorta y las redes neuronales caen en desgracia tras el libro de Minsky y Papert. En silencio se inventa la retropropagación.
-
1974
Retropropagación para redes neuronales
Paul Werbos
Werbos propone en su tesis entrenar redes multicapa con diferenciación en modo inverso. Pasa casi inadvertida.
Capítulo 06 · Cálculo → -
1976
MYCIN
Edward Shortliffe
Un sistema experto con unas 600 reglas recomienda antibióticos para infecciones de la sangre tan bien como los especialistas.
Capítulo 02 · Lógica →
1980 – 1986
Sistemas expertos y conexionismo
Las empresas invierten en sistemas basados en reglas escritas a mano. En paralelo renacen las redes neuronales con la retropropagación.
-
1980
El Neocognitrón
Kunihiko Fukushima
Una red jerárquica inspirada en la corteza visual: precursora de las redes convolucionales.
Capítulo 08 · Redes neuronales → -
1982
Redes de Hopfield
John Hopfield
Una red recurrente que funciona como memoria asociativa, analizada con herramientas de la física estadística.
Capítulo 08 · Redes neuronales → -
1982
El proyecto de Quinta Generación
MITI de Japón
Diez años de dinero público para construir máquinas paralelas de programación lógica. Se queda lejos de sus objetivos.
Capítulo 02 · Lógica → -
1983
El método acelerado
Yurii Nesterov
Un método de primer orden con error , el mejor posible para funciones convexas suaves.
Capítulo 07 · Optimización → -
1984
Aprendizaje PAC
Leslie Valiant
«A Theory of the Learnable» da una definición formal de aprender: probablemente, aproximadamente correcto.
Capítulo 09 · Teoría del aprendizaje → -
1984
El lema de Johnson-Lindenstrauss
William B. Johnson, Joram Lindenstrauss
Muchos puntos caben en pocas dimensiones sin distorsionar sus distancias: la geometría que aprovechan los embeddings.
Capítulo 05 · Álgebra lineal → -
1986
La retropropagación se populariza
David Rumelhart, Geoffrey Hinton, Ronald Williams
Un artículo en Nature muestra que las redes multicapa aprenden representaciones internas útiles.
Capítulo 06 · Cálculo →
1987 – 1992
El segundo invierno
Se hunde el mercado de las máquinas Lisp y los sistemas expertos resultan caros y frágiles. La teoría, sin embargo, avanza: aproximación universal, gradientes que se desvanecen, vectores soporte.
-
1987
Cae el mercado de las máquinas Lisp
Los ordenadores de propósito general alcanzan a las máquinas especializadas en IA y arrastran consigo a la industria de los sistemas expertos.
-
1989
Aproximación universal
George Cybenko; Kurt Hornik, Maxwell Stinchcombe, Halbert White
Una sola capa oculta basta para aproximar cualquier función continua.
Capítulo 08 · Redes neuronales → -
1989
Redes convolucionales para leer códigos postales
Yann LeCun y colaboradores
Una red entrenada con retropropagación lee dígitos escritos a mano para el servicio postal de EE. UU.
Capítulo 08 · Redes neuronales → -
1990
Redes recurrentes simples
Jeffrey Elman
Una red con memoria de su propio estado descubre estructura en secuencias de palabras.
Capítulo 10 · Transformers → -
1991
El gradiente que se desvanece
Sepp Hochreiter
Una tesis de diploma explica por qué las redes profundas y recurrentes no aprenden dependencias largas.
Capítulo 06 · Cálculo → -
1992
Máquinas de vectores soporte
Bernhard Boser, Isabelle Guyon, Vladimir Vapnik
Clasificadores de margen máximo con garantías teóricas: el método estrella de la década siguiente.
Capítulo 09 · Teoría del aprendizaje → -
1992
TD-Gammon
Gerald Tesauro
Una red neuronal entrenada por refuerzo jugando contra sí misma alcanza el nivel de los mejores jugadores de backgammon.
Capítulo 11 · Modelos de lenguaje →
1993 – 2011
El aprendizaje estadístico
La IA se vuelve probabilística y se apoya en los datos. Dominan los métodos con garantías teóricas, mientras las redes neuronales esperan su momento: datos y cálculo.
-
1994
Byte Pair Encoding
Philip Gage
Un algoritmo de compresión que, veinte años después, servirá para trocear el texto en tokens.
Capítulo 11 · Modelos de lenguaje → -
1996
No hay almuerzo gratis
David Wolpert
Ningún algoritmo de aprendizaje es mejor que otro promediando sobre todos los problemas: hace falta un sesgo inductivo.
Capítulo 09 · Teoría del aprendizaje → -
1997
LSTM
Sepp Hochreiter, Jürgen Schmidhuber
Las puertas de la memoria a largo plazo permiten a las redes recurrentes recordar durante cientos de pasos.
Capítulo 10 · Transformers → -
1997
Deep Blue gana a Kasparov
IBM
Búsqueda masiva y evaluación diseñada a mano, sin aprendizaje profundo: la otra tradición de la IA.
-
2003
Un modelo de lenguaje neuronal
Yoshua Bengio y colaboradores
Embeddings de palabras aprendidos junto con una red que predice la palabra siguiente.
Capítulo 05 · Álgebra lineal → -
2006
Redes de creencia profundas
Geoffrey Hinton, Simon Osindero, Yee-Whye Teh
Un preentrenamiento capa a capa reaviva el interés por las redes profundas.
Capítulo 08 · Redes neuronales → -
2009
ImageNet
Fei-Fei Li y colaboradores
Una base de datos con millones de imágenes etiquetadas y una competición anual que medirá el progreso de la visión.
Capítulo 08 · Redes neuronales →
2012 – 2016
El aprendizaje profundo
GPU, grandes conjuntos de datos y algunos trucos técnicos: las redes profundas arrasan en visión, habla y juegos.
-
2012
AlexNet
Alex Krizhevsky, Ilya Sutskever, Geoffrey Hinton
Una red convolucional entrenada en GPU gana ImageNet con un error top-5 del 15,3 %, diez puntos menos que el segundo.
Capítulo 08 · Redes neuronales → -
2013
word2vec
Tomas Mikolov y colaboradores
Embeddings entrenados a gran escala en los que las relaciones semánticas se vuelven direcciones: rey − hombre + mujer ≈ reina.
Capítulo 05 · Álgebra lineal → -
2014
Atención para traducir
Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio
El decodificador aprende a fijarse en las palabras relevantes de la frase de entrada.
Capítulo 10 · Transformers → -
2014
Adam
Diederik Kingma, Jimmy Ba
Un optimizador con momento y una tasa de aprendizaje adaptativa para cada parámetro.
Capítulo 07 · Optimización → -
2015
Redes residuales
Kaiming He y colaboradores
Las conexiones residuales permiten entrenar redes de más de cien capas sin que el gradiente se desvanezca.
Capítulo 06 · Cálculo → -
2016
AlphaGo gana a Lee Sedol
DeepMind
Redes profundas, búsqueda y aprendizaje por refuerzo vencen al campeón en el juego del go, una década antes de lo previsto.
Capítulo 11 · Modelos de lenguaje →
2017 – hoy
Transformers y modelos de lenguaje
La atención reemplaza a la recurrencia, las leyes de escalado guían la inversión y la predicción de la palabra siguiente se convierte en asistentes de uso general.
-
2017
«Attention Is All You Need»
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Łukasz Kaiser, Illia Polosukhin
El Transformer prescinde de la recurrencia: solo atención, en paralelo.
Capítulo 10 · Transformers → -
2017
Refuerzo a partir de preferencias humanas
Paul Christiano y colaboradores
Un modelo de recompensa entrenado con comparaciones humanas guía el aprendizaje por refuerzo.
Capítulo 11 · Modelos de lenguaje → -
2017
Repensar la generalización
Chiyuan Zhang y colaboradores
Las redes memorizan etiquetas aleatorias a la perfección: las cotas clásicas no explican su éxito.
Capítulo 09 · Teoría del aprendizaje → -
2018
GPT y BERT
OpenAI; Google
Preentrenar un Transformer sobre texto sin etiquetar y después ajustarlo bate los récords en casi todas las tareas de lenguaje.
Capítulo 10 · Transformers → -
2019
GPT-2 y el doble descenso
OpenAI; Mikhail Belkin y colaboradores
Un modelo de 1500 millones de parámetros escribe textos sorprendentemente coherentes; en paralelo se documenta que los modelos sobreparametrizados vuelven a mejorar.
Capítulo 09 · Teoría del aprendizaje → -
2020
Leyes de escalado y GPT-3
Jared Kaplan y colaboradores; Tom Brown y colaboradores
La pérdida baja como una ley de potencias. GPT-3, con 175 000 millones de parámetros, aprende tareas nuevas a partir de unos pocos ejemplos en el propio texto.
Capítulo 11 · Modelos de lenguaje → -
2021
LoRA
Edward Hu y colaboradores
Adaptar un modelo enorme entrenando solo correcciones de rango bajo.
Capítulo 05 · Álgebra lineal → -
2022
Chinchilla
Jordan Hoffmann y colaboradores
Con un cálculo fijo, parámetros y datos deben crecer a la par: unos 20 tokens por parámetro.
Capítulo 11 · Modelos de lenguaje → -
2022
ChatGPT
OpenAI
El 30 de noviembre, un modelo ajustado con RLHF se abre al público. Un millón de usuarios en cinco días.
Capítulo 11 · Modelos de lenguaje → -
2023
Optimización directa de preferencias
Rafael Rafailov y colaboradores
La solución exacta del objetivo con regularización KL permite alinear modelos sin aprendizaje por refuerzo explícito.
Capítulo 11 · Modelos de lenguaje → -
2024
Nobel para las redes neuronales
John Hopfield, Geoffrey Hinton; Demis Hassabis, John Jumper, David Baker
El Nobel de Física premia los fundamentos de las redes neuronales artificiales y el de Química, la predicción de estructuras de proteínas con AlphaFold (junto con el diseño de proteínas).
Capítulo 08 · Redes neuronales → -
2024
Los modelos calibrados alucinan
Adam Tauman Kalai, Santosh Vempala
Una cota inferior estadística para la tasa de alucinaciones de los modelos de lenguaje calibrados.
Capítulo 11 · Modelos de lenguaje → -
2024
Se demuestra el valor del castor afanoso de 5 estados
Colaboración bbchallenge
Una demostración verificada formalmente establece que la máquina de 5 estados que más tarda en parar da 47 176 870 pasos.
Capítulo 01 · Computación → -
2024
Modelos de razonamiento
OpenAI, DeepSeek y otros
Modelos entrenados con refuerzo sobre problemas verificables que «piensan» antes de responder, cambiando cálculo en el momento de la respuesta por precisión.
Capítulo 11 · Modelos de lenguaje →