Línea temporal

Cuatro siglos hasta ChatGPT

La IA moderna es la confluencia de ideas que nacieron con siglos de diferencia y por motivos muy distintos: repartir apuestas, calcular órbitas, transmitir mensajes por teléfono. Aquí están ordenadas, con dos inviernos incluidos. Filtra por capítulo para seguir el hilo de cada teoría.

1654 – 1927

Los cimientos

Probabilidad, cálculo y álgebra lineal: herramientas creadas para el juego, la física y la astronomía, que tres siglos después servirán para aprender de datos.

  1. 1654

    Pascal y Fermat inventan la probabilidad

    Blaise Pascal, Pierre de Fermat

    Una correspondencia sobre cómo repartir el bote de una partida interrumpida funda el cálculo de probabilidades.

    Capítulo 03 · Probabilidad →
  2. 1676

    La regla de la cadena

    Gottfried W. Leibniz

    Leibniz deriva funciones compuestas en sus notas. Tres siglos después, la retropropagación será esta regla aplicada de forma sistemática.

    Capítulo 06 · Cálculo →
  3. 1713

    Ley de los grandes números

    Jakob Bernoulli

    Se publica póstumamente Ars Conjectandi: la frecuencia observada converge a la probabilidad real.

    Capítulo 03 · Probabilidad →
  4. 1763

    El teorema de Bayes

    Thomas Bayes, Richard Price

    Price publica el ensayo póstumo de Bayes sobre cómo razonar desde los efectos hacia las causas.

    Capítulo 03 · Probabilidad →
  5. 1805

    Mínimos cuadrados

    Adrien-Marie Legendre, Carl F. Gauss

    Legendre publica el método para ajustar las órbitas de los cometas. Gauss lo había usado para reencontrar el planeta enano Ceres en 1801. Es la primera «función de pérdida».

    Capítulo 07 · Optimización →
  6. 1844

    Espacios de dimensión arbitraria

    Hermann Grassmann

    Die lineale Ausdehnungslehre introduce los espacios vectoriales con cualquier número de dimensiones.

    Capítulo 05 · Álgebra lineal →
  7. 1847

    El descenso de gradiente

    Augustin-Louis Cauchy

    Para resolver ecuaciones astronómicas, Cauchy propone bajar paso a paso en la dirección de mayor pendiente.

    Capítulo 07 · Optimización →
  8. 1854

    Las leyes del pensamiento

    George Boole

    Boole escribe la lógica como álgebra: variables que valen 0 o 1 y operaciones que cumplen leyes como las de los números.

    Capítulo 00 · Circuitos y autómatas →
  9. 1858

    La teoría de matrices

    Arthur Cayley

    Cayley define el producto de matrices y las trata como objetos algebraicos por derecho propio.

    Capítulo 05 · Álgebra lineal →
  10. 1879

    La Begriffsschrift

    Gottlob Frege

    El primer lenguaje formal completo para las matemáticas, con variables, cuantificadores y reglas de inferencia.

    Capítulo 02 · Lógica →
  11. 1922

    Máxima verosimilitud

    Ronald A. Fisher

    Fisher formaliza el principio de elegir los parámetros que hacen más probables los datos: el objetivo con el que se entrena cualquier LLM.

    Capítulo 03 · Probabilidad →

1928 – 1955

Nacen la computación y la información

Turing define qué es calcular, Shannon qué es la información y McCulloch y Pitts imaginan neuronas que calculan.

  1. 1928

    El problema de la decisión

    David Hilbert, Wilhelm Ackermann

    ¿Existe un procedimiento mecánico que decida si cualquier enunciado lógico es demostrable?

    Capítulo 01 · Computación →
  2. 1929

    El teorema de completitud

    Kurt Gödel

    En la lógica de primer orden, todo lo que es verdadero en todos los modelos se puede demostrar: verdad y demostración coinciden.

    Capítulo 02 · Lógica →
  3. 1931

    Los teoremas de incompletitud

    Kurt Gödel

    Todo sistema formal suficientemente potente y consistente contiene verdades que no puede demostrar.

    Capítulo 01 · Computación →
  4. 1936

    La máquina de Turing

    Alan Turing, Alonzo Church

    Turing define la computación con una cinta y una tabla de reglas, describe la máquina universal y demuestra que el problema de la parada es indecidible.

    Capítulo 01 · Computación →
  5. 1937

    Los circuitos obedecen el álgebra de Boole

    Claude Shannon

    En su tesis de máster, Shannon muestra que los circuitos de relés calculan funciones booleanas, y que diseñarlos es manipular fórmulas.

    Capítulo 00 · Circuitos y autómatas →
  6. 1943

    La neurona lógica

    Warren McCulloch, Walter Pitts

    Primer modelo matemático de una red de neuronas: umbrales que calculan funciones lógicas.

    Capítulo 08 · Redes neuronales →
  7. 1945

    El ordenador de programa almacenado

    John von Neumann

    El informe del EDVAC describe la arquitectura en la que programa y datos comparten memoria.

    Capítulo 01 · Computación →
  8. 1948

    Una teoría matemática de la comunicación

    Claude Shannon

    Shannon define la entropía, demuestra los límites de la compresión y genera texto con modelos de n-gramas.

    Capítulo 04 · Información →
  9. 1948

    El Baby de Mánchester

    Frederic Williams, Tom Kilburn, Geoff Tootill

    El 21 de junio, el primer ordenador que ejecuta un programa guardado en su propia memoria.

    Capítulo 00 · Circuitos y autómatas →
  10. 1949

    La regla de Hebb

    Donald Hebb

    «Las neuronas que se activan juntas se conectan»: la primera hipótesis sobre cómo aprende una red.

    Capítulo 08 · Redes neuronales →
  11. 1950

    El juego de la imitación

    Alan Turing

    «Computing Machinery and Intelligence» propone el test de Turing y sugiere construir máquinas que aprendan como un niño.

    Capítulo 01 · Computación →
  12. 1951

    La aproximación estocástica

    Herbert Robbins, Sutton Monro

    Se puede optimizar con estimaciones ruidosas del gradiente si la tasa de aprendizaje decrece adecuadamente.

    Capítulo 07 · Optimización →
  13. 1951

    La divergencia de Kullback-Leibler

    Solomon Kullback, Richard Leibler

    Una medida de la distancia entre distribuciones que reaparece en el entrenamiento y en el RLHF.

    Capítulo 04 · Información →
  14. 1951

    Los sucesos regulares

    Stephen Kleene

    Analizando las redes de McCulloch y Pitts, Kleene caracteriza lo que reconocen los autómatas finitos: los lenguajes de las expresiones regulares.

    Capítulo 00 · Circuitos y autómatas →
  15. 1952

    Códigos de Huffman

    David Huffman

    Un algoritmo sencillo construye el código sin prefijos óptimo para una distribución dada.

    Capítulo 04 · Información →

1956 – 1973

La primera primavera

La IA recibe su nombre. Optimismo desbordante: perceptrones, programas que juegan a las damas y chatbots que imitan a un psicoterapeuta.

  1. 1956

    Nace la «inteligencia artificial»

    John McCarthy, Marvin Minsky, Nathaniel Rochester, Claude Shannon

    El taller de verano de Dartmouth da nombre al campo. La propuesta (1955) estimaba que un grupo selecto haría «avances significativos» en dos meses.

  2. 1956

    El Logic Theorist

    Allen Newell, Herbert Simon, Cliff Shaw

    El primer programa que demuestra teoremas: 38 de los 52 primeros del capítulo 2 de los Principia Mathematica.

    Capítulo 02 · Lógica →
  3. 1956

    Tres modelos para el lenguaje

    Noam Chomsky

    Chomsky compara autómatas finitos y gramáticas como modelos del lenguaje; en 1959 forman su jerarquía de cuatro niveles.

    Capítulo 00 · Circuitos y autómatas →
  4. 1957

    El perceptrón

    Frank Rosenblatt

    Una neurona artificial con una regla de aprendizaje. Al año siguiente se presenta el Mark I Perceptron.

    Capítulo 08 · Redes neuronales →
  5. 1957

    Programación dinámica

    Richard Bellman

    La ecuación de Bellman funda la toma de decisiones secuenciales, la base del aprendizaje por refuerzo.

    Capítulo 11 · Modelos de lenguaje →
  6. 1957

    El principio de máxima entropía

    Edwin T. Jaynes

    La distribución menos comprometida compatible con lo que sabemos es exponencial: el softmax con temperatura.

    Capítulo 11 · Modelos de lenguaje →
  7. 1959

    «Aprendizaje automático»

    Arthur Samuel

    Un programa de damas que mejora jugando contra sí mismo populariza la expresión machine learning.

    Capítulo 09 · Teoría del aprendizaje →
  8. 1959

    Autómatas no deterministas

    Michael Rabin, Dana Scott

    Autómatas que adivinan, y la construcción de subconjuntos que demuestra que no reconocen nada nuevo. Premio Turing en 1976.

    Capítulo 00 · Circuitos y autómatas →
  9. 1962

    Convergencia del perceptrón

    Albert Novikoff

    Si los datos son separables con margen γ, el perceptrón comete como mucho (R/γ)2 errores.

    Capítulo 08 · Redes neuronales →
  10. 1964

    La bola pesada

    Boris Polyak

    El método del momento acelera el descenso de gradiente en valles alargados.

    Capítulo 07 · Optimización →
  11. 1965

    Resolución y unificación

    John Alan Robinson

    Una sola regla de inferencia, hecha para máquinas, basta para demostrar cualquier consecuencia en la lógica de primer orden.

    Capítulo 02 · Lógica →
  12. 1966

    ELIZA

    Joseph Weizenbaum

    Un programa de reglas simples que imita a un psicoterapeuta. Muchos usuarios le atribuyen comprensión real, para alarma de su autor.

  13. 1969

    Perceptrons

    Marvin Minsky, Seymour Papert

    Un análisis riguroso de las limitaciones del perceptrón de una capa, con el XOR como ejemplo célebre.

    Capítulo 08 · Redes neuronales →
  14. 1970

    Diferenciación automática en modo inverso

    Seppo Linnainmaa

    Una tesis de máster finlandesa describe el algoritmo que hoy llamamos retropropagación.

    Capítulo 06 · Cálculo →
  15. 1971

    La dimensión VC

    Vladimir Vapnik, Alexey Chervonenkis

    Una medida combinatoria de la capacidad de una clase de modelos que determina cuándo es posible generalizar.

    Capítulo 09 · Teoría del aprendizaje →
  16. 1972

    Prolog

    Alain Colmerauer, Philippe Roussel, Robert Kowalski

    Programar en lógica: un programa es un conjunto de cláusulas de Horn, y ejecutarlo es buscar una demostración.

    Capítulo 02 · Lógica →
  17. 1973

    El informe Lighthill

    James Lighthill

    Un informe muy crítico para el Gobierno británico desencadena recortes de financiación en la investigación en IA.

1974 – 1979

El primer invierno

Las promesas no se cumplen, la financiación se recorta y las redes neuronales caen en desgracia tras el libro de Minsky y Papert. En silencio se inventa la retropropagación.

  1. 1974

    Retropropagación para redes neuronales

    Paul Werbos

    Werbos propone en su tesis entrenar redes multicapa con diferenciación en modo inverso. Pasa casi inadvertida.

    Capítulo 06 · Cálculo →
  2. 1976

    MYCIN

    Edward Shortliffe

    Un sistema experto con unas 600 reglas recomienda antibióticos para infecciones de la sangre tan bien como los especialistas.

    Capítulo 02 · Lógica →

1980 – 1986

Sistemas expertos y conexionismo

Las empresas invierten en sistemas basados en reglas escritas a mano. En paralelo renacen las redes neuronales con la retropropagación.

  1. 1980

    El Neocognitrón

    Kunihiko Fukushima

    Una red jerárquica inspirada en la corteza visual: precursora de las redes convolucionales.

    Capítulo 08 · Redes neuronales →
  2. 1982

    Redes de Hopfield

    John Hopfield

    Una red recurrente que funciona como memoria asociativa, analizada con herramientas de la física estadística.

    Capítulo 08 · Redes neuronales →
  3. 1982

    El proyecto de Quinta Generación

    MITI de Japón

    Diez años de dinero público para construir máquinas paralelas de programación lógica. Se queda lejos de sus objetivos.

    Capítulo 02 · Lógica →
  4. 1983

    El método acelerado

    Yurii Nesterov

    Un método de primer orden con error O(1/k2), el mejor posible para funciones convexas suaves.

    Capítulo 07 · Optimización →
  5. 1984

    Aprendizaje PAC

    Leslie Valiant

    «A Theory of the Learnable» da una definición formal de aprender: probablemente, aproximadamente correcto.

    Capítulo 09 · Teoría del aprendizaje →
  6. 1984

    El lema de Johnson-Lindenstrauss

    William B. Johnson, Joram Lindenstrauss

    Muchos puntos caben en pocas dimensiones sin distorsionar sus distancias: la geometría que aprovechan los embeddings.

    Capítulo 05 · Álgebra lineal →
  7. 1986

    La retropropagación se populariza

    David Rumelhart, Geoffrey Hinton, Ronald Williams

    Un artículo en Nature muestra que las redes multicapa aprenden representaciones internas útiles.

    Capítulo 06 · Cálculo →

1987 – 1992

El segundo invierno

Se hunde el mercado de las máquinas Lisp y los sistemas expertos resultan caros y frágiles. La teoría, sin embargo, avanza: aproximación universal, gradientes que se desvanecen, vectores soporte.

  1. 1987

    Cae el mercado de las máquinas Lisp

    Los ordenadores de propósito general alcanzan a las máquinas especializadas en IA y arrastran consigo a la industria de los sistemas expertos.

  2. 1989

    Aproximación universal

    George Cybenko; Kurt Hornik, Maxwell Stinchcombe, Halbert White

    Una sola capa oculta basta para aproximar cualquier función continua.

    Capítulo 08 · Redes neuronales →
  3. 1989

    Redes convolucionales para leer códigos postales

    Yann LeCun y colaboradores

    Una red entrenada con retropropagación lee dígitos escritos a mano para el servicio postal de EE. UU.

    Capítulo 08 · Redes neuronales →
  4. 1990

    Redes recurrentes simples

    Jeffrey Elman

    Una red con memoria de su propio estado descubre estructura en secuencias de palabras.

    Capítulo 10 · Transformers →
  5. 1991

    El gradiente que se desvanece

    Sepp Hochreiter

    Una tesis de diploma explica por qué las redes profundas y recurrentes no aprenden dependencias largas.

    Capítulo 06 · Cálculo →
  6. 1992

    Máquinas de vectores soporte

    Bernhard Boser, Isabelle Guyon, Vladimir Vapnik

    Clasificadores de margen máximo con garantías teóricas: el método estrella de la década siguiente.

    Capítulo 09 · Teoría del aprendizaje →
  7. 1992

    TD-Gammon

    Gerald Tesauro

    Una red neuronal entrenada por refuerzo jugando contra sí misma alcanza el nivel de los mejores jugadores de backgammon.

    Capítulo 11 · Modelos de lenguaje →

1993 – 2011

El aprendizaje estadístico

La IA se vuelve probabilística y se apoya en los datos. Dominan los métodos con garantías teóricas, mientras las redes neuronales esperan su momento: datos y cálculo.

  1. 1994

    Byte Pair Encoding

    Philip Gage

    Un algoritmo de compresión que, veinte años después, servirá para trocear el texto en tokens.

    Capítulo 11 · Modelos de lenguaje →
  2. 1996

    No hay almuerzo gratis

    David Wolpert

    Ningún algoritmo de aprendizaje es mejor que otro promediando sobre todos los problemas: hace falta un sesgo inductivo.

    Capítulo 09 · Teoría del aprendizaje →
  3. 1997

    LSTM

    Sepp Hochreiter, Jürgen Schmidhuber

    Las puertas de la memoria a largo plazo permiten a las redes recurrentes recordar durante cientos de pasos.

    Capítulo 10 · Transformers →
  4. 1997

    Deep Blue gana a Kasparov

    IBM

    Búsqueda masiva y evaluación diseñada a mano, sin aprendizaje profundo: la otra tradición de la IA.

  5. 2003

    Un modelo de lenguaje neuronal

    Yoshua Bengio y colaboradores

    Embeddings de palabras aprendidos junto con una red que predice la palabra siguiente.

    Capítulo 05 · Álgebra lineal →
  6. 2006

    Redes de creencia profundas

    Geoffrey Hinton, Simon Osindero, Yee-Whye Teh

    Un preentrenamiento capa a capa reaviva el interés por las redes profundas.

    Capítulo 08 · Redes neuronales →
  7. 2009

    ImageNet

    Fei-Fei Li y colaboradores

    Una base de datos con millones de imágenes etiquetadas y una competición anual que medirá el progreso de la visión.

    Capítulo 08 · Redes neuronales →

2012 – 2016

El aprendizaje profundo

GPU, grandes conjuntos de datos y algunos trucos técnicos: las redes profundas arrasan en visión, habla y juegos.

  1. 2012

    AlexNet

    Alex Krizhevsky, Ilya Sutskever, Geoffrey Hinton

    Una red convolucional entrenada en GPU gana ImageNet con un error top-5 del 15,3 %, diez puntos menos que el segundo.

    Capítulo 08 · Redes neuronales →
  2. 2013

    word2vec

    Tomas Mikolov y colaboradores

    Embeddings entrenados a gran escala en los que las relaciones semánticas se vuelven direcciones: rey − hombre + mujer ≈ reina.

    Capítulo 05 · Álgebra lineal →
  3. 2014

    Atención para traducir

    Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio

    El decodificador aprende a fijarse en las palabras relevantes de la frase de entrada.

    Capítulo 10 · Transformers →
  4. 2014

    Adam

    Diederik Kingma, Jimmy Ba

    Un optimizador con momento y una tasa de aprendizaje adaptativa para cada parámetro.

    Capítulo 07 · Optimización →
  5. 2015

    Redes residuales

    Kaiming He y colaboradores

    Las conexiones residuales permiten entrenar redes de más de cien capas sin que el gradiente se desvanezca.

    Capítulo 06 · Cálculo →
  6. 2016

    AlphaGo gana a Lee Sedol

    DeepMind

    Redes profundas, búsqueda y aprendizaje por refuerzo vencen al campeón en el juego del go, una década antes de lo previsto.

    Capítulo 11 · Modelos de lenguaje →

2017 – hoy

Transformers y modelos de lenguaje

La atención reemplaza a la recurrencia, las leyes de escalado guían la inversión y la predicción de la palabra siguiente se convierte en asistentes de uso general.

  1. 2017

    «Attention Is All You Need»

    Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Łukasz Kaiser, Illia Polosukhin

    El Transformer prescinde de la recurrencia: solo atención, en paralelo.

    Capítulo 10 · Transformers →
  2. 2017

    Refuerzo a partir de preferencias humanas

    Paul Christiano y colaboradores

    Un modelo de recompensa entrenado con comparaciones humanas guía el aprendizaje por refuerzo.

    Capítulo 11 · Modelos de lenguaje →
  3. 2017

    Repensar la generalización

    Chiyuan Zhang y colaboradores

    Las redes memorizan etiquetas aleatorias a la perfección: las cotas clásicas no explican su éxito.

    Capítulo 09 · Teoría del aprendizaje →
  4. 2018

    GPT y BERT

    OpenAI; Google

    Preentrenar un Transformer sobre texto sin etiquetar y después ajustarlo bate los récords en casi todas las tareas de lenguaje.

    Capítulo 10 · Transformers →
  5. 2019

    GPT-2 y el doble descenso

    OpenAI; Mikhail Belkin y colaboradores

    Un modelo de 1500 millones de parámetros escribe textos sorprendentemente coherentes; en paralelo se documenta que los modelos sobreparametrizados vuelven a mejorar.

    Capítulo 09 · Teoría del aprendizaje →
  6. 2020

    Leyes de escalado y GPT-3

    Jared Kaplan y colaboradores; Tom Brown y colaboradores

    La pérdida baja como una ley de potencias. GPT-3, con 175 000 millones de parámetros, aprende tareas nuevas a partir de unos pocos ejemplos en el propio texto.

    Capítulo 11 · Modelos de lenguaje →
  7. 2021

    LoRA

    Edward Hu y colaboradores

    Adaptar un modelo enorme entrenando solo correcciones de rango bajo.

    Capítulo 05 · Álgebra lineal →
  8. 2022

    Chinchilla

    Jordan Hoffmann y colaboradores

    Con un cálculo fijo, parámetros y datos deben crecer a la par: unos 20 tokens por parámetro.

    Capítulo 11 · Modelos de lenguaje →
  9. 2022

    ChatGPT

    OpenAI

    El 30 de noviembre, un modelo ajustado con RLHF se abre al público. Un millón de usuarios en cinco días.

    Capítulo 11 · Modelos de lenguaje →
  10. 2023

    Optimización directa de preferencias

    Rafael Rafailov y colaboradores

    La solución exacta del objetivo con regularización KL permite alinear modelos sin aprendizaje por refuerzo explícito.

    Capítulo 11 · Modelos de lenguaje →
  11. 2024

    Nobel para las redes neuronales

    John Hopfield, Geoffrey Hinton; Demis Hassabis, John Jumper, David Baker

    El Nobel de Física premia los fundamentos de las redes neuronales artificiales y el de Química, la predicción de estructuras de proteínas con AlphaFold (junto con el diseño de proteínas).

    Capítulo 08 · Redes neuronales →
  12. 2024

    Los modelos calibrados alucinan

    Adam Tauman Kalai, Santosh Vempala

    Una cota inferior estadística para la tasa de alucinaciones de los modelos de lenguaje calibrados.

    Capítulo 11 · Modelos de lenguaje →
  13. 2024

    Se demuestra el valor del castor afanoso de 5 estados

    Colaboración bbchallenge

    Una demostración verificada formalmente establece que la máquina de 5 estados que más tarda en parar da 47 176 870 pasos.

    Capítulo 01 · Computación →
  14. 2024

    Modelos de razonamiento

    OpenAI, DeepSeek y otros

    Modelos entrenados con refuerzo sobre problemas verificables que «piensan» antes de responder, cambiando cálculo en el momento de la respuesta por precisión.

    Capítulo 11 · Modelos de lenguaje →