- Conmutar
- Computar
- Deducir
- Probabilidad
- Información
- Vectores
- Derivadas
- Optimizar
- Neuronas
- Generalizar
- Atención
- LLM
Capítulo 03 · Probabilidad
Aprender de los datos
La probabilidad pone números a la incertidumbre. Dos resultados del siglo XVIII, la ley de los grandes números y el teorema de Bayes, explican por qué más datos nos acercan a la verdad y cómo actualizar lo que creemos al ver cada uno.
En este capítulo
En 1654 el caballero de Méré le planteó a Blaise Pascal un problema de apuestas: si una partida a varias rondas se interrumpe antes de acabar, ¿cómo se reparte el bote de forma justa? Pascal se lo contó por carta a Pierre de Fermat, y en esa correspondencia nació el cálculo de probabilidades. Tres siglos después, la misma matemática que repartía apuestas decide qué palabra escribe ChatGPT.
Un modelo de lenguaje no «sabe» qué palabra viene después: asigna una probabilidad a cada palabra posible. Todo lo que hace se apoya en este lenguaje.
Variables aleatorias y distribuciones
Una variable aleatoria es una cantidad cuyo valor depende del azar: el resultado de una moneda, la altura de una persona elegida al azar o la próxima palabra de un texto. Su distribución asigna a cada resultado un número entre 0 y 1, y la suma de todos es 1:
El valor esperado es la media ponderada por las probabilidades, , y la varianza mide cuánto se dispersa la variable alrededor de esa media, .
La ley de los grandes números
Si una moneda sale cara con una probabilidad que desconocemos, la intuición dice que, tras muchos lanzamientos, la proporción de caras se acercará a . Jakob Bernoulli dedicó veinte años a demostrarlo, y el resultado se publicó en 1713, ocho años después de su muerte, en Ars Conjectandi. Lo llamó su «teorema áureo».
Sean variables independientes con la misma distribución, media y varianza finita , y sea su media muestral. Para todo ,
Demostración (con la desigualdad de Chebyshev)
Por independencia, . La desigualdad de Chebyshev dice que una variable se aleja de su media más de con probabilidad como mucho , así que
La demostración da algo más que el límite: el error típico de la media decrece como . Para tener el doble de precisión hacen falta cuatro veces más datos. Esta ley de rendimientos decrecientes reaparece, con otros exponentes, en las leyes de escalado de los LLM.
El teorema de Bayes
La ley de los grandes números habla de lo que pasa a la larga, pero casi nunca tenemos infinitos datos. ¿Qué podemos decir de después de ver solo diez lanzamientos? El reverendo Thomas Bayes trató ese problema inverso en un ensayo que su amigo Richard Price publicó en 1763, después de su muerte. Laplace lo redescubrió y lo generalizó en 1774.
Para una hipótesis y unos datos con ,
Demostración
Por la definición de probabilidad condicionada, . Basta con despejar .
El teorema cabe en una línea, pero su lectura es profunda: el prior resume lo que creíamos antes de ver los datos, la verosimilitud mide lo bien que cada hipótesis explica lo observado y el posterior es la creencia actualizada. Cada dato nuevo convierte el posterior de hoy en el prior de mañana.
En la moneda, si el prior sobre es una distribución y observamos caras en lanzamientos, el posterior vuelve a ser una Beta:
Con el prior uniforme (), la probabilidad de que el próximo lanzamiento salga cara es . Es la regla de sucesión de Laplace, con la que en 1814 calculó la probabilidad de que el sol salga mañana sabiendo que ha salido todos los días de la historia registrada. Fue el primer «suavizado» de una estimación, y los modelos de lenguaje estadísticos lo usarían doscientos años después para no asignar probabilidad cero a las palabras que no habían visto nunca.
Máxima verosimilitud: la función de pérdida de la IA
Ronald Fisher propuso entre 1912 y 1922 un criterio más directo: de entre todos los valores posibles del parámetro, quedarse con el que hace más probables los datos observados. Si los datos son independientes, la verosimilitud es un producto, y como multiplicar muchos números pequeños da problemas numéricos se maximiza su logaritmo:
Con la moneda sale lo esperado, . Pero la expresión de la derecha merece una segunda mirada: es exactamente la función que se minimiza al entrenar cualquier modelo de lenguaje. En el siguiente capítulo veremos que también tiene nombre en teoría de la información: entropía cruzada.
Entrenar un modelo es elegir los parámetros que hacen más probables los datos de entrenamiento. Todo lo demás (redes, gradientes, atención) son maneras de expresar y optimizar esa probabilidad.
La regla de la cadena de la probabilidad
Queda una pieza. ¿Cómo se asigna probabilidad a una frase entera, si el número de frases posibles es astronómico? Con una identidad elemental que se sigue de aplicar una y otra vez la definición de probabilidad condicionada:
La probabilidad de un texto es el producto de las probabilidades de cada palabra condicionada a todas las anteriores. Esta identidad convierte el problema imposible de modelar textos completos en otro manejable: predecir la palabra siguiente. Un LLM es un aproximador gigantesco de , y genera texto muestreando de esa distribución, una palabra cada vez.
Ya sabemos qué queremos estimar. Falta saber cuánta incertidumbre contiene una distribución y cómo medir lo lejos que está un modelo de la realidad. Esas preguntas las respondió Claude Shannon en 1948.
Referencias
- J. Bernoulli (1713). Ars Conjectandi. Basilea.
- T. Bayes (1763). «An Essay towards Solving a Problem in the Doctrine of Chances». Philosophical Transactions of the Royal Society, 53.
- P.-S. Laplace (1814). Essai philosophique sur les probabilités. París.
- R. A. Fisher (1922). «On the Mathematical Foundations of Theoretical Statistics». Philosophical Transactions of the Royal Society A, 222.
- E. T. Jaynes (2003). Probability Theory: The Logic of Science. Cambridge University Press.