- Conmutar
- Computar
- Deducir
- Probabilidad
- Información
- Vectores
- Derivadas
- Optimizar
- Neuronas
- Generalizar
- Atención
- LLM
Capítulo 04 · Información
Medir la sorpresa
En 1948 Claude Shannon convirtió la información en una cantidad medible. Con una sola fórmula, la entropía, explicó cuánto se puede comprimir un mensaje y cómo medir lo lejos que está un modelo de la realidad. Esa medida es, literalmente, la función que minimiza cualquier LLM al entrenarse.
En este capítulo
En julio de 1948 un ingeniero de los Laboratorios Bell, Claude Shannon, publicó «A Mathematical Theory of Communication». En la segunda página apartaba el significado de un plumazo: «los aspectos semánticos de la comunicación son irrelevantes para el problema de ingeniería». Lo que le interesaba era cuánta información hay en un mensaje y cómo transmitirla con eficiencia. Su respuesta fundó una disciplina entera y, setenta años después, da la mejor descripción de lo que hace un modelo de lenguaje.
La información es sorpresa
Si alguien te dice que mañana saldrá el sol, no aprendes nada: ya lo sabías. Si te dice que mañana nevará en Sevilla, aprendes mucho. Shannon formalizó esta intuición: la información que aporta un suceso depende solo de lo improbable que era.
La información de un resultado con probabilidad es
Un suceso seguro () aporta 0 bits. Una moneda justa aporta bit. Un suceso con probabilidad aporta 10 bits. El logaritmo tiene un motivo: queremos que la información de dos sucesos independientes se sume, y la probabilidad conjunta se multiplica: .
Entropía: la sorpresa media
Antes de conocer el resultado no sabemos cuánta sorpresa nos espera, pero sí podemos calcular su valor medio. Esa media es la entropía, la cantidad central de toda la teoría.
Cumple si toma valores. Vale 0 solo cuando un resultado es seguro y alcanza el máximo solo cuando todos son equiprobables.
Shannon no escogió la fórmula por estética: demostró que es la única medida razonable de incertidumbre.
Sea una función que (1) es continua en las , (2) crece con cuando los resultados son equiprobables y (3) es consistente al descomponer una elección en elecciones sucesivas. Entonces
para alguna constante , que solo fija la unidad (bits si el logaritmo es en base 2).
Vuelve al ejemplo de la portada. Para «El gato está sentado en el…», una distribución muy repartida entre sofá, suelo y jardín tiene una entropía alta: hay mucha incertidumbre sobre la palabra siguiente. Después de «Érase una…», casi toda la probabilidad cae en vez y la entropía es casi cero. Arrastra las barras de la figura para ver cómo cambia.
Comprimir es predecir
La entropía tiene un significado operativo muy concreto: es el límite de la compresión sin pérdidas.
Para cualquier código binario sin prefijos de los símbolos de una fuente con entropía , la longitud media cumple . Además, existe un código con
Idea de la demostración
Las longitudes de un código sin prefijos cumplen la desigualdad de Kraft, , así que se comporta como una distribución. Entonces por la desigualdad de Gibbs (más abajo). Para la cota superior basta con elegir , que cumple Kraft y da .
En 1952 David Huffman, entonces estudiante de doctorado en el MIT, encontró un algoritmo sencillo que construye el código óptimo: une una y otra vez los dos símbolos menos probables. La consecuencia es la clave de todo lo que viene: para comprimir bien hay que predecir bien. Quien conoce la distribución puede asignar códigos cortos a lo probable. El cálculo inverso también funciona: un buen compresor contiene un buen modelo de los datos.
Entropía cruzada: el precio de equivocarse
Supón que los datos siguen la distribución real y que tu modelo cree que siguen . Si diseñas el código con , cada símbolo te cuesta bits, y en media pagas la entropía cruzada:
El primer término es la incertidumbre propia de los datos, que ningún modelo puede eliminar. El segundo, la divergencia de Kullback-Leibler (1951), mide los bits que se desperdician por usar en lugar de :
Para cualesquiera distribuciones y , , con igualdad si y solo si . Por tanto .
Demostración
Usamos , con igualdad solo en . Sumando sobre los con :
(El cambio de base del logaritmo solo multiplica por una constante positiva).
Este es el punto de la web donde todo encaja. Si es la distribución empírica de los datos de entrenamiento, minimizar respecto a los parámetros es lo mismo que minimizar la log-verosimilitud negativa del capítulo anterior. Máxima verosimilitud, mínima entropía cruzada y máxima compresión son el mismo objetivo, y ese objetivo es la función de pérdida con la que se entrena cada LLM:
Su exponencial se llama perplejidad, (con en bits): es como si el modelo dudara, en cada paso, entre palabras equiprobables.
Las aproximaciones de Shannon al inglés
En el mismo artículo de 1948 Shannon hizo un experimento que hoy parece profético. Generó texto al azar con modelos cada vez más informados: letras equiprobables, letras con su frecuencia real, letras que dependen de la anterior (dígrafos), de las dos anteriores… y luego lo mismo con palabras. Con cada nivel, el texto se parecía más al inglés. Era el primer modelo de lenguaje estadístico, construido a mano con tablas de frecuencias de libros.
En 1951 Shannon estimó la entropía del inglés pidiendo a personas que adivinaran textos letra a letra, y obtuvo entre 0,6 y 1,3 bits por letra, muy por debajo de los bits de las letras equiprobables. Esa redundancia es la que explota un modelo de lenguaje. Un modelo de -gramas no puede ir mucho más allá: el número de contextos crece exponencialmente con y casi todos aparecen una vez o ninguna. Para generalizar a contextos nunca vistos hay que representar las palabras de forma que «gato» y «felino» queden cerca. Para eso necesitamos vectores y el álgebra lineal.
Referencias
- C. E. Shannon (1948). «A Mathematical Theory of Communication». Bell System Technical Journal, 27(3–4).
- S. Kullback y R. A. Leibler (1951). «On Information and Sufficiency». Annals of Mathematical Statistics, 22(1).
- C. E. Shannon (1951). «Prediction and Entropy of Printed English». Bell System Technical Journal, 30(1).
- D. A. Huffman (1952). «A Method for the Construction of Minimum-Redundancy Codes». Proceedings of the IRE, 40(9).
- T. M. Cover y J. A. Thomas (2006). Elements of Information Theory, 2.ª ed. Wiley.
- G. Delétang et al. (2024). «Language Modeling Is Compression». ICLR 2024.