Saltar a contenido

Tipos de IA y aprendizaje automático Básico

"IA" es un paraguas enorme. Saber situar cada técnica evita dos errores caros: usar un LLM donde bastaba una regresión, y usar reglas donde hacía falta aprendizaje.

flowchart TB
    IA[Inteligencia artificial] --> SIM[IA simbólica<br/>reglas, lógica, búsqueda]
    IA --> ML[Aprendizaje automático<br/>aprender de datos]
    ML --> CL[ML clásico<br/>árboles, regresión, SVM, clustering]
    ML --> DL[Deep learning<br/>redes neuronales profundas]
    DL --> GEN[IA generativa]
    GEN --> LLM[LLMs]
    GEN --> DIF[Difusión<br/>imagen, vídeo, audio]

Por capacidad

Tipo Qué es Estado
IA estrecha (ANI) Resuelve tareas concretas (traducir, clasificar, programar) Toda la IA actual, incluidos los LLMs, aunque cada vez más general
IA general (AGI) Rendimiento humano o superior en prácticamente cualquier tarea cognitiva Objetivo declarado de varios laboratorios; sin definición ni fecha consensuadas
Superinteligencia (ASI) Supera ampliamente a los humanos en todo Hipotética; motiva la investigación en seguridad y alineamiento

Por enfoque

Enfoque Cómo funciona Pros Contras Ejemplos
Simbólica Reglas y conocimiento explícitos, lógica, búsqueda Explicable, determinista, sin datos de entrenamiento No escala a problemas difusos (visión, lenguaje) Motores de reglas, sistemas expertos, planificadores, solvers
Estadística / ML Aprende patrones a partir de datos Maneja ruido y complejidad Necesita datos; menos explicable Detección de fraude, recomendadores, LLMs
Neuro-simbólica Combina redes neuronales con razonamiento simbólico Lo mejor de ambos Complejidad Un LLM que usa un solver o ejecuta código como herramienta

Regla práctica

Si puedes escribir la regla, escríbela (más barata, rápida y auditable). Usa ML cuando la regla es desconocida o demasiado compleja, y un LLM cuando el problema es de lenguaje, conocimiento general o razonamiento abierto.

Paradigmas de aprendizaje

Paradigma Datos Tareas Ejemplo
Supervisado Ejemplos etiquetados (entrada → salida correcta) Clasificación, regresión ¿Este nodo edge fallará en 24 h?
No supervisado Sin etiquetas Clustering, reducción de dimensionalidad, anomalías Agrupar sitios por patrón de uso
Autosupervisado Las etiquetas salen de los propios datos (predecir la palabra siguiente o la parte oculta) Preentrenamiento de grandes modelos Así se preentrenan los LLMs
Por refuerzo (RL) Recompensas por acciones en un entorno Control, juegos, alineamiento de LLMs AlphaGo; RLHF; entrenar razonamiento

ML clásico: algoritmos que siguen mandando

Algoritmo Tipo Cuándo
Regresión lineal / logística Supervisado Línea base interpretable
Árboles de decisión Supervisado Reglas legibles
Random forest / gradient boosting (XGBoost, LightGBM) Supervisado Datos tabulares: suelen ganar a las redes neuronales
k-NN Supervisado Similitud simple
SVM Supervisado Conjuntos medianos, fronteras claras
k-means, DBSCAN No supervisado Segmentación
PCA, UMAP No supervisado Reducir dimensiones, visualizar
Isolation Forest No supervisado Detección de anomalías (telemetría)
# Predicción de fallo de nodos edge a partir de telemetría (scikit-learn)
from sklearn.ensemble import GradientBoostingClassifier
from sklearn.model_selection import train_test_split
from sklearn.metrics import classification_report

X = df[["cpu_p95", "mem_p95", "disk_errors", "reboots_7d", "temp_max"]]
y = df["failed_next_24h"]

X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, stratify=y, random_state=42)
model = GradientBoostingClassifier().fit(X_train, y_train)
print(classification_report(y_test, model.predict(X_test)))   # precision, recall, F1 por clase

Conceptos que hay que dominar

  • Entrenamiento / validación / test: el test solo se usa al final; si lo miras para ajustar, deja de medir nada.
  • Overfitting (memoriza el entrenamiento) vs. underfitting (demasiado simple). Remedios: más datos, regularización, validación cruzada.
  • Métricas: accuracy engaña con clases desbalanceadas → precision (de lo que marqué, cuánto era cierto), recall (de lo cierto, cuánto marqué), F1, AUC-ROC; en regresión, MAE/RMSE.
  • Data leakage: información del futuro o de la etiqueta que se cuela en las variables → resultados irreales.
  • MLOps: versionado de datos y modelos, feature stores, despliegue, monitorización de deriva (data/model drift).

Deep learning: arquitecturas

Arquitectura Idea Uso típico
MLP (perceptrón multicapa) Capas densas Bloque básico
CNN (convolucionales) Filtros que detectan patrones locales Visión artificial
RNN / LSTM Procesan secuencias paso a paso Series temporales (hoy, a menudo sustituidas por transformers)
Transformer Atención: cada elemento mira a todos los demás en paralelo LLMs, visión, audio, casi todo
Mixture of Experts (MoE) Solo se activa una parte de la red por token LLMs grandes con menor coste de inferencia
Modelos de difusión Aprenden a quitar ruido paso a paso Generación de imagen, vídeo, audio
GAN Generador contra discriminador Generación de imagen (antes de la difusión)
Autoencoders / VAE Comprimen y reconstruyen Anomalías, representaciones latentes
GNN Redes sobre grafos Moléculas, redes sociales, topologías
State Space Models (Mamba) Secuencias largas en tiempo lineal Alternativa o complemento a la atención

Discriminativa vs. generativa

Discriminativa Generativa
Aprende La frontera entre clases: P(y | x) La distribución de los datos: puede crear nuevos
Salida Etiqueta, número, puntuación Texto, imagen, código, audio…
Ejemplos Clasificador de spam, detector de anomalías LLMs, difusión

Tipos de modelos generativos actuales

Tipo Qué hace
LLM Genera texto (y código) prediciendo el siguiente token → Cómo funcionan
Modelo de razonamiento LLM entrenado para "pensar" antes de responder; mejor en matemáticas, código y planificación
Multimodal (VLM) Entiende imagen, audio o vídeo además de texto
SLM (modelo pequeño) Pocos miles de millones de parámetros; se ejecuta en portátiles, móviles o edge
Modelo de embeddings Convierte texto o imágenes en vectores para búsqueda semántica → RAG
Difusión Imagen, vídeo y audio a partir de texto
VLA (vision-language-action) Percibe, entiende instrucciones y actúa: robótica

World models y JEPA

Una línea de investigación que cuestiona que predecir texto baste para llegar a una inteligencia general.

  • World model: un modelo interno de cómo funciona el mundo que permite predecir las consecuencias de las acciones y planificar. Ejemplos: modelos que generan entornos interactivos (Genie de Google DeepMind), simuladores para robótica y conducción.
  • JEPA (Joint-Embedding Predictive Architecture), propuesta por Yann LeCun (2022): en lugar de predecir cada píxel o token (generativo), predice la representación abstracta de la parte que falta. Así ignora detalles impredecibles y aprende lo esencial. Variantes: I-JEPA (imágenes), V-JEPA y V-JEPA 2 (vídeo, con aplicación en robótica).
  • LeCun sostiene que los LLMs autoregresivos no bastan para razonar y planificar como los humanos; a finales de 2025 anunció su salida de Meta para centrarse en este enfoque. Es un debate abierto, no una conclusión.
LLM autoregresivo JEPA / world model
Predice El siguiente token Representaciones abstractas del estado del mundo
Aprende principalmente de Texto (y multimodal) Vídeo, interacción, sensores
Punto fuerte Lenguaje, conocimiento, código Física intuitiva, planificación, robótica

Preguntas de repaso

¿Por qué el gradient boosting suele ganar a las redes neuronales en datos tabulares?

Los datos tabulares tienen variables heterogéneas y poco estructura espacial o secuencial que una red pueda explotar; los árboles manejan bien escalas distintas, valores ausentes e interacciones con menos datos y ajuste.

Un clasificador de fallos tiene 99 % de accuracy. ¿Es bueno?

No se sabe: si solo el 1 % de los nodos falla, un modelo que siempre dice "no falla" también tiene 99 %. Hay que mirar precision, recall y la matriz de confusión.

¿Qué tipo de aprendizaje se usa para preentrenar un LLM?

Autosupervisado: predecir el siguiente token sobre enormes cantidades de texto. Después se ajusta con ejemplos supervisados y con aprendizaje por refuerzo (feedback humano o de IA, y recompensas verificables).

¿Qué diferencia a JEPA de un modelo generativo?

El generativo reconstruye la entrada (píxeles, tokens); JEPA predice solo la representación abstracta de la parte que falta, sin tener que modelar detalles impredecibles.

Ejercicios

Ejercicio 1 · Básico — ¿Reglas, ML o LLM?

Elige el enfoque para: (a) rechazar manifiestos con la etiqueta :latest; (b) predecir qué nodos fallarán mañana a partir de su telemetría; (c) resumir para un operador un log de 2 000 líneas; (d) clasificar tickets de soporte en 5 categorías con 50 000 ejemplos etiquetados.

Solución

(a) Reglas: la condición es exacta y conocida (una política de Kyverno/Conftest). (b) ML clásico supervisado (gradient boosting sobre variables de telemetría). (c) LLM: lenguaje y resumen de texto libre. (d) Depende de coste y volumen: un clasificador ML entrenado con los 50 000 ejemplos (barato y rápido en producción), o un LLM con ejemplos (few-shot) si hay pocos datos o las categorías cambian a menudo; un modelo de decisión tipada como Jev también encaja.

Ejercicio 2 · Medio — Interpretar métricas

Un modelo de detección de fallos da: 100 fallos reales en el conjunto de prueba; el modelo marca 150 nodos, de los que 80 fallan de verdad. Calcula precision, recall y F1. ¿Es bueno?

Solución

Precision = 80 / 150 = 53 % (de lo que marca, algo más de la mitad es cierto). Recall = 80 / 100 = 80 % (detecta 8 de cada 10 fallos). F1 = 2 × 0,53 × 0,80 / (0,53 + 0,80) ≈ 0,64. Depende del coste de cada error: si una revisión preventiva es barata y un fallo muy caro, un recall alto con precision moderada puede ser aceptable; si cada alerta moviliza a un técnico, hay que subir la precision (ajustar el umbral de decisión).

Ejercicio 3 · Avanzado — Detectar data leakage

Un modelo predice con 99 % de acierto si un despliegue fallará. Entre sus variables está rollback_count (número de rollbacks del despliegue). ¿Qué problema hay?

Solución

Data leakage: rollback_count solo se conoce después de que el despliegue haya fallado; el modelo "hace trampa" usando información del futuro. En producción, al predecir antes del despliegue, esa variable vale 0 y el modelo no sirve. Regla: cada variable debe estar disponible en el momento de la predicción. Revisar todas las variables con esa pregunta y validar con una separación temporal (entrenar con el pasado, probar con el futuro).