Entrevista: Inteligencia Artificial¶
Fundamentos de ML y LLMs, construir aplicaciones con LLMs, agentes, seguridad y operación. Para un arquitecto, el foco no es entrenar modelos sino integrarlos con criterio: cuándo usar IA, cómo evaluarla, cuánto cuesta y cómo se asegura.
Tipos de IA y ML¶
Teoría: Tipos de IA y ML
Básico · ¿Aprendizaje supervisado, no supervisado y por refuerzo?
- Supervisado: aprende de ejemplos etiquetados a predecir la etiqueta (clasificación, regresión).
- No supervisado: busca estructura sin etiquetas (agrupamiento, reducción de dimensionalidad, anomalías).
- Por refuerzo: un agente aprende por recompensas al actuar en un entorno.
- Autosupervisado: las etiquetas salen de los propios datos (predecir la siguiente palabra): así se preentrenan los LLMs.
Repregunta: ¿qué es RLHF? — Ajustar un modelo con refuerzo usando un modelo de recompensa entrenado con preferencias humanas.
Medio · ¿Qué es el sobreajuste y cómo lo detectas y evitas?
El modelo memoriza el entrenamiento (incluido el ruido) y generaliza mal: error bajo en entrenamiento y alto en validación. Se detecta separando entrenamiento, validación y test (o validación cruzada). Se evita con más datos, modelos más simples, regularización, early stopping, dropout.
Repregunta: ¿qué métrica usarías para detectar fraude (0,1 % de positivos)? — No la exactitud (99,9 % diciendo siempre "no"): precisión, recall y su compromiso (F1, curva PR), según el coste de cada error.
Medio · ¿Cuándo usarías ML clásico en lugar de un LLM?
Con datos tabulares estructurados y una tarea concreta (predecir abandono, puntuar riesgo, detectar anomalías): gradient boosting (XGBoost, LightGBM) suele ganar en precisión, coste, latencia y explicabilidad. Los LLMs brillan con lenguaje no estructurado, tareas abiertas y pocos ejemplos.
Repregunta: ¿y para clasificar tickets? — Un LLM sirve para arrancar sin datos etiquetados; con volumen, un clasificador pequeño entrenado (o embeddings + modelo simple) es mucho más barato.
Cómo funcionan los LLMs¶
Teoría: Cómo funcionan los LLMs
Básico · ¿Qué es un token y por qué importa en una arquitectura?
La unidad en la que el modelo lee y escribe: trozos de palabra (en español, ~1 token ≈ 3-4 caracteres). Todo se mide en tokens: el precio (entrada y salida por separado), la latencia (la salida se genera token a token) y la ventana de contexto.
Repregunta: ¿por qué la salida es más cara que la entrada? — La entrada se procesa en paralelo; cada token de salida exige una pasada completa del modelo.
Medio · Explica a alto nivel cómo funciona un transformer.
El texto se convierte en tokens y luego en embeddings (vectores) con información de posición. Cada capa aplica autoatención: cada token calcula cuánto debe "atender" a los demás (consultas, claves y valores) y mezcla su información; luego una red feed-forward. Tras muchas capas, el modelo produce una distribución de probabilidad sobre el siguiente token; se elige uno, se añade y se repite (autorregresivo).
Repregunta: ¿qué es la caché KV? — Guardar las claves y valores de los tokens ya procesados para no recalcularlos en cada paso: acelera la generación y consume memoria de GPU proporcional al contexto.
Medio · ¿Qué controlan la temperatura y top-p?
Cómo se elige el siguiente token. Temperatura baja → casi siempre el más probable (determinista, preciso); alta → más variedad y creatividad (y más errores). Top-p limita la elección al conjunto más pequeño de tokens que suma una probabilidad p. Para extracción o código, baja; para ideas, más alta.
Repregunta: ¿temperatura 0 garantiza la misma respuesta? — No del todo: hay no determinismo numérico en la inferencia por lotes en GPU. Para reproducibilidad, evals con varias muestras.
Medio · ¿Qué son las alucinaciones y cómo las mitigas en un sistema?
El modelo genera texto plausible pero falso, porque predice texto probable, no consulta una base de verdad. Mitigaciones:
- Fundamentar con RAG o herramientas y pedir que cite las fuentes.
- Permitir "no lo sé" en las instrucciones.
- Verificación automática (contra los datos, otro modelo, reglas) y evals.
- Diseño: humano en el bucle donde el error cuesta caro; no usar el LLM para cálculos exactos.
Repregunta: ¿un contexto más largo reduce las alucinaciones? — No necesariamente: con mucho contexto irrelevante la atención se diluye; es mejor poco contexto y muy pertinente.
Avanzado · ¿Qué aporta el razonamiento ('thinking') y cuándo no compensa?
El modelo genera pasos intermedios antes de responder, gastando más tokens (y tiempo) para mejorar en problemas de varios pasos: matemáticas, código, planificación, análisis. Se controla con un presupuesto o nivel de esfuerzo.
No compensa en tareas simples (clasificar, extraer, reformular) o muy sensibles a la latencia: sube coste y tiempo sin mejorar el resultado.
Repregunta: ¿cómo decides el nivel de esfuerzo? — Con evals: el mínimo que da la calidad necesaria en tus casos reales.
Construir aplicaciones con LLMs¶
Teoría: Construir aplicaciones con LLMs
Básico · ¿Qué es RAG y cuándo lo usarías frente a un ajuste fino?
Retrieval-Augmented Generation: antes de llamar al modelo, recuperar los fragmentos relevantes de tus documentos (búsqueda semántica con embeddings, por palabras clave o híbrida) y pasarlos en el contexto.
RAG para conocimiento: datos propios, que cambian, con citas y control de acceso. Ajuste fino para comportamiento: formato, estilo, tareas muy repetitivas, o un modelo más pequeño y barato.
Repregunta: ¿qué es el troceado (chunking) y por qué importa? — Dividir los documentos en fragmentos; si son muy pequeños pierden contexto, si son muy grandes meten ruido. Mejor por estructura (secciones) con solapamiento.
Medio · Un sistema RAG responde mal. ¿Cómo lo diagnosticas?
Separar las dos mitades:
- Recuperación: ¿estaban los fragmentos correctos en el contexto? Medir recall de recuperación con un conjunto de preguntas y documentos esperados. Fallos típicos: troceado malo, embeddings que no captan términos exactos (códigos, nombres) → búsqueda híbrida y reordenación (reranker).
- Generación: con el contexto correcto, ¿responde fiel a él? Medir fidelidad (faithfulness).
Además: datos desactualizados, permisos, y preguntas que necesitan agregar muchos documentos (RAG no sirve para "cuántos…").
Repregunta: ¿cómo evalúas sin etiquetar todo a mano? — Un conjunto dorado pequeño revisado por personas, más LLM como juez calibrado contra él.
Medio · ¿Qué es el context engineering?
Diseñar qué información entra en la ventana de contexto en cada llamada, y en qué forma: instrucciones, ejemplos, documentos recuperados, resultados de herramientas, memoria, historial. El objetivo es el conjunto mínimo de tokens con más señal, porque el contexto es finito, cuesta dinero y el exceso degrada la calidad.
Técnicas: recuperar justo a tiempo, resumir o compactar el historial, notas persistentes fuera del contexto, subagentes con contexto propio que devuelven solo el resultado.
Repregunta: ¿qué es el prompt caching? — Reutilizar el prefijo fijo del contexto (instrucciones, documentos) entre llamadas: menos coste y latencia; obliga a poner lo estable al principio.
Medio · ¿Cómo evalúas una aplicación con LLM antes de llevarla a producción?
- Un conjunto de evaluación con casos reales y casos límite, con el resultado esperado o criterios.
- Evaluadores: código (formato, coincidencia exacta, tests), LLM como juez (con rúbrica y calibrado contra humanos) y revisión humana por muestreo.
- Ejecutarlo en el CI ante cada cambio de prompt, modelo o datos (regresiones).
- En producción: trazas, feedback de usuarios, métricas de coste y latencia, y alimentar el conjunto con fallos reales.
Repregunta: ¿por qué no basta con probar unos cuantos ejemplos a mano? — La salida es no determinista y los cambios tienen efectos no locales: lo que mejora un caso rompe otros.
Avanzado · ¿Cómo reduces el coste y la latencia de una aplicación con LLM?
- Modelo adecuado por tarea: uno pequeño para clasificar o enrutar, uno grande solo donde hace falta.
- Prompt caching del prefijo estable y caché de respuestas para preguntas repetidas.
- Menos tokens: contexto mínimo, salida estructurada y concisa.
- Batch asíncrono para lo que no es interactivo (suele ser mucho más barato).
- Streaming para mejorar la latencia percibida; llamadas en paralelo.
Repregunta: ¿cómo controlas el gasto? — Presupuestos y límites por usuario o funcionalidad, métricas de coste por petición y alertas.
Agentes, MCP y Skills¶
Teoría: Agentes, MCP y Skills · Harnesses y agentes de código
Básico · ¿Workflow o agente?
En un workflow, tu código controla el flujo y el LLM resuelve pasos concretos: predecible, barato, depurable. En un agente, el modelo decide en bucle qué herramienta usar y cuándo ha terminado: resuelve tareas abiertas, a cambio de más coste, latencia y riesgo.
Usar un agente solo si la tarea es compleja y difícil de especificar, el valor lo justifica, el modelo es capaz y los errores se pueden detectar y revertir. Si no, un workflow.
Repregunta: ¿qué patrones de workflow conoces? — Encadenar prompts, enrutar, paralelizar, orquestador con trabajadores, evaluador-optimizador.
Medio · ¿Qué es MCP y qué problema resuelve?
El Model Context Protocol es un estándar abierto para conectar aplicaciones de IA con herramientas y datos: un servidor MCP expone herramientas, recursos y prompts, y cualquier cliente compatible (un IDE, un asistente, un agente) los usa sin integración a medida. Convierte un problema N×M (cada app con cada sistema) en N+M.
Repregunta: ¿qué riesgos de seguridad trae? — Servidores de terceros con permisos amplios, inyección de instrucciones a través de los resultados de las herramientas y descripciones de herramientas maliciosas: mínimo privilegio, servidores de confianza y confirmación humana en acciones sensibles.
Medio · ¿Qué es una Agent Skill y en qué se diferencia de un servidor MCP?
Una skill es una carpeta con instrucciones (SKILL.md), scripts y recursos que el agente carga solo cuando
la necesita: al principio solo ve su nombre y descripción (progressive disclosure). Enseña cómo hacer una
tarea (procedimientos, convenciones). Un servidor MCP da acceso a sistemas (herramientas y datos). Se
complementan.
Repregunta: ¿por qué la carga progresiva importa? — Permite tener muchas skills disponibles sin llenar la ventana de contexto.
Avanzado · ¿Cómo diseñarías un agente fiable para producción?
- Herramientas pocas, bien descritas, con parámetros claros y errores útiles; idempotentes cuando sea posible.
- Límites: número de pasos, presupuesto de tokens, timeouts.
- Permisos mínimos y confirmación humana en acciones irreversibles; sandbox para ejecutar código.
- Contexto gestionado (compactación, memoria externa, subagentes).
- Observabilidad: trazas de cada paso; evals de extremo a extremo con tareas reales.
- Plan de degradación: si el agente no puede, escalar a una persona.
Repregunta: ¿qué es un harness? — El programa que rodea al modelo y ejecuta el bucle: herramientas, permisos, contexto, hooks (por ejemplo Claude Code).
Seguridad, regulación y operación¶
Teoría: Seguridad y regulación · MLOps · IA en el edge · Ecosistema
Medio · ¿Qué es la prompt injection y cómo te defiendes?
Instrucciones maliciosas que llegan al modelo como datos (un documento, una web, un email, la salida de una herramienta) y le hacen desobedecer las instrucciones legítimas: filtrar datos, llamar a herramientas indebidas. No hay una defensa completa; se aplican capas:
- Mínimo privilegio de las herramientas y separar quién lee datos no confiables de quién actúa.
- Confirmación humana en acciones sensibles; nada de exfiltración por URLs o imágenes generadas.
- Marcar y aislar el contenido no confiable, clasificadores de entrada y salida.
- Diseñar suponiendo que la inyección tendrá éxito alguna vez: limitar el daño posible.
Repregunta: ¿qué es la "tríada letal"? — Acceso a datos privados + exposición a contenido no confiable + capacidad de comunicar hacia fuera: con las tres, la exfiltración es posible.
Medio · ¿Qué implica el EU AI Act para un sistema que diseñas?
Regula por nivel de riesgo: prácticas prohibidas (puntuación social, manipulación), alto riesgo (empleo, educación, crédito, infraestructuras críticas…: gestión de riesgos, calidad de datos, documentación, registros, supervisión humana, evaluación de conformidad), transparencia (avisar de que se habla con una IA, marcar el contenido generado) y riesgo mínimo. Los modelos de propósito general tienen obligaciones propias.
Para un arquitecto: clasificar el caso de uso pronto, trazabilidad y registros, supervisión humana en el diseño, y seguir el calendario, que la UE ha ido ajustando.
Repregunta: ¿qué otros marcos de gestión conoces? — ISO/IEC 42001 (sistema de gestión de IA) y el NIST AI RMF.
Medio · ¿Qué técnica usarías para adaptar un LLM a tu caso?
En orden de coste creciente:
- Prompting y context engineering (con ejemplos).
- RAG si falta conocimiento.
- Ajuste fino eficiente (LoRA/QLoRA) si falta comportamiento: formato, tono, una tarea muy concreta, o destilar a un modelo más pequeño.
- Ajuste fino completo o preentrenamiento: casi nunca justificado.
Repregunta: ¿qué hace LoRA? — Congela el modelo y entrena matrices pequeñas de bajo rango que se suman a los pesos: una fracción de los parámetros y de la memoria.
Avanzado · ¿Cómo servirías un modelo abierto en tu propia infraestructura?
- Motor de inferencia optimizado (vLLM, TGI, SGLang; llama.cpp u Ollama en pequeño) con batching continuo y caché KV paginada.
- Memoria de GPU: pesos (parámetros × bytes por parámetro: 7 B en FP16 ≈ 14 GB) + caché KV según contexto y concurrencia; cuantización (INT8, 4 bits) para reducirla.
- En Kubernetes: nodos GPU con device plugin, escalado por cola o latencia, imágenes y pesos cacheados (son enormes), y una pasarela que unifique modelos propios y de API.
Repregunta: ¿cuándo compensa frente a una API? — Por datos que no pueden salir, volumen muy alto y estable, latencia o funcionamiento sin conexión (edge); si no, la API suele ser más barata y simple.
Medio · ¿Cuándo llevarías la inferencia al edge?
Por latencia (visión en tiempo real), conectividad (debe funcionar sin red), privacidad (los datos no salen del sitio) o coste de ancho de banda (no subir vídeo en bruto). Implica modelos pequeños, cuantizados y optimizados para el hardware (NPU, GPU pequeñas), y una forma de distribuirlos y actualizarlos en la flota (como artefactos OCI con GitOps) y de vigilar su deriva.
Repregunta: ¿qué arquitectura híbrida usarías? — Modelo pequeño local para lo frecuente y urgente, y escalado a un modelo grande en la nube para los casos dudosos cuando haya conexión.
Avanzado · ¿Qué es un modelo 'System One' como Jev y dónde encaja?
Un modelo que no genera texto: recibe estado no estructurado y devuelve valores tipados con probabilidades calibradas, en milisegundos y a muy bajo coste (según su fabricante; aún sin evaluaciones independientes). Encaja como un "if" inteligente dentro del código: clasificar, puntuar, filtrar a gran volumen, o como guardarraíl rápido de la salida de un LLM, con umbrales de confianza que deciden si se actúa, se pide confirmación o se pasa a una persona.
Repregunta: ¿qué no le pedirías? — Contar, aritmética, comparar fechas o razonamiento de varios saltos: la lógica exacta va en tu código.