Introducción a LLM
Esta página proporciona una guía sencilla sobre los modelos de lenguaje de gran escala (LLM), desde lo básico hasta las aplicaciones para los entusiastas de la IA.
Capítulo 4 — Inyección de prompts y jailbreaks
Cuarta entrega del recorrido de LLM Primer VII. Por qué la inyección de prompts no tiene una corrección estructural análoga a las consultas parametrizadas, y la arquitectura de mitigación por capas que responde a esa ausencia.
2026-05-13Capítulo 2 — Modelado de amenazas para sistemas LLM
Segunda entrega del recorrido de LLM Primer VII. Las cuatro preguntas de Shostack, STRIDE, PASTA y MITRE ATLAS aplicados a un sistema cuyo componente más poderoso lee toda entrada como potencialmente instructiva.
2026-05-11Capítulo 14 — Economía del token y precios de API
Decimocuarta entrega del recorrido de LLM Primer VI. Por qué el token es la unidad de precio, por qué la salida cuesta 4–8× más que la entrada, y cómo la acumulación de contexto y los tokens invisibles de razonamiento acaban en la factura.
2026-05-06Capítulo 6 — Pruning y destilación de conocimiento
Sexta entrega del recorrido de LLM Primer VI. Cómo el pruning y la destilación atacan el número de pesos y transfieren la distribución del profesor a un estudiante más pequeño. La sparsity 2:4 que Hopper acelera nativa y las tres compresiones apiladas en su orden correcto.
2026-04-28Capítulo 5 — Desmitificando la cuantización
Quinta entrega del recorrido de LLM Primer VI. Por qué un modelo de 70B sobrevive la cuantización a 4 bits mientras que uno de 1B no, qué hacen realmente AWQ, GPTQ, SmoothQuant y GGUF, y dónde deja de ser segura y empieza a degradar en silencio.
2026-04-27Capítulo 4 — Silicio especializado y ASICs de IA
Cuarta entrega del recorrido de LLM Primer VI. La elección entre GPU y ASIC es una pregunta sobre la forma de la carga. Cuándo ganan Groq, Inferentia, TPU y Gaudi, y por qué las GPUs siguen ganando en la frontera y en la variedad de modelos.
2026-04-26Capítulo 2 — El desafío de la caché KV
Segunda entrega del recorrido de LLM Primer VI. La estructura de datos que se come la VRAM de todo sistema de serving antes de que los pesos tengan oportunidad, la fórmula que gobierna su tamaño, las variantes arquitectónicas que la reducen y el problema de fragmentación que arruina la asignación ingenua.
2026-04-24Capítulo 4 — Agentes de IA y llamada a herramientas
Cuarta entrega del recorrido de LLM Primer V. El bucle ReAct como base y sus tres aumentaciones, los esquemas de herramientas como contrato del que depende toda la fiabilidad, y las tres capas de memoria — a corto plazo, a largo plazo y semántica — que un agente necesita de verdad.
2026-04-17Capítulo 2 — Modelos base e ingeniería de prompts
Segunda entrega del recorrido de LLM Primer V. Selección de modelo como decisión de enrutado, muestreo como perfil deliberado, y prompts defensivos con salidas estructuradas — cuatro superficies de control que el equipo opera con intención o sufre las consecuencias.
2026-04-15Capítulo 14 — Benchmarking, testing y rendimiento
Decimocuarta y última entrega del recorrido de LLM Primer IV. El MCP-Universe Benchmark sobre servidores reales, los dos modos de fallo sistémico que expuso, la brecha de diez veces en throughput entre sesión por petición y pools de sesión compartidos, y el puente al Volumen V.
2026-04-12Capítulo 13 — Frameworks e integración con la nube
Decimotercera entrega del recorrido de LLM Primer IV. Strands con Bedrock, el patrón de capa de estado de AWS, el Microsoft Agent Framework, LangChain, Semantic Kernel — y las tres formas de integración de producción a las que los equipos llegan de forma independiente.
2026-04-11Capítulo 12 — Endurecimiento del protocolo y defensas
Duodécima entrega del recorrido de LLM Primer IV. Los cuatro racimos de defensa — atestación criptográfica, disciplina de scopes OAuth con sesiones acotadas, sandboxing en tiempo de ejecución y puertas human-in-the-loop — se componen en una postura que no depende de que el modelo se comporte correctamente bajo condiciones adversarias.
2026-04-10Capítulo 11 — Superficies de ataque y vulnerabilidades del protocolo
Undécima entrega del recorrido de LLM Primer IV. Los ataques clásicos adaptados a MCP — Confused Deputy, Token Passthrough, Session Hijacking — los defectos a nivel de protocolo de escalado de capacidades y sampling sin autenticar, y la propagación implícita de confianza que vuelve estructural y no de higiene el envenenamiento de contexto.
2026-04-09Capítulo 10 — Memoria de tareas de horizonte largo
Décima entrega del recorrido de LLM Primer IV. Memoria a corto plazo mediante ventanas y scratchpads ReAct, memoria a largo plazo mediante vectores episódicos y almacenes semánticos, y las técnicas de compactación que mantienen productivo a un agente a lo largo de horas y días.
2026-04-08Capítulo 9 — Administrando el presupuesto de atención
Novena entrega del recorrido de LLM Primer IV. Context rot, el acantilado de lost-in-the-middle, tool-loadout rot, y las tres respuestas arquitectónicas — MCP, RAG, fine-tuning — a la pregunta de dónde corresponde de verdad el conocimiento que le falta a un modelo.
2026-04-07Capítulo 8 — Distribuciones arquitectónicas de despliegue
Octava entrega del recorrido de LLM Primer IV. Las tres distribuciones de despliegue que han emergido en el ecosistema MCP — agente reutilizable, pureza estricta, híbrida — y las cuatro restricciones vinculantes que determinan cuál encaja con cada proyecto.
2026-04-06Capítulo 7 — Patrones colaborativos avanzados y dinámicos
Séptima entrega del recorrido de LLM Primer IV. Consenso en mesa redonda, enrutado por handoff y orquestación magéntica — los patrones que aparecen cuando la topología hay que construirla por petición, con los modos de fallo (no-terminación, mis-routing, planificación descontrolada) que los patrones más simples evitan.
2026-04-05Capítulo 6 — Estrategias fundamentales de orquestación
Sexta entrega del recorrido de LLM Primer IV. Las dos formas fundacionales de orquestación — pipelines secuenciales y scatter-gather concurrente — y la pregunta previa que todo equipo debería hacerse: ¿es un sistema multi-agente la respuesta correcta?
2026-04-04Capítulo 5 — Protocolos de transporte y descubrimiento
Quinta entrega del recorrido de LLM Primer IV. Los tres transportes que MCP soporta, la capa de descubrimiento .well-known con Server Cards, y las preocupaciones operativas aburridas — CORS, validación de Origin, caching — que deciden si un servidor es un ciudadano cooperativo de la red o un pasivo.
2026-04-03Capítulo 4 — Primitivas del cliente: comportamientos agénticos y control
Cuarta entrega del recorrido de LLM Primer IV. Sampling, Roots y Elicitation son los tres pequeños agujeros controlados que MCP abre en el muro host-servidor — cada uno una capacidad otorgada de vuelta, cada uno un riesgo aceptado en nombre del usuario.
2026-04-02Capítulo 3 — Primitivas del servidor: exponer contexto y capacidades
Tercera entrega del recorrido de LLM Primer IV. Los tres sustantivos que un servidor MCP puede ofrecer — Recursos (estado de lectura), Prompts (andamiajes reutilizables), Herramientas (acciones de escritura) — sus esquemas, sus ciclos de vida, sus modelos de error y la disciplina de elegir la primitiva correcta.
2026-04-01Capítulo 2 — Desentrañando el Model Context Protocol (MCP)
Segunda entrega del recorrido de LLM Primer IV. Qué estandariza MCP de verdad, la división en tres roles Host, Cliente y Servidor, por qué el descubrimiento dinámico y la mensajería bidireccional se diferencian de REST en los casos que importan, y el ciclo de vida de la sesión que abre con negociación de capacidades.
2026-03-31Capítulo 1 — La crisis de integración de la IA y el auge de la arquitectura agéntica
Primera entrega del recorrido de LLM Primer IV. Por qué los agentes monolíticos se deshilachan al crecer el system prompt, el problema de integración N por M que se esconde debajo, y el paso de la ingeniería de prompts a la ingeniería de contexto que MCP vino a habilitar.
2026-03-30LLM Primer IV — Introducción a la serie e índice
Apertura del recorrido capítulo a capítulo del Libro IV de la serie LLM Primer — Diseñando la cognición de la IA con MCP. Por qué los agentes necesitan una capa de protocolo para escalar más allá de la demo, para quién está escrito, y el calendario de los catorce posts que siguen, del 30 de marzo al 12 de abril.
2026-03-29Capítulo 4 — Elegir la base de datos vectorial correcta
Cuarta entrega del recorrido de LLM Primer III. La división arquitectónica entre bases de datos vectoriales dedicadas y extensiones tipo Postgres, los líderes gestionados (Pinecone, Vertex), el campo open-source (Qdrant, Milvus, Weaviate), las opciones embebidas, y los tres ejes operativos — residencia, operación, coste — que deciden la elección real.
2026-03-21Capítulo 2 — Parsing inteligente de documentos
Segunda entrega del recorrido de LLM Primer III. Por qué un PDF no es un fichero de texto, qué preserva en realidad un parser consciente del layout, el panorama actual de herramientas (LlamaParse, Docling, Unstructured, Marker-PDF, Firecrawl, DeepSeek-OCR) y la vía multimodal que recupera directamente sobre imágenes de página.
2026-03-19Capítulo 11 — Evaluación, calibración e inferencia
Capítulo 11 de la serie LLM Primer II. Cómo se mide realmente una máquina que puede decir cualquier cosa: perplejidad como vara de medir intrínseca, calibración como pregunta a menudo más importante que la precisión, barras de error como antídoto al teatro de los benchmarks y la geometría de recuperación como herramienta de producción contra la alucinación.
2026-03-13Capítulo 10 — Matemáticas del post-entrenamiento y la alineación
Capítulo 10 de la serie LLM Primer II. Cómo un predictor de siguiente token genial pero salvaje se civiliza hasta convertirse en un asistente útil — ajuste fino supervisado, modelado de recompensas con Bradley–Terry, RLHF con correa KL y la elegante derivación de DPO que colapsa toda la cañería en una sola pérdida supervisada.
2026-03-12Capítulo 4 — La arquitectura Transformer: dentro del motor de la IA moderna
Capítulo 4 de la serie LLM Primer I. Un recorrido por el bloque Transformer — cómo el self-attention, la codificación posicional y las capas apiladas se combinan para producir la arquitectura sobre la que está construido cada LLM moderno. Incluye una explicación clara de por qué escalar Transformers funciona, y cuánto cuesta.
2026-02-21Capítulo 2 — Probabilidad, tokens y texto: el juego de adivinar la siguiente palabra
Capítulo 2 de la serie LLM Primer I. Cómo los LLM convierten el texto en tokens, por qué el modelado del lenguaje es fundamentalmente un problema de probabilidad y cómo el viejo enfoque de n-gramas dio paso a modelos neuronales capaces de generalizar. Incluye explicaciones en lenguaje sencillo sobre la perplejidad y por qué importan los límites entre tokens.
2026-02-19