Introducción a LLM

Esta página proporciona una guía sencilla sobre los modelos de lenguaje de gran escala (LLM), desde lo básico hasta las aplicaciones para los entusiastas de la IA.


Total de 18 artículos disponibles. | Actualmente en la página 1 de 1.

Capítulo 15 — APIs serverless frente a infraestructura dedicada

Decimoquinta entrega del recorrido de LLM Primer VI. Cuándo autohostear ahorra dinero y cuándo la ingeniería de plataforma se lo come todo. La fórmula del punto de equilibrio, la función escalón que la decide, y por qué la postura realista es híbrida con un router en la frontera.

2026-05-07

Capítulo 12 — Serving desagregado y Kubernetes

Duodécima entrega del recorrido de LLM Primer VI. Separar prefill y decode en flotas GPU distintas, y las primitivas de Kubernetes que mantienen los pods del lado correcto de la interconexión. LeaderWorkerSet, Grove PodCliqueSet y el scheduler consciente de topología.

2026-05-04

Capítulo 10 — La capa del motor LLM

Décima entrega del recorrido de LLM Primer VI. La frontera entre motor y plataforma, y los cinco motores que dominan la capa en 2026. vLLM como default Python-nativo, TensorRT-LLM como pipeline de build, SGLang como RadixAttention agéntico, TGI como Hugging Face y Ollama como edge.

2026-05-02

Capítulo 9 — Decodificación especulativa

Novena entrega del recorrido de LLM Primer VI. Cómo la decodificación especulativa paga por una suposición barata y una verificación un poco más ancha, y si acierta lo bastante a menudo el modelo objetivo produce varios tokens al coste de reloj de uno. EAGLE, Medusa, la aritmética del speedup.

2026-05-01

Capítulo 8 — Gestión de caché KV de nueva generación

Octava entrega del recorrido de LLM Primer VI. Traer la paginación del sistema operativo dentro del motor de inferencia, y convertir la caché KV de una losa de bytes reservados en un recurso compartido, evictable y prefix-cacheable. PagedAttention, H2O, InfiniGen y RadixAttention.

2026-04-30

Capítulo 7 — Estrategias de batching avanzadas

Séptima entrega del recorrido de LLM Primer VI. Por qué el batching no es una optimización sino el movimiento que hace tratable el decoding limitado por ancho de banda, y por qué el batch es un verbo, no un sustantivo. Estático, continuo y chunked prefill.

2026-04-29

Capítulo 6 — Pruning y destilación de conocimiento

Sexta entrega del recorrido de LLM Primer VI. Cómo el pruning y la destilación atacan el número de pesos y transfieren la distribución del profesor a un estudiante más pequeño. La sparsity 2:4 que Hopper acelera nativa y las tres compresiones apiladas en su orden correcto.

2026-04-28

Capítulo 5 — Desmitificando la cuantización

Quinta entrega del recorrido de LLM Primer VI. Por qué un modelo de 70B sobrevive la cuantización a 4 bits mientras que uno de 1B no, qué hacen realmente AWQ, GPTQ, SmoothQuant y GGUF, y dónde deja de ser segura y empieza a degradar en silencio.

2026-04-27

Capítulo 3 — GPUs de centro de datos para IA generativa

Tercera entrega del recorrido de LLM Primer VI. Por qué se compra una GPU de serving por su ancho de banda de HBM y su capacidad de VRAM, no por el número de FLOP/s de la portada de la hoja de especificaciones. H100, H200, B200, L40S y MI300X leídos como perfiles de ancho de banda y capacidad.

2026-04-25

Capítulo 1 — La mecánica de la generación de tokens

Primera entrega del recorrido de LLM Primer VI. Por qué casi toda pregunta difícil sobre el serving de LLMs desciende de un único hecho — el bucle que produce cada token está limitado por el ancho de banda de memoria, y el cómputo caro por el que pagaste está inactivo el 99,7 % del tiempo.

2026-04-23

LLM Primer VI — Introducción a la serie e índice

Índice y prólogo del recorrido capítulo por capítulo de LLM Primer VI. Por qué el mismo H100 que sirve un modelo de 70B queda inactivo el 99,7 % del tiempo, y cómo los dieciséis capítulos convierten esa ociosidad en throughput sin romper la latencia que percibe el usuario.

2026-04-22

Capítulo 8 — Optimizar rendimiento, serving y coste

Octava y última entrega del recorrido de LLM Primer V. La llamada más barata es la que nunca se hace: caché semántica y enrutado dinámico arriba, y dentro del servidor de inferencia PagedAttention, continuous batching, decodificación especulativa y prefix caching que ponen el suelo de coste.

2026-04-21

Capítulo 14 — Benchmarking, testing y rendimiento

Decimocuarta y última entrega del recorrido de LLM Primer IV. El MCP-Universe Benchmark sobre servidores reales, los dos modos de fallo sistémico que expuso, la brecha de diez veces en throughput entre sesión por petición y pools de sesión compartidos, y el puente al Volumen V.

2026-04-12

Capítulo 13 — Frameworks e integración con la nube

Decimotercera entrega del recorrido de LLM Primer IV. Strands con Bedrock, el patrón de capa de estado de AWS, el Microsoft Agent Framework, LangChain, Semantic Kernel — y las tres formas de integración de producción a las que los equipos llegan de forma independiente.

2026-04-11

Capítulo 2 — Parsing inteligente de documentos

Segunda entrega del recorrido de LLM Primer III. Por qué un PDF no es un fichero de texto, qué preserva en realidad un parser consciente del layout, el panorama actual de herramientas (LlamaParse, Docling, Unstructured, Marker-PDF, Firecrawl, DeepSeek-OCR) y la vía multimodal que recupera directamente sobre imágenes de página.

2026-03-19

Capítulo 9 — Rendimiento, escalado y costos: los compromisos reales de ingeniería

Capítulo 9 de la serie LLM Primer I. Las realidades operativas de ejecutar LLM a escala — tamaño del modelo vs capacidad, el compromiso latencia–throughput, economía de costos, cuantización y despliegue en el borde. Por qué los modelos de frontera son a menudo la elección equivocada incluso cuando puedes permitírtelos.

2026-02-26

Capítulo 8 — Usando LLM en aplicaciones: chatbots, código, extracción y agentes

Capítulo 8 de la serie LLM Primer I. Los patrones de aplicación que realmente llegan a producción — chatbots, resumen, asistentes de código, extracción estructurada y el auge de los sistemas agénticos donde el modelo conduce un bucle de uso de herramientas. Más los benchmarks que todo ingeniero debería reconocer por su nombre.

2026-02-25

Un recorrido capítulo por capítulo de LLM Primer I — Introducción a la serie e índice

Introducción e índice del recorrido en doce partes capítulo por capítulo de LLM Primer I: Cómo funciona la IA generativa. Una publicación por día, del 18 de febrero al 1 de marzo de 2026. Léelos en orden o elige el capítulo que más te importe. Los doce están listados y enlazados aquí.

2026-02-17