Introdução ao LLM

Esta página oferece um guia sobre LLMs (Modelos de Linguagem em Grande Escala) desde os conceitos básicos até as aplicações, para entusiastas de IA.


Total de 14 artigos disponíveis. | Atualmente na página 1 de 1.

Capítulo 10 — A Camada de Engine de LLM

A fronteira entre engine e plataforma, e os cinco engines que dominam essa camada em 2026 — vLLM, TensorRT-LLM, SGLang, TGI e Ollama.

2026-05-02

Capítulo 9 — Decodificação Especulativa

Como a decodificação especulativa contorna o gargalo sequencial da autorregressão, quais mecanismos de rascunho funcionam e a aritmética que decide quando o ganho compensa.

2026-05-01

Capítulo 6 — Poda e Destilação de Conhecimento

A poda zera pesos que não importam e a destilação transfere o comportamento do professor para um aluno menor — juntas com a quantização, compõem uma redução de 20 vezes nos bytes por token.

2026-04-28

Capítulo 5 — Desmistificando a Quantização

Por que um modelo de 70B sobrevive à quantização de 4 bits enquanto um de 1B não sobrevive — e como escolher a receita entre AWQ, GPTQ, SmoothQuant e GGUF.

2026-04-27

Capítulo 4 — Silício de IA Especializado e ASICs

Groq, Inferentia2, TPU e Gaudi 3 — onde ASICs vencem GPUs em latência ou custo por token, e onde os retos de kernel e variedade de modelos ainda pertencem à NVIDIA.

2026-04-26

Capítulo 3 — GPUs de Data Center para IA Generativa

Como ler o catálogo de GPUs de data center — H100, H200, B200, L40S, MI300X — pela lente de banda de HBM e capacidade de VRAM, não pelos FLOPs de manchete.

2026-04-25

Capítulo 1 — A Mecânica da Geração de Tokens

Por que o loop autoregressivo é sequencial por matemática, como prefill e decoding estressam o chip de formas opostas e por que um único usuário deixa uma H100 99,7 por cento ociosa.

2026-04-23

LLM Primer VI — Introdução da Série e Índice

Introdução e índice do passeio capítulo a capítulo por LLM Primer VI: Escalando Sistemas de IA — dezesseis capítulos sobre inferência LLM tratada como disciplina de engenharia.

2026-04-22

Capítulo 8 — Otimizando Performance, Serving e Custo

Post final do passeio pelo LLM Primer V. Cache semântico, roteamento dinâmico e as otimizações dentro do servidor de inferência que fecham o volume — do que nunca é chamado ao que quase não custa.

2026-04-21

Capítulo 4 — Escolhendo o Banco de Dados Vetorial Certo

Quarto post do passeio pelo LLM Primer III. A separação arquitetural entre bancos vetoriais dedicados e extensões estilo Postgres, as líderes gerenciadas (Pinecone, Vertex), o campo open-source (Qdrant, Milvus, Weaviate), as opções embedded, e os três eixos operacionais — residência, ops, custo — que decidem a escolha real.

2026-03-21

Capítulo 11 — Modelos menores, modelos mais espertos

Décimo primeiro post do passeio capítulo a capítulo pelo LLM Primer I. Como reduzir modelos grandes para caber em operações reais — destilação, quantização, MoE — e o §11.6 novo da edição 2026, sobre modelos de raciocínio.

2026-02-28

Capítulo 10 — Multimodal: para além do texto

Décimo post do passeio capítulo a capítulo pelo LLM Primer I. Como o mesmo transformer passou a aceitar imagem e áudio — vision transformer e tokenização de áudio — e os limites honestos por trás da ideia de "um modelo que vê tudo".

2026-02-27

LLM Primer I — passeio capítulo a capítulo: introdução e índice

Introdução do passeio capítulo a capítulo pelo LLM Primer I. Como a série está organizada, o que cada capítulo entrega, e o índice dos doze posts que vêm a seguir entre 18 de fevereiro e 1º de março.

2026-02-17

A Série LLM Primer — Um guia de campo para a IA generativa, escrito um volume por vez

A série LLM Primer — um guia de campo de sete volumes completo sobre IA generativa por Sho Shimoda. Dos fundamentos à segurança. Inclui Physical AI como volume companheiro. Todos os 7 volumes disponíveis na Amazon.

2026-02-15