Introdução ao LLM
Esta página oferece um guia sobre LLMs (Modelos de Linguagem em Grande Escala) desde os conceitos básicos até as aplicações, para entusiastas de IA.
Capítulo 17 — Ameaças Futuras e Defesas Emergentes
Ameaças ainda em formação — agentes autônomos, superfícies multimodais, identidade sintética e IA contra IA — e o encerramento da série LLM Primer com uma ponte para Physical AI.
2026-05-26Capítulo 16 — Fine-Tuning Seguro e Adaptação
Um modelo fine-tunado é artefato cujas propriedades de segurança precisam ser conquistadas, não herdadas — porque os mesmos passos de gradiente que ensinam vocabulário de domínio também erodem alinhamento.
2026-05-25Capítulo 15 — Construindo uma Organização de IA Segura
Cultura de segurança, red teams, risco de fornecedor e stewardship como a infraestrutura organizacional que carrega a disciplina ao longo dos anos.
2026-05-24Capítulo 14 — Economia de Tokens e Precificação de APIs
Por que o token é a unidade de cobrança, por que o output custa de quatro a oito vezes o input, e como tokens de reasoning invisíveis acabam na fatura.
2026-05-06Capítulo 12 — Serving Desagregado e Kubernetes
Como separar prefill e decodificação em pools de GPU distintos, transportar a KV cache pelo fabric e expressar a topologia em Kubernetes.
2026-05-04Capítulo 11 — A Camada de Plataforma e Orquestração
Ray Serve, KServe, BentoML e Triton — como as quatro plataformas de orquestração de LLM se dividem por afinidade com a cultura de ops do time.
2026-05-03Capítulo 7 — Estratégias Avançadas de Batching
Do batching estático que colapsa no problema do que termina primeiro ao escalonamento em nível de iteração do batching contínuo — e a dívida que ele cria para o KV cache.
2026-04-29Capítulo 6 — Poda e Destilação de Conhecimento
A poda zera pesos que não importam e a destilação transfere o comportamento do professor para um aluno menor — juntas com a quantização, compõem uma redução de 20 vezes nos bytes por token.
2026-04-28Capítulo 1 — A Mecânica da Geração de Tokens
Por que o loop autoregressivo é sequencial por matemática, como prefill e decoding estressam o chip de formas opostas e por que um único usuário deixa uma H100 99,7 por cento ociosa.
2026-04-23Capítulo 12 — Endurecimento do Protocolo e Defesas
Décima segunda postagem do passeio pelo LLM Primer IV. Os quatro clusters de defesa — atestação criptográfica, disciplina de escopo OAuth com sessões limitadas, sandbox em runtime, e portões humano-no-loop — compõem numa postura que não depende do modelo se comportar corretamente sob condições adversárias.
2026-04-10Capítulo 11 — Superfícies de Ataque e Vulnerabilidades de Protocolo
Décima primeira postagem do passeio pelo LLM Primer IV. Os ataques clássicos adaptados ao MCP — Confused Deputy, Token Passthrough, Session Hijacking — os defeitos no nível de protocolo em torno de escalada de capacidade e sampling não-autenticado, e a propagação implícita de confiança que torna envenenamento de contexto problema estrutural em vez de higiene.
2026-04-09Capítulo 9 — Gerenciando o Orçamento de Atenção
Nona postagem do passeio pelo LLM Primer IV. Context rot, o precipício de lost-in-the-middle, tool-loadout rot, e as três respostas arquiteturais — MCP, RAG, fine-tuning — para a pergunta de onde o conhecimento ausente de um modelo de fato pertence.
2026-04-07Capítulo 8 — Layouts Arquiteturais de Deployment
Oitava postagem do passeio pelo LLM Primer IV. Os três layouts de deployment que emergiram no ecossistema MCP — agente reutilizável, pureza estrita, híbrido — e as quatro restrições determinantes que decidem qual encaixa em qual projeto.
2026-04-06Capítulo 2 — Revelando o Model Context Protocol (MCP)
Segunda postagem do passeio pelo LLM Primer IV. O que o MCP de fato padroniza, a divisão em três papéis entre Host, Cliente e Servidor, por que descoberta dinâmica e mensageria bidirecional diferem de REST nos casos que importam, e o ciclo de vida de sessão que abre com negociação de capacidades.
2026-03-31Capítulo 3 — Frameworks Avançados de Chunking
Terceiro post do passeio pelo LLM Primer III. O espectro de chunking de tamanho fixo a consciente de estrutura, o mito do overlap, o penhasco de contexto que destrói a recuperação em silêncio, e as técnicas de recuperação contextual e late chunking que reformularam a fronteira.
2026-03-20Capítulo 11 — Avaliação, Calibração e Inferência
Décimo primeiro post do passeio capítulo a capítulo pelo LLM Primer II. Como medir uma máquina que pode dizer qualquer coisa — perplexidade, calibração, barras de erro de benchmark e geometria da recuperação para conter alucinação.
2026-03-13Capítulo 12 — Construir um sistema LLM, e o que vem depois
Último post do passeio capítulo a capítulo pelo LLM Primer I. Modelo, ferramentas, RAG, avaliação e guarda-fios costurados em um sistema só — e a ponte do Livro 1 para os Livros 2 a 7 da série.
2026-03-01Capítulo 11 — Modelos menores, modelos mais espertos
Décimo primeiro post do passeio capítulo a capítulo pelo LLM Primer I. Como reduzir modelos grandes para caber em operações reais — destilação, quantização, MoE — e o §11.6 novo da edição 2026, sobre modelos de raciocínio.
2026-02-28Capítulo 6 — Segurança, alinhamento, e o que "ser útil" realmente significa
Sexto post do passeio capítulo a capítulo pelo LLM Primer I. Por que fluência e utilidade são coisas diferentes, o que o alinhamento realmente refina, e uma prévia do §6.6 novo na edição 2026 — IA Constitucional, modelos de debate, e o que há de mais recente em pesquisa de alinhamento.
2026-02-23