Introdução ao LLM
Esta página oferece um guia sobre LLMs (Modelos de Linguagem em Grande Escala) desde os conceitos básicos até as aplicações, para entusiastas de IA.
Capítulo 7 — Alucinações e Confiabilidade
Confiabilidade como propriedade de segurança — porque uma saída confidentemente errada é problema de segurança sempre que consequências dependem de correção.
2026-05-16Capítulo 15 — APIs Serverless vs Infraestrutura Dedicada
A matemática do ponto de equilíbrio entre API por token e GPU dedicada, o item de engenharia de plataforma que decide a conta e por que a postura híbrida é a resposta realista.
2026-05-07Capítulo 13 — Autoscaling e Mitigação de Cold Start
Por que o HPA padrão do Kubernetes derruba deployments de LLM sob picos de tráfego, e como KEDA, Knative e CRIU se combinam para consertar o problema.
2026-05-05Capítulo 12 — Serving Desagregado e Kubernetes
Como separar prefill e decodificação em pools de GPU distintos, transportar a KV cache pelo fabric e expressar a topologia em Kubernetes.
2026-05-04Capítulo 8 — Gerenciamento de KV Cache de Próxima Geração
PagedAttention traz a paginação do sistema operacional para o motor de inferência; H2O e InfiniGen adicionam evicção; o prefix caching serve milhões de requisições agênticas em uma dúzia de GPUs.
2026-04-30Capítulo 2 — O Desafio do KV Cache
A fórmula que governa o tamanho do KV cache, os trade-offs entre MHA, GQA e MQA, e por que a alocação ingênua desperdiça a maior parte do orçamento de VRAM.
2026-04-24LLM Primer VI — Introdução da Série e Índice
Introdução e índice do passeio capítulo a capítulo por LLM Primer VI: Escalando Sistemas de IA — dezesseis capítulos sobre inferência LLM tratada como disciplina de engenharia.
2026-04-22Capítulo 8 — Otimizando Performance, Serving e Custo
Post final do passeio pelo LLM Primer V. Cache semântico, roteamento dinâmico e as otimizações dentro do servidor de inferência que fecham o volume — do que nunca é chamado ao que quase não custa.
2026-04-21Capítulo 7 — Segurança e Guardrails de LLM
Sétimo post do passeio pelo LLM Primer V. Injeção direta versus indireta, a matriz de mitigação em quatro camadas e o princípio de que autoridade tem de casar com origem de confiança.
2026-04-20Capítulo 6 — Observabilidade e Tracing de IA
Sexto post do passeio pelo LLM Primer V. Do log de requisição para o trace causal aninhado, as métricas que importam para sistemas LLM, e o pipeline de export que fecha o loop com avaliação.
2026-04-19Capítulo 14 — Benchmarking, Testes e Desempenho
Décima quarta e última postagem do passeio pelo LLM Primer IV. O MCP-Universe Benchmark em servidores reais, os dois modos de falha sistêmicos que ele expôs, o gap de dez vezes de throughput entre sessão-por-requisição e pools de sessão compartilhados, e a ponte para o Volume V.
2026-04-12Capítulo 9 — Gerenciando o Orçamento de Atenção
Nona postagem do passeio pelo LLM Primer IV. Context rot, o precipício de lost-in-the-middle, tool-loadout rot, e as três respostas arquiteturais — MCP, RAG, fine-tuning — para a pergunta de onde o conhecimento ausente de um modelo de fato pertence.
2026-04-07Capítulo 8 — Layouts Arquiteturais de Deployment
Oitava postagem do passeio pelo LLM Primer IV. Os três layouts de deployment que emergiram no ecossistema MCP — agente reutilizável, pureza estrita, híbrido — e as quatro restrições determinantes que decidem qual encaixa em qual projeto.
2026-04-06LLM Primer IV — Introdução à Série e Índice
Abrindo o passeio capítulo a capítulo pelo Livro IV da série LLM Primer — Projetando a Cognição da IA com MCP. Por que agentes precisam de uma camada de protocolo para escalar além do demoware, para quem este livro foi escrito, e o cronograma das quatorze postagens que se seguem, de 30 de março a 12 de abril.
2026-03-29Capítulo 3 — Como o texto flui dentro do modelo
Terceiro post do passeio capítulo a capítulo pelo LLM Primer I. Como o token muda de forma dentro do modelo — embeddings, atenção, transformer — sem cair em matrizes nem perder precisão.
2026-02-20A Série LLM Primer — Um guia de campo para a IA generativa, escrito um volume por vez
A série LLM Primer — um guia de campo de sete volumes completo sobre IA generativa por Sho Shimoda. Dos fundamentos à segurança. Inclui Physical AI como volume companheiro. Todos os 7 volumes disponíveis na Amazon.
2026-02-15Introdução aos Grandes Modelos de Linguagem (LLMs) - Guia Completo para Engenheiros
Explore os fundamentos dos Grandes Modelos de Linguagem (LLMs), incluindo o treinamento, as aplicações e os desafios. Um guia completo para engenheiros que querem entender o impacto dos LLMs no aprendizado de máquina e no processamento de linguagem natural.
2024-09-01