Introdução ao LLM
Esta página oferece um guia sobre LLMs (Modelos de Linguagem em Grande Escala) desde os conceitos básicos até as aplicações, para entusiastas de IA.
Capítulo 12 — Controle de Acesso e Identidade
Quem pode invocar quais capacidades de uma aplicação integrada a LLM, com o adicional de que o modelo, ao agir por ferramentas, também é principal cuja permissão precisa ser escopada.
2026-05-21Capítulo 10 — Projetando Arquiteturas LLM Seguras
A arquitetura como disciplina primária de segurança — porque a configuração mais segura de um componente probabilístico é aquela cujo raio de destruição é limitado por estrutura, não pela contenção do próprio componente.
2026-05-19Capítulo 9 — Integridade de Modelo e Riscos da Cadeia de Suprimentos
Um artefato de modelo é um binário distribuído por terceiros — com as preocupações de desserialização, backdoor e proveniência que a distribuição de binários sempre carregou.
2026-05-18Capítulo 8 — Ataques Adversariais a Modelos
De Goodfellow 2014 a TextFooler e sufixos universais até roubo de modelo em APIs de produção — a tradição de pesquisa por trás do prompt injection.
2026-05-17Capítulo 6 — Riscos da Geração Aumentada por Recuperação
O corpus de recuperação como canal de entrada não confiável — cada documento indexado é, do ponto de vista do modelo, uma instrução em pé de igualdade com a pergunta do usuário.
2026-05-15Capítulo 4 — Prompt Injection e Jailbreaks
Por que prompt injection não tem correção estrutural análoga às consultas parametrizadas, e como a arquitetura de mitigação em quatro camadas do resto da Parte II se estrutura.
2026-05-13Capítulo 1 — Por Que a Segurança de IA É Diferente
Por que a segurança de IA não é segurança tradicional com um adjetivo de ML; o substrato mudou, a superfície de ataque se ampliou e os modelos estão se tornando infraestrutura.
2026-05-10Capítulo 16 — Estratégias de Corte de Custo em Produção
Roteamento de modelos, compactação de contexto, batch APIs e cache semântico — os movimentos ortogonais que se compõem em uma redução de 80 por cento sem mudar o que o usuário vê.
2026-05-08Capítulo 15 — APIs Serverless vs Infraestrutura Dedicada
A matemática do ponto de equilíbrio entre API por token e GPU dedicada, o item de engenharia de plataforma que decide a conta e por que a postura híbrida é a resposta realista.
2026-05-07Capítulo 14 — Economia de Tokens e Precificação de APIs
Por que o token é a unidade de cobrança, por que o output custa de quatro a oito vezes o input, e como tokens de reasoning invisíveis acabam na fatura.
2026-05-06Capítulo 13 — Autoscaling e Mitigação de Cold Start
Por que o HPA padrão do Kubernetes derruba deployments de LLM sob picos de tráfego, e como KEDA, Knative e CRIU se combinam para consertar o problema.
2026-05-05Capítulo 11 — A Camada de Plataforma e Orquestração
Ray Serve, KServe, BentoML e Triton — como as quatro plataformas de orquestração de LLM se dividem por afinidade com a cultura de ops do time.
2026-05-03Capítulo 6 — Poda e Destilação de Conhecimento
A poda zera pesos que não importam e a destilação transfere o comportamento do professor para um aluno menor — juntas com a quantização, compõem uma redução de 20 vezes nos bytes por token.
2026-04-28Capítulo 5 — Desmistificando a Quantização
Por que um modelo de 70B sobrevive à quantização de 4 bits enquanto um de 1B não sobrevive — e como escolher a receita entre AWQ, GPTQ, SmoothQuant e GGUF.
2026-04-27Capítulo 4 — Silício de IA Especializado e ASICs
Groq, Inferentia2, TPU e Gaudi 3 — onde ASICs vencem GPUs em latência ou custo por token, e onde os retos de kernel e variedade de modelos ainda pertencem à NVIDIA.
2026-04-26Capítulo 2 — O Desafio do KV Cache
A fórmula que governa o tamanho do KV cache, os trade-offs entre MHA, GQA e MQA, e por que a alocação ingênua desperdiça a maior parte do orçamento de VRAM.
2026-04-24Capítulo 1 — A Mecânica da Geração de Tokens
Por que o loop autoregressivo é sequencial por matemática, como prefill e decoding estressam o chip de formas opostas e por que um único usuário deixa uma H100 99,7 por cento ociosa.
2026-04-23LLM Primer VI — Introdução da Série e Índice
Introdução e índice do passeio capítulo a capítulo por LLM Primer VI: Escalando Sistemas de IA — dezesseis capítulos sobre inferência LLM tratada como disciplina de engenharia.
2026-04-22Capítulo 3 — Geração Aumentada por Recuperação
Terceiro post do passeio pelo LLM Primer V. O pipeline RAG de cinco estágios de ponta a ponta, por que o chunking é onde vive ou morre a qualidade, e as transformações de consulta que separam a demo do deployment.
2026-04-16Capítulo 1 — A Disciplina da Engenharia de IA
Primeiro post do passeio pelo LLM Primer V. Por que sua demo funciona e seu sistema de produção não é um problema de engenharia, não de modelo — e os cinco pilares que o fecham.
2026-04-14LLM Primer V — Introdução da Série e Índice
Primeiro post do passeio pelo LLM Primer V. Por que o padrão demo-para-produção quebra, o wrapper determinístico ao redor do núcleo probabilístico, e as oito superfícies onde vive a disciplina da engenharia de IA.
2026-04-13Capítulo 14 — Benchmarking, Testes e Desempenho
Décima quarta e última postagem do passeio pelo LLM Primer IV. O MCP-Universe Benchmark em servidores reais, os dois modos de falha sistêmicos que ele expôs, o gap de dez vezes de throughput entre sessão-por-requisição e pools de sessão compartilhados, e a ponte para o Volume V.
2026-04-12Capítulo 7 — Padrões Avançados Colaborativos e Dinâmicos
Sétima postagem do passeio pelo LLM Primer IV. Consenso roundtable, roteamento por handoff, e orquestração magentic — os padrões que emergem quando a topologia precisa ser construída por requisição, com os modos de falha (não-terminação, mis-routing, planejamento desbocado) que os padrões mais simples evitam.
2026-04-05Capítulo 2 — Revelando o Model Context Protocol (MCP)
Segunda postagem do passeio pelo LLM Primer IV. O que o MCP de fato padroniza, a divisão em três papéis entre Host, Cliente e Servidor, por que descoberta dinâmica e mensageria bidirecional diferem de REST nos casos que importam, e o ciclo de vida de sessão que abre com negociação de capacidades.
2026-03-31Capítulo 1 — A Crise de Integração de IA e a Ascensão da Arquitetura Agêntica
Primeira postagem do passeio pelo LLM Primer IV. Por que agentes monolíticos se esfarrapam conforme prompts de sistema crescem, o problema de integração N vezes M escondido por baixo, e o movimento de engenharia de prompt para engenharia de contexto que o MCP foi feito para habilitar.
2026-03-30LLM Primer IV — Introdução à Série e Índice
Abrindo o passeio capítulo a capítulo pelo Livro IV da série LLM Primer — Projetando a Cognição da IA com MCP. Por que agentes precisam de uma camada de protocolo para escalar além do demoware, para quem este livro foi escrito, e o cronograma das quatorze postagens que se seguem, de 30 de março a 12 de abril.
2026-03-29Capítulo 9 — A Tríade de Avaliação de RAG
Nono post do passeio pelo LLM Primer III. Um sistema RAG pode falhar em três lugares distintos e por fora as falhas parecem iguais — a Tríade de Avaliação de Relevância de Contexto, Fidelidade e Relevância da Resposta é o pequeno vocabulário que impede consertar um bug enquanto se mede outro.
2026-03-26Capítulo 7 — Implementando Controle de Acesso
Sétimo post do passeio pelo LLM Primer III. ACLs em nível de documento como fundação, RBAC com rótulos de sensibilidade do Microsoft Purview, ReBAC com Zanzibar e SpiceDB, e a disciplina de pré-filtro versus pós-filtro que corre por baixo de todos eles.
2026-03-24Capítulo 6 — Modelos de Ameaça e Vulnerabilidades em RAG
Sexto post do passeio pelo LLM Primer III. A superfície expandida de ataque da recuperação — envenenamento de corpus, chunks adversariais, injection indireta de prompt, inversão de embedding e o problema do deputado confuso em RAG agêntico. Ataques concretos, cada um demonstrado, cada um reprodutível.
2026-03-23Capítulo 5 — Arquitetando o Pipeline de Recuperação
Quinto post do passeio pelo LLM Primer III. Por que uma única busca vetorial não é um pipeline — recuperação híbrida, reciprocal rank fusion, reranking com cross-encoder, e rewriting e HyDE do lado da query — montados na arquitetura de produção para a qual sistemas RAG maduros convergem.
2026-03-22Capítulo 2 — Parsing Inteligente de Documentos
Segundo post do passeio pelo LLM Primer III. Por que um PDF não é um arquivo de texto, o que os parsers conscientes de layout de fato preservam, o panorama atual de ferramentas (LlamaParse, Docling, Unstructured, Marker-PDF, Firecrawl, DeepSeek-OCR), e a trilha multimodal que recupera direto sobre imagens de página.
2026-03-19Capítulo 1 — A Evolução da Arquitetura RAG
Primeiro post do passeio pelo LLM Primer III. As quatro posturas arquiteturais de RAG — Naive, Avançada, Modular, Agêntica — lidas como uma história de entregar mais agência ao LLM uma decisão por vez, e a resposta honesta para quando fine-tuning é a ferramenta melhor do que recuperação.
2026-03-18LLM Primer III — Introdução da Série e Índice
Abertura do passeio capítulo a capítulo pelo Livro III da série LLM Primer — Aprimorando a IA Empresarial com RAG. Por que a geração aumentada por recuperação parece simples por fora e é uma pilha de disciplinas por dentro, para quem este livro foi escrito, e o cronograma dos onze posts que seguem, de 18 a 28 de março.
2026-03-17Capítulo 10 — Multimodal: para além do texto
Décimo post do passeio capítulo a capítulo pelo LLM Primer I. Como o mesmo transformer passou a aceitar imagem e áudio — vision transformer e tokenização de áudio — e os limites honestos por trás da ideia de "um modelo que vê tudo".
2026-02-27Capítulo 7 — Engenharia de prompt como ofício de campo
Sétimo post do passeio capítulo a capítulo pelo LLM Primer I. Os quatro padrões de prompt que carregam o peso real — system prompt, few-shot, cadeia de pensamento, papel — e por que cada um funciona, à luz do mecanismo de próximo token.
2026-02-24Capítulo 6 — Segurança, alinhamento, e o que "ser útil" realmente significa
Sexto post do passeio capítulo a capítulo pelo LLM Primer I. Por que fluência e utilidade são coisas diferentes, o que o alinhamento realmente refina, e uma prévia do §6.6 novo na edição 2026 — IA Constitucional, modelos de debate, e o que há de mais recente em pesquisa de alinhamento.
2026-02-23Capítulo 5 — Ainda há pequenos defeitos
Quinto post do passeio capítulo a capítulo pelo LLM Primer I. Por que alucinação, lacunas temporais, problemas de cálculo e oscilações de consistência não são bugs, mas características do mesmo mecanismo de previsão de próximo token.
2026-02-22Capítulo 4 — Como o modelo aprende
Quarto post do passeio capítulo a capítulo pelo LLM Primer I. Por que o pré-treinamento define o teto da capacidade, por que o fine-tuning esculpe a personalidade, e como o RLHF transforma um previsor de tokens no assistente em que confiamos todo dia.
2026-02-21A Série LLM Primer — Um guia de campo para a IA generativa, escrito um volume por vez
A série LLM Primer — um guia de campo de sete volumes completo sobre IA generativa por Sho Shimoda. Dos fundamentos à segurança. Inclui Physical AI como volume companheiro. Todos os 7 volumes disponíveis na Amazon.
2026-02-15