Introdução ao LLM

Esta página oferece um guia sobre LLMs (Modelos de Linguagem em Grande Escala) desde os conceitos básicos até as aplicações, para entusiastas de IA.


Total de 17 artigos disponíveis. | Atualmente na página 1 de 1.

Capítulo 7 — Alucinações e Confiabilidade

Confiabilidade como propriedade de segurança — porque uma saída confidentemente errada é problema de segurança sempre que consequências dependem de correção.

2026-05-16

Capítulo 15 — APIs Serverless vs Infraestrutura Dedicada

A matemática do ponto de equilíbrio entre API por token e GPU dedicada, o item de engenharia de plataforma que decide a conta e por que a postura híbrida é a resposta realista.

2026-05-07

Capítulo 13 — Autoscaling e Mitigação de Cold Start

Por que o HPA padrão do Kubernetes derruba deployments de LLM sob picos de tráfego, e como KEDA, Knative e CRIU se combinam para consertar o problema.

2026-05-05

Capítulo 12 — Serving Desagregado e Kubernetes

Como separar prefill e decodificação em pools de GPU distintos, transportar a KV cache pelo fabric e expressar a topologia em Kubernetes.

2026-05-04

Capítulo 8 — Gerenciamento de KV Cache de Próxima Geração

PagedAttention traz a paginação do sistema operacional para o motor de inferência; H2O e InfiniGen adicionam evicção; o prefix caching serve milhões de requisições agênticas em uma dúzia de GPUs.

2026-04-30

Capítulo 2 — O Desafio do KV Cache

A fórmula que governa o tamanho do KV cache, os trade-offs entre MHA, GQA e MQA, e por que a alocação ingênua desperdiça a maior parte do orçamento de VRAM.

2026-04-24

LLM Primer VI — Introdução da Série e Índice

Introdução e índice do passeio capítulo a capítulo por LLM Primer VI: Escalando Sistemas de IA — dezesseis capítulos sobre inferência LLM tratada como disciplina de engenharia.

2026-04-22

Capítulo 8 — Otimizando Performance, Serving e Custo

Post final do passeio pelo LLM Primer V. Cache semântico, roteamento dinâmico e as otimizações dentro do servidor de inferência que fecham o volume — do que nunca é chamado ao que quase não custa.

2026-04-21

Capítulo 7 — Segurança e Guardrails de LLM

Sétimo post do passeio pelo LLM Primer V. Injeção direta versus indireta, a matriz de mitigação em quatro camadas e o princípio de que autoridade tem de casar com origem de confiança.

2026-04-20

Capítulo 6 — Observabilidade e Tracing de IA

Sexto post do passeio pelo LLM Primer V. Do log de requisição para o trace causal aninhado, as métricas que importam para sistemas LLM, e o pipeline de export que fecha o loop com avaliação.

2026-04-19

Capítulo 14 — Benchmarking, Testes e Desempenho

Décima quarta e última postagem do passeio pelo LLM Primer IV. O MCP-Universe Benchmark em servidores reais, os dois modos de falha sistêmicos que ele expôs, o gap de dez vezes de throughput entre sessão-por-requisição e pools de sessão compartilhados, e a ponte para o Volume V.

2026-04-12

Capítulo 9 — Gerenciando o Orçamento de Atenção

Nona postagem do passeio pelo LLM Primer IV. Context rot, o precipício de lost-in-the-middle, tool-loadout rot, e as três respostas arquiteturais — MCP, RAG, fine-tuning — para a pergunta de onde o conhecimento ausente de um modelo de fato pertence.

2026-04-07

Capítulo 8 — Layouts Arquiteturais de Deployment

Oitava postagem do passeio pelo LLM Primer IV. Os três layouts de deployment que emergiram no ecossistema MCP — agente reutilizável, pureza estrita, híbrido — e as quatro restrições determinantes que decidem qual encaixa em qual projeto.

2026-04-06

LLM Primer IV — Introdução à Série e Índice

Abrindo o passeio capítulo a capítulo pelo Livro IV da série LLM Primer — Projetando a Cognição da IA com MCP. Por que agentes precisam de uma camada de protocolo para escalar além do demoware, para quem este livro foi escrito, e o cronograma das quatorze postagens que se seguem, de 30 de março a 12 de abril.

2026-03-29

Capítulo 3 — Como o texto flui dentro do modelo

Terceiro post do passeio capítulo a capítulo pelo LLM Primer I. Como o token muda de forma dentro do modelo — embeddings, atenção, transformer — sem cair em matrizes nem perder precisão.

2026-02-20

A Série LLM Primer — Um guia de campo para a IA generativa, escrito um volume por vez

A série LLM Primer — um guia de campo de sete volumes completo sobre IA generativa por Sho Shimoda. Dos fundamentos à segurança. Inclui Physical AI como volume companheiro. Todos os 7 volumes disponíveis na Amazon.

2026-02-15

Introdução aos Grandes Modelos de Linguagem (LLMs) - Guia Completo para Engenheiros

Explore os fundamentos dos Grandes Modelos de Linguagem (LLMs), incluindo o treinamento, as aplicações e os desafios. Um guia completo para engenheiros que querem entender o impacto dos LLMs no aprendizado de máquina e no processamento de linguagem natural.

2024-09-01