Introdução ao LLM

Esta página oferece um guia sobre LLMs (Modelos de Linguagem em Grande Escala) desde os conceitos básicos até as aplicações, para entusiastas de IA.


Total de 39 artigos disponíveis. | Atualmente na página 1 de 1.

Capítulo 12 — Controle de Acesso e Identidade

Quem pode invocar quais capacidades de uma aplicação integrada a LLM, com o adicional de que o modelo, ao agir por ferramentas, também é principal cuja permissão precisa ser escopada.

2026-05-21

Capítulo 10 — Projetando Arquiteturas LLM Seguras

A arquitetura como disciplina primária de segurança — porque a configuração mais segura de um componente probabilístico é aquela cujo raio de destruição é limitado por estrutura, não pela contenção do próprio componente.

2026-05-19

Capítulo 9 — Integridade de Modelo e Riscos da Cadeia de Suprimentos

Um artefato de modelo é um binário distribuído por terceiros — com as preocupações de desserialização, backdoor e proveniência que a distribuição de binários sempre carregou.

2026-05-18

Capítulo 8 — Ataques Adversariais a Modelos

De Goodfellow 2014 a TextFooler e sufixos universais até roubo de modelo em APIs de produção — a tradição de pesquisa por trás do prompt injection.

2026-05-17

Capítulo 6 — Riscos da Geração Aumentada por Recuperação

O corpus de recuperação como canal de entrada não confiável — cada documento indexado é, do ponto de vista do modelo, uma instrução em pé de igualdade com a pergunta do usuário.

2026-05-15

Capítulo 4 — Prompt Injection e Jailbreaks

Por que prompt injection não tem correção estrutural análoga às consultas parametrizadas, e como a arquitetura de mitigação em quatro camadas do resto da Parte II se estrutura.

2026-05-13

Capítulo 1 — Por Que a Segurança de IA É Diferente

Por que a segurança de IA não é segurança tradicional com um adjetivo de ML; o substrato mudou, a superfície de ataque se ampliou e os modelos estão se tornando infraestrutura.

2026-05-10

Capítulo 16 — Estratégias de Corte de Custo em Produção

Roteamento de modelos, compactação de contexto, batch APIs e cache semântico — os movimentos ortogonais que se compõem em uma redução de 80 por cento sem mudar o que o usuário vê.

2026-05-08

Capítulo 15 — APIs Serverless vs Infraestrutura Dedicada

A matemática do ponto de equilíbrio entre API por token e GPU dedicada, o item de engenharia de plataforma que decide a conta e por que a postura híbrida é a resposta realista.

2026-05-07

Capítulo 14 — Economia de Tokens e Precificação de APIs

Por que o token é a unidade de cobrança, por que o output custa de quatro a oito vezes o input, e como tokens de reasoning invisíveis acabam na fatura.

2026-05-06

Capítulo 13 — Autoscaling e Mitigação de Cold Start

Por que o HPA padrão do Kubernetes derruba deployments de LLM sob picos de tráfego, e como KEDA, Knative e CRIU se combinam para consertar o problema.

2026-05-05

Capítulo 11 — A Camada de Plataforma e Orquestração

Ray Serve, KServe, BentoML e Triton — como as quatro plataformas de orquestração de LLM se dividem por afinidade com a cultura de ops do time.

2026-05-03

Capítulo 6 — Poda e Destilação de Conhecimento

A poda zera pesos que não importam e a destilação transfere o comportamento do professor para um aluno menor — juntas com a quantização, compõem uma redução de 20 vezes nos bytes por token.

2026-04-28

Capítulo 5 — Desmistificando a Quantização

Por que um modelo de 70B sobrevive à quantização de 4 bits enquanto um de 1B não sobrevive — e como escolher a receita entre AWQ, GPTQ, SmoothQuant e GGUF.

2026-04-27

Capítulo 4 — Silício de IA Especializado e ASICs

Groq, Inferentia2, TPU e Gaudi 3 — onde ASICs vencem GPUs em latência ou custo por token, e onde os retos de kernel e variedade de modelos ainda pertencem à NVIDIA.

2026-04-26

Capítulo 2 — O Desafio do KV Cache

A fórmula que governa o tamanho do KV cache, os trade-offs entre MHA, GQA e MQA, e por que a alocação ingênua desperdiça a maior parte do orçamento de VRAM.

2026-04-24

Capítulo 1 — A Mecânica da Geração de Tokens

Por que o loop autoregressivo é sequencial por matemática, como prefill e decoding estressam o chip de formas opostas e por que um único usuário deixa uma H100 99,7 por cento ociosa.

2026-04-23

LLM Primer VI — Introdução da Série e Índice

Introdução e índice do passeio capítulo a capítulo por LLM Primer VI: Escalando Sistemas de IA — dezesseis capítulos sobre inferência LLM tratada como disciplina de engenharia.

2026-04-22

Capítulo 3 — Geração Aumentada por Recuperação

Terceiro post do passeio pelo LLM Primer V. O pipeline RAG de cinco estágios de ponta a ponta, por que o chunking é onde vive ou morre a qualidade, e as transformações de consulta que separam a demo do deployment.

2026-04-16

Capítulo 1 — A Disciplina da Engenharia de IA

Primeiro post do passeio pelo LLM Primer V. Por que sua demo funciona e seu sistema de produção não é um problema de engenharia, não de modelo — e os cinco pilares que o fecham.

2026-04-14

LLM Primer V — Introdução da Série e Índice

Primeiro post do passeio pelo LLM Primer V. Por que o padrão demo-para-produção quebra, o wrapper determinístico ao redor do núcleo probabilístico, e as oito superfícies onde vive a disciplina da engenharia de IA.

2026-04-13

Capítulo 14 — Benchmarking, Testes e Desempenho

Décima quarta e última postagem do passeio pelo LLM Primer IV. O MCP-Universe Benchmark em servidores reais, os dois modos de falha sistêmicos que ele expôs, o gap de dez vezes de throughput entre sessão-por-requisição e pools de sessão compartilhados, e a ponte para o Volume V.

2026-04-12

Capítulo 7 — Padrões Avançados Colaborativos e Dinâmicos

Sétima postagem do passeio pelo LLM Primer IV. Consenso roundtable, roteamento por handoff, e orquestração magentic — os padrões que emergem quando a topologia precisa ser construída por requisição, com os modos de falha (não-terminação, mis-routing, planejamento desbocado) que os padrões mais simples evitam.

2026-04-05

Capítulo 2 — Revelando o Model Context Protocol (MCP)

Segunda postagem do passeio pelo LLM Primer IV. O que o MCP de fato padroniza, a divisão em três papéis entre Host, Cliente e Servidor, por que descoberta dinâmica e mensageria bidirecional diferem de REST nos casos que importam, e o ciclo de vida de sessão que abre com negociação de capacidades.

2026-03-31

Capítulo 1 — A Crise de Integração de IA e a Ascensão da Arquitetura Agêntica

Primeira postagem do passeio pelo LLM Primer IV. Por que agentes monolíticos se esfarrapam conforme prompts de sistema crescem, o problema de integração N vezes M escondido por baixo, e o movimento de engenharia de prompt para engenharia de contexto que o MCP foi feito para habilitar.

2026-03-30

LLM Primer IV — Introdução à Série e Índice

Abrindo o passeio capítulo a capítulo pelo Livro IV da série LLM Primer — Projetando a Cognição da IA com MCP. Por que agentes precisam de uma camada de protocolo para escalar além do demoware, para quem este livro foi escrito, e o cronograma das quatorze postagens que se seguem, de 30 de março a 12 de abril.

2026-03-29

Capítulo 9 — A Tríade de Avaliação de RAG

Nono post do passeio pelo LLM Primer III. Um sistema RAG pode falhar em três lugares distintos e por fora as falhas parecem iguais — a Tríade de Avaliação de Relevância de Contexto, Fidelidade e Relevância da Resposta é o pequeno vocabulário que impede consertar um bug enquanto se mede outro.

2026-03-26

Capítulo 7 — Implementando Controle de Acesso

Sétimo post do passeio pelo LLM Primer III. ACLs em nível de documento como fundação, RBAC com rótulos de sensibilidade do Microsoft Purview, ReBAC com Zanzibar e SpiceDB, e a disciplina de pré-filtro versus pós-filtro que corre por baixo de todos eles.

2026-03-24

Capítulo 6 — Modelos de Ameaça e Vulnerabilidades em RAG

Sexto post do passeio pelo LLM Primer III. A superfície expandida de ataque da recuperação — envenenamento de corpus, chunks adversariais, injection indireta de prompt, inversão de embedding e o problema do deputado confuso em RAG agêntico. Ataques concretos, cada um demonstrado, cada um reprodutível.

2026-03-23

Capítulo 5 — Arquitetando o Pipeline de Recuperação

Quinto post do passeio pelo LLM Primer III. Por que uma única busca vetorial não é um pipeline — recuperação híbrida, reciprocal rank fusion, reranking com cross-encoder, e rewriting e HyDE do lado da query — montados na arquitetura de produção para a qual sistemas RAG maduros convergem.

2026-03-22

Capítulo 2 — Parsing Inteligente de Documentos

Segundo post do passeio pelo LLM Primer III. Por que um PDF não é um arquivo de texto, o que os parsers conscientes de layout de fato preservam, o panorama atual de ferramentas (LlamaParse, Docling, Unstructured, Marker-PDF, Firecrawl, DeepSeek-OCR), e a trilha multimodal que recupera direto sobre imagens de página.

2026-03-19

Capítulo 1 — A Evolução da Arquitetura RAG

Primeiro post do passeio pelo LLM Primer III. As quatro posturas arquiteturais de RAG — Naive, Avançada, Modular, Agêntica — lidas como uma história de entregar mais agência ao LLM uma decisão por vez, e a resposta honesta para quando fine-tuning é a ferramenta melhor do que recuperação.

2026-03-18

LLM Primer III — Introdução da Série e Índice

Abertura do passeio capítulo a capítulo pelo Livro III da série LLM Primer — Aprimorando a IA Empresarial com RAG. Por que a geração aumentada por recuperação parece simples por fora e é uma pilha de disciplinas por dentro, para quem este livro foi escrito, e o cronograma dos onze posts que seguem, de 18 a 28 de março.

2026-03-17

Capítulo 10 — Multimodal: para além do texto

Décimo post do passeio capítulo a capítulo pelo LLM Primer I. Como o mesmo transformer passou a aceitar imagem e áudio — vision transformer e tokenização de áudio — e os limites honestos por trás da ideia de "um modelo que vê tudo".

2026-02-27

Capítulo 7 — Engenharia de prompt como ofício de campo

Sétimo post do passeio capítulo a capítulo pelo LLM Primer I. Os quatro padrões de prompt que carregam o peso real — system prompt, few-shot, cadeia de pensamento, papel — e por que cada um funciona, à luz do mecanismo de próximo token.

2026-02-24

Capítulo 6 — Segurança, alinhamento, e o que "ser útil" realmente significa

Sexto post do passeio capítulo a capítulo pelo LLM Primer I. Por que fluência e utilidade são coisas diferentes, o que o alinhamento realmente refina, e uma prévia do §6.6 novo na edição 2026 — IA Constitucional, modelos de debate, e o que há de mais recente em pesquisa de alinhamento.

2026-02-23

Capítulo 5 — Ainda há pequenos defeitos

Quinto post do passeio capítulo a capítulo pelo LLM Primer I. Por que alucinação, lacunas temporais, problemas de cálculo e oscilações de consistência não são bugs, mas características do mesmo mecanismo de previsão de próximo token.

2026-02-22

Capítulo 4 — Como o modelo aprende

Quarto post do passeio capítulo a capítulo pelo LLM Primer I. Por que o pré-treinamento define o teto da capacidade, por que o fine-tuning esculpe a personalidade, e como o RLHF transforma um previsor de tokens no assistente em que confiamos todo dia.

2026-02-21

A Série LLM Primer — Um guia de campo para a IA generativa, escrito um volume por vez

A série LLM Primer — um guia de campo de sete volumes completo sobre IA generativa por Sho Shimoda. Dos fundamentos à segurança. Inclui Physical AI como volume companheiro. Todos os 7 volumes disponíveis na Amazon.

2026-02-15