Introdução ao LLM

Esta página oferece um guia sobre LLMs (Modelos de Linguagem em Grande Escala) desde os conceitos básicos até as aplicações, para entusiastas de IA.


Total de 46 artigos disponíveis. | Atualmente na página 1 de 1.

Capítulo 15 — Construindo uma Organização de IA Segura

Cultura de segurança, red teams, risco de fornecedor e stewardship como a infraestrutura organizacional que carrega a disciplina ao longo dos anos.

2026-05-24

Capítulo 14 — Viés, Justiça e IA Responsável

IA responsável como disciplina de escolhas sob incerteza — onde ferramentas técnicas expõem trade-offs sem os resolver.

2026-05-23

Capítulo 11 — Observabilidade, Logging e Resposta a Incidentes

Logging, alerting e resposta a incidentes como a camada que transforma defesas arquiteturais em sistema que operadores conseguem de fato rodar.

2026-05-20

Capítulo 10 — Projetando Arquiteturas LLM Seguras

A arquitetura como disciplina primária de segurança — porque a configuração mais segura de um componente probabilístico é aquela cujo raio de destruição é limitado por estrutura, não pela contenção do próprio componente.

2026-05-19

Capítulo 8 — Ataques Adversariais a Modelos

De Goodfellow 2014 a TextFooler e sufixos universais até roubo de modelo em APIs de produção — a tradição de pesquisa por trás do prompt injection.

2026-05-17

Capítulo 7 — Alucinações e Confiabilidade

Confiabilidade como propriedade de segurança — porque uma saída confidentemente errada é problema de segurança sempre que consequências dependem de correção.

2026-05-16

Capítulo 6 — Riscos da Geração Aumentada por Recuperação

O corpus de recuperação como canal de entrada não confiável — cada documento indexado é, do ponto de vista do modelo, uma instrução em pé de igualdade com a pergunta do usuário.

2026-05-15

Capítulo 4 — Prompt Injection e Jailbreaks

Por que prompt injection não tem correção estrutural análoga às consultas parametrizadas, e como a arquitetura de mitigação em quatro camadas do resto da Parte II se estrutura.

2026-05-13

Capítulo 3 — Segurança de Dados e Privacidade

Dado como ativo com ciclo de vida — de corpora de treinamento parcialmente memorizados a entradas de usuário que engenheiros da Samsung colaram no ChatGPT antes de o incidente ter nome.

2026-05-12

Capítulo 1 — Por Que a Segurança de IA É Diferente

Por que a segurança de IA não é segurança tradicional com um adjetivo de ML; o substrato mudou, a superfície de ataque se ampliou e os modelos estão se tornando infraestrutura.

2026-05-10

Capítulo 16 — Estratégias de Corte de Custo em Produção

Roteamento de modelos, compactação de contexto, batch APIs e cache semântico — os movimentos ortogonais que se compõem em uma redução de 80 por cento sem mudar o que o usuário vê.

2026-05-08

Capítulo 14 — Economia de Tokens e Precificação de APIs

Por que o token é a unidade de cobrança, por que o output custa de quatro a oito vezes o input, e como tokens de reasoning invisíveis acabam na fatura.

2026-05-06

Capítulo 13 — Autoscaling e Mitigação de Cold Start

Por que o HPA padrão do Kubernetes derruba deployments de LLM sob picos de tráfego, e como KEDA, Knative e CRIU se combinam para consertar o problema.

2026-05-05

Capítulo 12 — Serving Desagregado e Kubernetes

Como separar prefill e decodificação em pools de GPU distintos, transportar a KV cache pelo fabric e expressar a topologia em Kubernetes.

2026-05-04

Capítulo 11 — A Camada de Plataforma e Orquestração

Ray Serve, KServe, BentoML e Triton — como as quatro plataformas de orquestração de LLM se dividem por afinidade com a cultura de ops do time.

2026-05-03

Capítulo 9 — Decodificação Especulativa

Como a decodificação especulativa contorna o gargalo sequencial da autorregressão, quais mecanismos de rascunho funcionam e a aritmética que decide quando o ganho compensa.

2026-05-01

Capítulo 5 — Desmistificando a Quantização

Por que um modelo de 70B sobrevive à quantização de 4 bits enquanto um de 1B não sobrevive — e como escolher a receita entre AWQ, GPTQ, SmoothQuant e GGUF.

2026-04-27

Capítulo 4 — Silício de IA Especializado e ASICs

Groq, Inferentia2, TPU e Gaudi 3 — onde ASICs vencem GPUs em latência ou custo por token, e onde os retos de kernel e variedade de modelos ainda pertencem à NVIDIA.

2026-04-26

Capítulo 3 — GPUs de Data Center para IA Generativa

Como ler o catálogo de GPUs de data center — H100, H200, B200, L40S, MI300X — pela lente de banda de HBM e capacidade de VRAM, não pelos FLOPs de manchete.

2026-04-25

Capítulo 1 — A Mecânica da Geração de Tokens

Por que o loop autoregressivo é sequencial por matemática, como prefill e decoding estressam o chip de formas opostas e por que um único usuário deixa uma H100 99,7 por cento ociosa.

2026-04-23

LLM Primer VI — Introdução da Série e Índice

Introdução e índice do passeio capítulo a capítulo por LLM Primer VI: Escalando Sistemas de IA — dezesseis capítulos sobre inferência LLM tratada como disciplina de engenharia.

2026-04-22

Capítulo 5 — Avaliando Aplicações LLM

Quinto post do passeio pelo LLM Primer V. Rubricas ancoradas de LLM-como-juiz, a Tríade RAG e testes de trajetória de agente — a disciplina que substitui assertEqual em sistemas LLM.

2026-04-18

Capítulo 4 — Agentes de IA e Tool Calling

Quarto post do passeio pelo LLM Primer V. O loop ReAct, os schemas de ferramenta como contratos e as três camadas de memória que transformam uma demo plausível num ator de produção.

2026-04-17

Capítulo 2 — Modelos de Fundação e Engenharia de Prompt

Segundo post do passeio pelo LLM Primer V. Seleção de modelo como decisão de engenharia de primeira classe, perfis de amostragem deliberados, prompts defensivos e saídas estruturadas como superfícies operáveis.

2026-04-15

Capítulo 4 — Primitivas de Cliente: Comportamentos Agênticos e Controle

Quarta postagem do passeio pelo LLM Primer IV. Sampling, Roots e Elicitation são os três pequenos buracos controlados que o MCP abre na parede host-servidor — cada um uma capacidade concedida de volta, cada um um risco aceito em nome do usuário.

2026-04-02

Capítulo 3 — Primitivas de Servidor: Expondo Contexto e Capacidades

Terceira postagem do passeio pelo LLM Primer IV. Os três substantivos que um servidor MCP pode oferecer — Resources (estado de leitura), Prompts (andaime reutilizável), Tools (ações de escrita) — seus schemas, seus ciclos de vida, seus modelos de erro, e a disciplina de escolher a primitiva certa.

2026-04-01

Capítulo 7 — Implementando Controle de Acesso

Sétimo post do passeio pelo LLM Primer III. ACLs em nível de documento como fundação, RBAC com rótulos de sensibilidade do Microsoft Purview, ReBAC com Zanzibar e SpiceDB, e a disciplina de pré-filtro versus pós-filtro que corre por baixo de todos eles.

2026-03-24

Capítulo 6 — Modelos de Ameaça e Vulnerabilidades em RAG

Sexto post do passeio pelo LLM Primer III. A superfície expandida de ataque da recuperação — envenenamento de corpus, chunks adversariais, injection indireta de prompt, inversão de embedding e o problema do deputado confuso em RAG agêntico. Ataques concretos, cada um demonstrado, cada um reprodutível.

2026-03-23

Capítulo 1 — A Evolução da Arquitetura RAG

Primeiro post do passeio pelo LLM Primer III. As quatro posturas arquiteturais de RAG — Naive, Avançada, Modular, Agêntica — lidas como uma história de entregar mais agência ao LLM uma decisão por vez, e a resposta honesta para quando fine-tuning é a ferramenta melhor do que recuperação.

2026-03-18

Capítulo 11 — Avaliação, Calibração e Inferência

Décimo primeiro post do passeio capítulo a capítulo pelo LLM Primer II. Como medir uma máquina que pode dizer qualquer coisa — perplexidade, calibração, barras de erro de benchmark e geometria da recuperação para conter alucinação.

2026-03-13

Capítulo 10 — Matemática do Pós-Treinamento e Alinhamento

Décimo post do passeio capítulo a capítulo pelo LLM Primer II. Como um previsor de próximo token brilhante e feral é civilizado em assistente útil — SFT, modelo de recompensa, RLHF na coleira do KL, e a derivação elegante do DPO que colapsa o pipeline inteiro em uma única perda supervisionada.

2026-03-12

Capítulo 12 — Construir um sistema LLM, e o que vem depois

Último post do passeio capítulo a capítulo pelo LLM Primer I. Modelo, ferramentas, RAG, avaliação e guarda-fios costurados em um sistema só — e a ponte do Livro 1 para os Livros 2 a 7 da série.

2026-03-01

Capítulo 11 — Modelos menores, modelos mais espertos

Décimo primeiro post do passeio capítulo a capítulo pelo LLM Primer I. Como reduzir modelos grandes para caber em operações reais — destilação, quantização, MoE — e o §11.6 novo da edição 2026, sobre modelos de raciocínio.

2026-02-28

Capítulo 10 — Multimodal: para além do texto

Décimo post do passeio capítulo a capítulo pelo LLM Primer I. Como o mesmo transformer passou a aceitar imagem e áudio — vision transformer e tokenização de áudio — e os limites honestos por trás da ideia de "um modelo que vê tudo".

2026-02-27

Capítulo 9 — RAG: costurando informação fresca no contexto

Nono post do passeio capítulo a capítulo pelo LLM Primer I. O que RAG (Retrieval-Augmented Generation) realmente faz, como apoia a lacuna temporal e a exatidão do modelo, e onde começa a diferença entre um RAG bom e um ruim.

2026-02-26

Capítulo 8 — Quando um modelo não basta: ferramentas e agentes

Oitavo post do passeio capítulo a capítulo pelo LLM Primer I. O terreno onde o modelo ganha braços — uso de ferramentas, chamada de função, agentes — e o §8.6 novo da edição 2026 com padrões agentivos como ReAct, planejador-executor e reflexão.

2026-02-25

Capítulo 7 — Engenharia de prompt como ofício de campo

Sétimo post do passeio capítulo a capítulo pelo LLM Primer I. Os quatro padrões de prompt que carregam o peso real — system prompt, few-shot, cadeia de pensamento, papel — e por que cada um funciona, à luz do mecanismo de próximo token.

2026-02-24

Capítulo 6 — Segurança, alinhamento, e o que "ser útil" realmente significa

Sexto post do passeio capítulo a capítulo pelo LLM Primer I. Por que fluência e utilidade são coisas diferentes, o que o alinhamento realmente refina, e uma prévia do §6.6 novo na edição 2026 — IA Constitucional, modelos de debate, e o que há de mais recente em pesquisa de alinhamento.

2026-02-23

Capítulo 5 — Ainda há pequenos defeitos

Quinto post do passeio capítulo a capítulo pelo LLM Primer I. Por que alucinação, lacunas temporais, problemas de cálculo e oscilações de consistência não são bugs, mas características do mesmo mecanismo de previsão de próximo token.

2026-02-22

Capítulo 4 — Como o modelo aprende

Quarto post do passeio capítulo a capítulo pelo LLM Primer I. Por que o pré-treinamento define o teto da capacidade, por que o fine-tuning esculpe a personalidade, e como o RLHF transforma um previsor de tokens no assistente em que confiamos todo dia.

2026-02-21

Capítulo 3 — Como o texto flui dentro do modelo

Terceiro post do passeio capítulo a capítulo pelo LLM Primer I. Como o token muda de forma dentro do modelo — embeddings, atenção, transformer — sem cair em matrizes nem perder precisão.

2026-02-20

Capítulo 2 — Probabilidade, tokens e texto

Segundo post do passeio capítulo a capítulo pelo LLM Primer I. Como tokens diferem de palavras, o que é a distribuição de probabilidade que o modelo produz a cada passo, e como temperature e top-p mudam o caráter da saída.

2026-02-19

Capítulo 1 — O que é, afinal, um Grande Modelo de Linguagem?

Primeiro post do passeio capítulo a capítulo pelo LLM Primer I. O que "grande", "linguagem" e "modelo" realmente significam, como saímos dos sistemas baseados em regras até as redes neurais, e três mitos que vale a pena desfazer logo de cara.

2026-02-18

LLM Primer I — passeio capítulo a capítulo: introdução e índice

Introdução do passeio capítulo a capítulo pelo LLM Primer I. Como a série está organizada, o que cada capítulo entrega, e o índice dos doze posts que vêm a seguir entre 18 de fevereiro e 1º de março.

2026-02-17

A Série LLM Primer — Um guia de campo para a IA generativa, escrito um volume por vez

A série LLM Primer — um guia de campo de sete volumes completo sobre IA generativa por Sho Shimoda. Dos fundamentos à segurança. Inclui Physical AI como volume companheiro. Todos os 7 volumes disponíveis na Amazon.

2026-02-15

Introdução aos Grandes Modelos de Linguagem (LLMs) - Guia Completo para Engenheiros

Explore os fundamentos dos Grandes Modelos de Linguagem (LLMs), incluindo o treinamento, as aplicações e os desafios. Um guia completo para engenheiros que querem entender o impacto dos LLMs no aprendizado de máquina e no processamento de linguagem natural.

2024-09-01