Introduction aux LLM

Cette page fournit un guide facile à comprendre sur les LLM (grands modèles de langage) des bases aux applications pour les passionnés d'IA.

Total de 46 articles disponibles. | Actuellement à la page 1 de 1.

Chapitre 8 — Attaques adverses contre les modèles

De FGSM à TextFooler puis aux suffixes universels ; attaques boîte-noire contre les API et vol de modèle — la dette de recherche derrière l'injection de prompt.

2026-05-17

Chapitre 5 — Validation des entrées et filtrage des sorties

Étapes d'assainissement, prompting structuré, Llama Guard, red teaming avec Garak et PyRIT, et métriques de sécurité honnêtes qui survivent au trafic réel.

2026-05-14

Chapitre 3 — Sécurité des données et vie privée

Corpus d'entraînement, mémorisation et extraction, incidents Samsung et Garante, et la discipline de chiffrement, d'isolation et de rétention que les LLM exigent.

2026-05-12

Chapitre 2 — Modélisation des menaces pour les systèmes LLM

Les quatre questions de Shostack, STRIDE et PASTA contre les actifs LLM, MITRE ATLAS pour les adversaires — et le modèle de menace opérationnel dont chaque chapitre suivant se réclame.

2026-05-11

Chapitre 16 — Stratégies de réduction des coûts en production

Billet final du LLM Primer VI. Routage, compaction, API batch, cache sémantique — le catalogue de mouvements indépendants qui composent en 80 pour cent de réduction de facture.

2026-05-08

Chapitre 15 — API serverless vs infrastructure dédiée

Quinzième billet du LLM Primer VI. Le calcul du seuil de rentabilité, la ligne d'ingénierie plateforme sous-estimée, et pourquoi la posture réaliste est presque toujours hybride.

2026-05-07

Chapitre 14 — Économie du token et tarification des API

Quatorzième billet du LLM Primer VI. Pourquoi la sortie coûte 4–8× l'entrée, comment l'accumulation de contexte grossit la facture, et pourquoi les tokens de raisonnement invisibles surprennent.

2026-05-06

Chapitre 13 — Autoscaling et atténuation du démarrage à froid

Treizième billet du LLM Primer VI. Pourquoi le HPA par défaut produit des pannes sous trafic LLM, et comment KEDA, Knative et CRIU composent des démarrages à froid en secondes.

2026-05-05

Chapitre 12 — Service désagrégé et Kubernetes

Douzième billet du LLM Primer VI. Séparer préremplissage et décodage sur des pools GPU distincts, transporter le cache KV, et exprimer la topologie par LeaderWorkerSet, Grove et KAI.

2026-05-04

Chapitre 11 — La couche plateforme et orchestration

Onzième billet du LLM Primer VI. Ray Serve, KServe, BentoML, Triton — le choix de plateforme comme adéquation avec la culture d'exploitation plutôt que comparatif de fonctionnalités.

2026-05-03

Chapitre 10 — La couche moteur LLM

Dixième billet du LLM Primer VI. La frontière entre moteur et plateforme, et les cinq moteurs — vLLM, TensorRT-LLM, SGLang, TGI, Ollama — qui dominent cette couche en 2026.

2026-05-02

Chapitre 8 — Gestion nouvelle génération du cache KV

Huitième billet du LLM Primer VI. PagedAttention comme mémoire virtuelle pour le cache KV, les évictions H2O/InfiniGen, et le cache de préfixe comme levier de coût le plus rentable.

2026-04-30

Chapitre 7 — Stratégies de batching avancées

Septième billet du LLM Primer VI. Pourquoi le batching n'est pas une optimisation mais le mouvement porteur du décodage — et pourquoi le batch est un verbe et non un nom.

2026-04-29

Chapitre 6 — Élagage et distillation des connaissances

Sixième billet du LLM Primer VI. La sparsité 2:4 accélérée par Hopper, la distillation qui transfère la distribution du professeur, et l'ordre dans lequel les trois compressions se composent.

2026-04-28

Chapitre 4 — Silicium spécialisé et ASIC pour l'IA

Quatrième billet du LLM Primer VI. Groq LPU, AWS Inferentia2, TPU v5p/v6 et Intel Gaudi 3 — où les ASIC gagnent, où ils perdent, et comment la forme de la charge tranche.

2026-04-26

Chapitre 3 — GPU de centre de données pour l'IA générative

Troisième billet du LLM Primer VI. H100, H200, B200, L40S, MI300X — lus comme des profils de bande passante et de VRAM plutôt que par le chiffre de FLOP/s sur la fiche.

2026-04-25

Chapitre 2 — Le défi du cache KV

Deuxième billet du LLM Primer VI. La formule mémoire du cache KV, les arbitrages MHA/GQA/MQA, et pourquoi l'allocation naïve détruit la concurrence avant que le calcul ne devienne le goulot.

2026-04-24

Chapitre 1 — La mécanique de la génération de tokens

Premier billet de la tournée du LLM Primer VI. La boucle autoregressive, le contraste préremplissage/décodage, et pourquoi un utilisateur seul laisse un H100 inactif à 99,7 pour cent.

2026-04-23

LLM Primer VI — Introduction de la série & index

Introduction à la tournée chapitre par chapitre du LLM Primer VI : Mettre à l'échelle les systèmes IA. L'inférence LLM traitée comme une discipline d'ingénierie où bande passante mémoire, ordonnancement et lignes de facture se rencontrent.

2026-04-22

Chapitre 8 — Optimiser performance, service et coût

Dernier billet de la tournée du LLM Primer V. Le chapitre qui traite l'économie LLM de production comme une discipline en couches — l'appel le moins cher est celui qui n'a jamais lieu, et chaque couche en dessous est celle qui rend l'appel suivant bon marché.

2026-04-21

Chapitre 7 — Sécurité et garde-fous LLM

Septième billet de la tournée du LLM Primer V. Le chapitre qui nomme le nouvel axe de sécurité introduit par les applications LLM — contrôler quelles instructions atteignent le modèle, d'où, avec quelle autorité — et construit la matrice de mitigation autour de lui.

2026-04-20

Chapitre 4 — Agents IA et appel d'outils

Quatrième billet de la tournée du LLM Primer V. Le chapitre qui traite un agent comme un modèle de langage bouclé sur des outils dont les schémas, les couches de mémoire et le câblage multi-agents doivent être conçus avant de confier la boucle à quoi que ce soit de réel.

2026-04-17

Chapitre 3 — Génération augmentée par la récupération

Troisième billet de la tournée du LLM Primer V. Le chapitre qui parcourt le pipeline RAG de bout en bout et sépare la démo qui marche sur vos dix documents favoris du système qui survit au contact de votre corpus réel.

2026-04-16

Chapitre 1 — La discipline de l'ingénierie IA

Premier billet de la tournée du LLM Primer V. L'écart de fiabilité entre la démo et la production, l'enveloppe déterministe autour du cœur probabiliste, et les cinq piliers — fiabilité, qualité, performance, coût, évolution — qui font la discipline.

2026-04-14

LLM Primer V — Introduction de la série et sommaire

Une tournée chapitre par chapitre de LLM Primer V — le volume qui traite l'ingénierie IA comme une discipline à part entière et parcourt les huit surfaces où cette discipline vit : modèles de base, prompts, récupération, agents, évaluations, observabilité, sécurité et service.

2026-04-13

Chapitre 14 — Benchmarking, tests et performance

Quinzième et dernier billet de la tournée du LLM Primer IV. Le MCP-Universe Benchmark sur de vrais serveurs, les deux modes de défaillance systémiques qu'il a exposés, l'écart de débit dix-pour-un entre session-par-requête et pools de sessions partagées, et le pont vers le Volume V.

2026-04-12

Chapitre 13 — Frameworks et intégration cloud

Treizième billet de la tournée du LLM Primer IV. Strands avec Bedrock, le patron de couche d'état AWS, le Microsoft Agent Framework, LangChain, Semantic Kernel — et les trois formes d'intégration de production sur lesquelles les équipes convergent indépendamment.

2026-04-11

Chapitre 10 — Mémoire de tâche à long horizon

Dixième billet de la tournée du LLM Primer IV. Mémoire à court terme par fenêtres et scratchpads ReAct, mémoire à long terme par vecteurs épisodiques et stores sémantiques, et les techniques de compaction qui maintiennent un agent productif sur des heures et des jours.

2026-04-08

Chapitre 9 — Gérer le budget d'attention

Neuvième billet de la tournée du LLM Primer IV. Context rot, la falaise du « lost-in-the-middle », tool-loadout rot, et les trois réponses architecturales — MCP, RAG, affinage — à la question de savoir où la connaissance manquante du modèle appartient vraiment.

2026-04-07

Chapitre 8 — Topologies de déploiement architecturales

Huitième billet de la tournée du LLM Primer IV. Les trois topologies de déploiement qui ont émergé dans l'écosystème MCP — agent réutilisable, pureté stricte, hybride — et les quatre contraintes contraignantes qui décident laquelle convient à quel projet.

2026-04-06

Chapitre 5 — Protocoles de transport et découverte

Cinquième billet de la tournée du LLM Primer IV. Les trois transports que MCP soutient, la couche de découverte .well-known avec les Server Cards, et les soucis opérationnels ennuyeux — CORS, validation d'origine, mise en cache — qui décident si un serveur est un citoyen réseau coopératif ou une responsabilité.

2026-04-03

Chapitre 4 — Primitives du client : comportements agentiques et contrôle

Quatrième billet de la tournée du LLM Primer IV. Sampling, Roots et Elicitation sont les trois petits trous contrôlés que MCP perce dans le mur entre l'hôte et le serveur — chacun une capacité concédée en retour, chacun un risque accepté au nom de l'utilisateur.

2026-04-02

Chapitre 3 — Primitives du serveur : exposer le contexte et les capacités

Troisième billet de la tournée du LLM Primer IV. Les trois noms qu'un serveur MCP peut offrir — Ressources (lecture d'état), Prompts (échafaudage réutilisable), Outils (actions d'écriture) — leurs schémas, leurs cycles de vie, leurs modèles d'erreur, et la discipline de choisir la bonne primitive.

2026-04-01

Chapitre 1 — La crise d'intégration de l'IA et l'essor de l'architecture agentique

Premier billet de la tournée du LLM Primer IV. Pourquoi les agents monolithiques s'effilochent à mesure que les prompts système grossissent, le problème d'intégration N fois M qui se cache en dessous, et le passage de l'ingénierie de prompt à l'ingénierie de contexte que MCP a été conçu pour rendre possible.

2026-03-30

LLM Primer IV — Introduction de la série et index

Lancement de la tournée chapitre par chapitre du Livre IV de la série LLM Primer — Concevoir la cognition de l'IA avec MCP. Pourquoi les agents ont besoin d'une couche protocolaire pour dépasser le stade de la démo, à qui ce livre s'adresse, et le calendrier des quatorze billets qui suivent, du 30 mars au 12 avril.

2026-03-29

Chapitre 11 — Mises à jour continues et optimisation du pipeline

Onzième et dernier billet de la tournée du LLM Primer III. CDC et indexation incrémentale gardent le corpus frais, cache sémantique et tiering de modèles maintiennent la latence basse, et une boucle de feedback en quatre étapes ferme l'écart entre ce que la production dit à l'équipe et ce que l'équipe change effectivement — plus un pont vers le Volume IV sur le Model Context Protocol.

2026-03-28

Chapitre 10 — Les frameworks d'évaluation de référence

Dixième billet de la tournée du LLM Primer III. Un guide de terrain des frameworks qui transforment la triade d'évaluation en quelque chose qu'une équipe peut faire tourner — RAGAS, TruLens, DeepEval d'un côté, Braintrust, LangSmith, Phoenix, Galileo, Opik de l'autre, et l'écart d'évaluation qu'aucun d'eux n'a encore comblé.

2026-03-27

Chapitre 7 — Implémenter le contrôle d'accès

Septième billet de la tournée du LLM Primer III. ACL au niveau document comme fondation, RBAC avec les étiquettes de sensibilité Microsoft Purview, ReBAC avec Zanzibar et SpiceDB, et la discipline pré-filtre contre post-filtre qui tourne sous tous.

2026-03-24

Chapitre 3 — Frameworks avancés de découpage

Troisième billet de la tournée du LLM Primer III. Le spectre du découpage du taille fixe au structurel, le mythe du recouvrement, la falaise de contexte qui détruit la recherche silencieusement, et les techniques de recherche contextuelle et de découpage tardif qui ont redessiné la frontière.

2026-03-20

Chapitre 2 — L'analyse intelligente de documents

Deuxième billet de la tournée du LLM Primer III. Pourquoi un PDF n'est pas un fichier texte, ce que les parseurs sensibles à la mise en page préservent réellement, le paysage actuel des outils (LlamaParse, Docling, Unstructured, Marker-PDF, Firecrawl, DeepSeek-OCR), et la piste multimodale qui retrouve directement sur les images de pages.

2026-03-19

LLM Primer III — Améliorer l'IA d'entreprise avec RAG : présentation de la série et sommaire

Lancement de la tournée chapitre par chapitre du Livre III de la série LLM Primer — Améliorer l'IA d'entreprise avec RAG. Pourquoi la génération augmentée par la recherche semble simple vue de l'extérieur et constitue, en réalité, un empilement de disciplines, à qui ce livre s'adresse, et le calendrier des onze billets qui suivent, du 18 au 28 mars.

2026-03-17

Chapitre 8 — Utiliser les LLM dans les applications : chatbots, code, extraction et agents

Chapitre 8 de la série LLM Primer I. Les motifs d'application qui sortent vraiment en production — chatbots, résumé, assistants de code, extraction structurée et la montée des systèmes agentiques où le modèle pilote une boucle d'utilisation d'outils. Plus les benchmarks que chaque ingénieur devrait reconnaître par leur nom.

2026-02-25

Chapitre 7 — Au-delà de la prédiction du prochain token : embeddings, recherche et multimodalité

Chapitre 7 de la série LLM Primer I. Les capacités qui transforment un prédicteur du prochain token en bien plus — embeddings, recherche sémantique, retrieval-augmented generation et la transition vers les entrées multimodales. Comment RAG garde réellement un LLM ancré dans de vrais documents au lieu d'inventer.

2026-02-24

Chapitre 6 — Affinage et adaptation : du modèle brut à l'assistant utile

Chapitre 6 de la série LLM Primer I. La pile complète d'adaptation — du pilotage bon marché basé sur les prompts à l'affinage efficace en paramètres jusqu'à l'alignement complet avec RLHF et ses successeurs modernes comme DPO. Pourquoi le post-entraînement est désormais là où se différencient vraiment les API de modèles fermés.

2026-02-23

Une tournée chapitre par chapitre de LLM Primer I — Introduction à la série et index

Introduction et index de la tournée en douze parties chapitre par chapitre de LLM Primer I : Comment fonctionne l'IA générative. Un billet par jour, du 18 février au 1er mars 2026. Lisez-les dans l'ordre ou choisissez le chapitre qui vous intéresse le plus. Tous les douze sont listés et liés ici.

2026-02-17

La Série LLM Primer — Un guide de terrain de l'IA générative, construit volume après volume

La série LLM Primer — un guide de terrain en sept volumes désormais complet sur l'IA générative par Sho Shimoda. Des fondamentaux à la sécurité. Comprend Physical AI comme volume compagnon. Les 7 volumes disponibles sur Amazon.

2026-02-15