LLM Primer V — Introduction de la série et sommaire
Une tournée chapitre par chapitre de LLM Primer V : Construire des applications LLM réelles — le volume qui traite l'ingénierie IA comme une discipline à part entière, non comme un tour de passe-passe sur le prompt.
Pourquoi cette série existe
Il y a un schéma récurrent dans le travail d'IA appliquée : une équipe monte une démo en un week-end, la démo éblouit, un pilote est approuvé, et six mois plus tard le pilote est bloqué dans la phase que l'équipe appelle « le durcissement » et que l'on nomme, en privé, « la partie où le modèle continue à faire des choses que nous n'attendions pas ». Rien n'a changé côté modèle. Ce qui a changé, c'est que le travail est sorti de la zone où une poignée d'entrées choisies produit des sorties plausibles, et est entré dans la zone où des milliers d'utilisateurs réels, du contenu adversarial, des lignes de coût et des budgets de latence dictent les règles. Le Volume V porte sur la discipline qui vit dans cette seconde zone. Ce n'est pas un livre sur l'entraînement des modèles, et ce n'est pas un recueil d'astuces de prompt. C'est un livre sur l'ingénierie qui transforme un modèle en un système qu'une entreprise peut exploiter.
À qui ce livre s'adresse
Aux ingénieurs applicatifs qui ont livré un prototype fonctionnel et à qui l'on demande maintenant de le maintenir en état. Aux tech leads qui décident si une nouvelle fonctionnalité LLM vaut la charge opérationnelle qu'elle implique. Aux chefs de produit d'équipes IA qui veulent comprendre ce que leurs ingénieurs arbitrent entre latence, coût et qualité. Le livre suppose que vous avez utilisé une API LLM et lu assez de documentation d'un framework pour savoir ce qu'est un gabarit de prompt. Il ne suppose aucun bagage particulier en recherche ML ; la mécanique qui compte en production est une mécanique d'ingénierie, et le livre reste dans ce registre.
Comment le lire
Les chapitres sont ordonnés comme une pile. Le Chapitre 1 pose le cadre — l'enveloppe déterministe autour du cœur probabiliste — et le reste du livre remplit les couches de cette enveloppe. Les Chapitres 2 à 4 parcourent tour à tour le modèle, la récupération et les agents ; les Chapitres 5 et 6 ajoutent les rails d'évaluation et d'observabilité qui laissent le système évoluer sans casse ; les Chapitres 7 et 8 ferment avec la sécurité et l'économie du service. Vous pouvez lire le livre d'un trait, ou sauter directement au chapitre qui correspond au mode de défaillance que votre système présente en ce moment. Chaque article de la tournée distille trois idées clés et pointe vers le matériau d'origine.
La tournée en huit chapitres
La tournée publie un article par chapitre, chaque jour.
- 14 avril — Chapitre 1 — La discipline de l'ingénierie IA. L'écart de fiabilité entre la démo et la production, et les cinq piliers qui le comblent.
- 15 avril — Chapitre 2 — Modèles de base et ingénierie de prompt. Le tri par palier de modèle, les paramètres d'échantillonnage, les prompts défensifs et les sorties structurées comme surfaces d'ingénierie.
- 16 avril — Chapitre 3 — Génération augmentée par la récupération. Le pipeline RAG de bout en bout : découpage, récupération hybride, transformation de requête, multimodal et texte-vers-SQL.
- 17 avril — Chapitre 4 — Agents IA et appel d'outils. Les boucles ReAct, les schémas d'outil comme contrats, et les trois couches de mémoire dont un agent a réellement besoin.
- 18 avril — Chapitre 5 — Évaluer les applications LLM. Le LLM-juge, le Triangle RAG et les tests de trajectoire pour les agents.
- 19 avril — Chapitre 6 — Observabilité et traçage de l'IA. Les conventions GenAI d'OpenTelemetry, les métriques qui comptent et la boucle qui remonte vers les évaluations.
- 20 avril — Chapitre 7 — Sécurité et garde-fous LLM. Le Top 10 OWASP, la distinction injection directe / indirecte, et la matrice de mitigation à quatre couches.
- 21 avril — Chapitre 8 — Optimiser performance, service et coût. Le cache sémantique, le routage dynamique et ce qui se passe réellement à l'intérieur du serveur d'inférence.
À propos de ce livre et de la série
Le LLM Primer est une série en sept volumes qui traite les modèles de langage comme de l'ingénierie plutôt que comme de la magie. Le Volume V en est la cinquième entrée. Le style maison est sobre et centré sur les mécanismes : chaque chapitre nomme le mode de défaillance qu'il ferme, parcourt le mécanisme qui le ferme et montre le code où ce mécanisme vit. Il n'y a pas d'exhortation à embrasser l'IA. Le lecteur est supposé avoir déjà tranché cette question ; le livre porte sur la manière de bien le faire. Les volumes suivants iront plus loin sur la mise à l'échelle (VI) et sur les questions de sécurité et de gouvernance plus dures que soulèvent les déploiements régulés (VII).