LLM Primer V — 系列导读与索引
《LLM Primer V: Building Real-World LLM Applications》 的章节走读 —— 这一卷把 AI 工程当作一门独立的工程学科来讲,而不是一套 prompt 技巧。
这一系列为什么存在
做应用型 AI 工作会反复看到同一种模式:团队用一个周末做出 demo,demo 惊艳到人,pilot 通过审批,六个月之后 pilot 卡在团队公开叫做 “hardening”、私下叫做 “模型老是干我们没想到的事” 那一段。模型本身什么都没变。变的是工作已经走出那个 “挑几十个精心准备的输入就能得到看着合理的输出” 的区域,进入了另一个区域 —— 成千上万的真实用户、对抗性内容、成本压力、延迟预算,都在这里定规则。第五卷讲的就是活在这第二个区域里的那门学科。它不是一本讲怎么训练模型的书,也不是一本 prompt 技巧集。它讲的是把一个模型变成一个业务能运营的系统所需要的那门工程。
写给谁看
写给已经把原型跑通、现在被要求把它撑住的应用工程师。写给正在决定一个新的 LLM 功能是否值得那份运营负担的技术负责人。写给想搞清楚工程师究竟在延迟、成本、质量之间怎么权衡的 AI 团队产品经理。本书假定读者用过 LLM API,也翻过某个框架的文档,知道 prompt 模板是什么;它不假定读者有 ML 研究背景 —— 生产环境里真正起作用的机制是工程机制,本书就在这个语域里讲。
怎么读
章节是按栈的方式排下来的。第 1 章立框架 —— 包在概率核心外面的那层确定性外壳 —— 后面每一章都是这层外壳的一块。第 2 到第 4 章依次走模型、检索、智能体;第 5、6 章加上评估和可观测性这两条让系统能安全演进的轨道;第 7、8 章以安全和部署经济学收尾。整本书可以顺着读,也可以直接跳到当前系统正在暴露的那种故障对应的章节。每一章的走读文章都会把三个核心想法蒸馏出来,再指向原书对应的位置。
八章走读
走读一天一篇,一章一篇。
- 4 月 14 日 — 第 1 章 — AI 工程这门学科。demo 到生产之间那道可靠性鸿沟,以及把它合上的五根柱子。
- 4 月 15 日 — 第 2 章 — 基础模型与 prompt 工程。模型分级、采样参数、防御性 prompt、结构化输出 —— 都作为工程可操作的面来处理。
- 4 月 16 日 — 第 3 章 — 检索增强生成。RAG 管道从头到尾:切分、混合检索、query 变换、多模态、text-to-SQL。
- 4 月 17 日 — 第 4 章 — AI 智能体与工具调用。ReAct 循环、把工具 schema 当合同,以及智能体真正需要的三层记忆。
- 4 月 18 日 — 第 5 章 — LLM 应用的评估。LLM-as-judge、RAG 三角、以及针对智能体的轨迹测试。
- 4 月 19 日 — 第 6 章 — AI 可观测性与追踪。OpenTelemetry GenAI 约定、真正重要的那几个指标,以及回到评估的那条闭环。
- 4 月 20 日 — 第 7 章 — LLM 安全与护栏。OWASP LLM Top 10、直接与间接注入的分类,以及四层缓解矩阵。
- 4 月 21 日 — 第 8 章 — 性能、部署与成本优化。语义缓存、动态路由,以及推理服务器内部真正在发生的事。
关于本书与系列
LLM Primer 是一套七卷的系列,把语言模型当工程而不是当魔法来讲。第五卷是其中第五本。整套书的写法是克制、以机制为先的:每一章先点出它要合上的那种故障模式,再走那条把故障合上的机制,然后展示这个机制活在哪段代码里。书里没有 “拥抱 AI” 的号召 —— 默认读者已经决定要做,书讲的是怎么把它做好。后面两卷分别更深入地讲扩展(第六卷)以及受监管部署下更棘手的安全与治理问题(第七卷)。