LLM介绍
本页面为AI爱好者提供从基础到应用的大型语言模型(LLM)指南。
第 7 章 — 幻觉与可靠性
LLM Primer VII 章节走读第 7 篇。这一章把可靠性作为安全性质来处理 —— 因为在结果依赖于正确性的时候,一份自信的错误输出就是一个安全问题。
2026-05-16第 12 章 — 拆分部署与 Kubernetes
LLM Primer VI 章节走读第 12 篇。把 prefill 和 decode 拆到不同 GPU 池,让每一池按自己的工作负载调优。LeaderWorkerSet、Grove PodCliqueSet、KAI Scheduler —— 表达这次拆分的 Kubernetes 原语。
2026-05-04第 9 章 — 投机解码
LLM Primer VI 章节走读第 9 篇。原来自回归的顺序瓶颈里藏着一个数学漏洞:先猜再验。EAGLE、Medusa、Lookahead、MTP —— 以及投机什么时候真的划算的那道算术。
2026-05-01第 8 章 — 新一代 KV Cache 管理
LLM Primer VI 章节走读第 8 篇。把 KV cache 当成分页虚拟内存来管理:小 block、page table、引用计数共享 —— continuous batching 那道内存债就还得起。PagedAttention、H2O、InfiniGen、前缀缓存。
2026-04-30第 6 章 — 剪枝与知识蒸馏
LLM Primer VI 章节走读第 6 篇。剪枝直接砍掉参与相乘的权重数量;蒸馏把大教师的行为迁到更小的学生上。Hopper 上的 2:4 稀疏、KL 蒸馏、MiniLLM 的反向 KL,以及三种压缩叠加的顺序。
2026-04-28第 5 章 — 拆解量化
LLM Primer VI 章节走读第 5 篇。为什么 70B 模型能扛得住 4-bit 量化,而 1B 模型不能。AWQ、GPTQ、SmoothQuant、GGUF 各自在做什么,以及那份能上生产的校准纪律。
2026-04-27第 2 章 — KV Cache 的挑战
LLM Primer VI 章节走读第 2 篇。KV cache 是 serving 系统里最大的显存消费者。这一章走那道决定它大小的公式、MHA/GQA/MQA 三种架构选择,以及那道毁掉并发的碎片化问题。
2026-04-24第 9 章 — 管理注意力预算
LLM Primer IV 章节走读第 9 篇。Context rot、lost-in-the-middle 这一道悬崖、tool-loadout rot,以及对 "模型缺的那一份知识到底该放在哪一层" 的三个架构答案 — MCP、RAG、微调。
2026-04-07第 8 章 — 架构部署形态
LLM Primer IV 章节走读第 8 篇。MCP 生态里浮现出来的三种部署形态 — 可复用 agent、严格纯净、混合 — 以及决定哪一种适合哪个项目的四条约束。
2026-04-06LLM Primer IV — 系列导读与目录
本文开启 LLM Primer 系列第四卷《用 MCP 设计 AI 认知》的章节走读。为什么智能体要靠一层协议才能从 demo 走到生产,这本书写给谁,以及 3 月 30 日到 4 月 12 日 14 篇连载的时间表。
2026-03-29第 3 章 — 文本在模型里是怎么流动的
LLM Primer I 章节走读第三篇。token 进了模型之后到底经历了什么 — 嵌入、注意力、Transformer — 不被矩阵淹没,也不丢精度。
2026-02-20LLM Primer 系列 — 一卷一卷读懂生成式 AI 的实战指南
LLM Primer 系列 — 下田昌平(Sho Shimoda)撰写的七卷本生成式 AI 现场指南,现已完结。从基础到安全。含姊妹卷《Physical AI》。全 7 卷均在 Amazon 上架销售。
2026-02-15
大规模语言模型(LLM)全面指南:原理、应用与训练方法
深入探索大规模语言模型(LLM)的世界。本指南涵盖LLM的定义、在自然语言处理(NLP)中的作用、训练方法以及文本生成、翻译、问答系统和代码生成等实际应用。适合希望利用LLM开发创新解决方案的工程师与开发者。
2024-09-01