LLM介绍
本页面为AI爱好者提供从基础到应用的大型语言模型(LLM)指南。
第 14 章 — Token 经济学与 API 定价
LLM Primer VI 章节走读第 14 篇。为什么输出比输入贵 4–8 倍。输入输出混合决定优化杠杆的方向。上下文累积和看不见的 reasoning token 是账单上最贵的两个隐藏项。
2026-05-06第 13 章 — 自动扩缩与冷启动缓解
LLM Primer VI 章节走读第 13 篇。默认 HPA 在 LLM 流量上会造成故障 —— 按队列深度、TTFT、KV 占用扩缩,并用 CRIU 温存快照把冷启动压到 3–6 秒。
2026-05-05第 7 章 — 进阶 Batching 策略
LLM Primer VI 章节走读第 7 篇。Batching 不是一项优化,是让带宽受限 decoding 变得经济可行的那个决定性动作。从静态 batching 到 continuous batching,再到 chunked prefill —— 以及后者留给 KV cache 的债务。
2026-04-29第 3 章 — 面向生成式 AI 的数据中心 GPU
LLM Primer VI 章节走读第 3 篇。挑一块 serving GPU,该看的是 HBM 带宽和 VRAM 容量,而不是数据表正面那个 FLOP/s 数字。这一章走 H100、H200、B200、L40S、MI300X 这五款主流硅片。
2026-04-25LLM Primer VI — 系列导读与目录
《LLM Primer VI: Scaling AI Systems》章节走读的第一篇。这一卷把 LLM 推理当成一门工程学科:内存带宽、调度、每一美元的账单,在同一块芯片上撞在一起。十六章分成六个部分,一层层走过硬件、模型压缩、运行时、平台和经济学。
2026-04-22第 8 章 — 性能、部署与成本优化
LLM Primer V 章节走读第 8 篇。把生产 LLM 的经济学当分层学科来做:最便宜的调用是那次没发生的调用,再往下每一层都是让下一次调用变便宜的那一层。语义缓存、动态路由、推理服务器内部的 PagedAttention、连续批处理、推测解码。
2026-04-21第 5 章 — LLM 应用的评估
LLM Primer V 章节走读第 5 篇。承认 assertEqual 在 LLM 输出上已经死掉,再围绕锚点法官、RAG 三角、智能体轨迹测试,把测试纪律重新搭起来 —— 把随机输出变成能守得住的通过/不通过信号。
2026-04-18LLM Primer V — 系列导读与索引
LLM Primer V 章节走读的系列导读。这一卷把 AI 工程当作一门独立的工程学科来讲,而不是一套 prompt 技巧;八个章节按栈的方式排列 —— 基础模型、prompt、检索、智能体、评估、可观测性、安全、以及部署经济学 —— 一层一层填出包在概率核心外面的确定性外壳。
2026-04-13第 11 章 — 攻击面与协议漏洞
LLM Primer IV 章节走读第 11 篇。被改造到 MCP 上的几个经典攻击 — Confused Deputy、Token Passthrough、Session Hijacking — 围绕能力升级和未认证 sampling 的协议级缺陷,以及让上下文投毒变成结构性问题而不是卫生问题的隐式信任传播。
2026-04-09第 6 章 — 基础编排策略
LLM Primer IV 章节走读第 6 篇。两种基础编排形状 — 顺序流水线和并发 scatter-gather — 以及每个团队都该先问的那个上游问题:多 agent 系统真的是这件事的答案吗?
2026-04-04第 5 章 — 传输协议与发现
LLM Primer IV 章节走读第 5 篇。MCP 支持的三种传输,.well-known 这一层发现机制加 Server Card,以及那些无聊的运维问题 — CORS、Origin 校验、缓存 — 决定一个 server 是合作型网络公民还是负债。
2026-04-03第 11 章 — 持续更新与流水线优化
LLM Primer III 章节走读最末一篇。流水线没有「做完」这件事 — 文档在变、查询在漂、模型在换 — 负它的团队学着在三种时间尺度上同时思考。结尾接到第四本 — MCP。
2026-03-28第 8 章 — RAG 管线里的数据匿名化
LLM Primer III 章节走读第八篇。数据是该在模型看见之前匿名化、还是在用户看见输出之前?答案改写整条流水线的样子 — 而监管框架通常会替你做出答案。
2026-03-25第 5 章 — 搭一条检索流水线
LLM Primer III 章节走读第五篇。一次向量搜索是大多数 demo 停下的地方,也是大多数生产故障开始的地方。本章一路走到生成器手里那一组候选,以及每一步存在的理由。
2026-03-22第10章 — 后训练与对齐的数学
LLM Primer II 章节走读第十篇。后训练那一整套机器 — 监督微调、奖励模型、RLHF 上的 KL 缰绳,以及 DPO 那个把整条流水线塌成一条监督损失的漂亮推导。
2026-03-12第 3 章 — 文本在模型里是怎么流动的
LLM Primer I 章节走读第三篇。token 进了模型之后到底经历了什么 — 嵌入、注意力、Transformer — 不被矩阵淹没,也不丢精度。
2026-02-20第 1 章 — 所以,大语言模型究竟是什么?
LLM Primer I 章节走读第一篇。"大"、"语言"和"模型"这三个词到底分别意味着什么、从规则系统到神经网络我们是怎么一步步走过来的,以及三个值得尽早摆脱的误解。
2026-02-18