LLM介绍
本页面为AI爱好者提供从基础到应用的大型语言模型(LLM)指南。
第 15 章 — 构建一个安全的 AI 组织
LLM Primer VII 章节走读第 15 篇。这一章把安全文化、红队、供应商风险和长期管理,当作那份跨年承载这门学科的组织基础设施。
2026-05-24第 9 章 — 模型完整性与供应链风险
LLM Primer VII 章节走读第 9 篇。这一章把模型 artefact 当作由第三方分发的二进制来对待 —— 带着二进制分发一直带着的反序列化、后门和出处问题。
2026-05-18第 5 章 — 输入验证与输出过滤
LLM Primer VII 章节走读第 5 篇。这一章把第 4 章的分层缓解框架变成操作纪律 —— 清洗阶段、护栏工具、结构化输出、红队,以及说得清楚的安全指标。
2026-05-14第 4 章 — Prompt Injection 与 Jailbreak
LLM Primer VII 章节走读第 4 篇。位于 LLM 安全实操问题正中央的这一章 —— 解释为什么 prompt injection 没有一个类似参数化查询那样的结构性修复,只有分层的、部分的防御。
2026-05-13第 1 章 — 为什么 AI 安全和以往不同
LLM Primer VII 章节走读第 1 篇。这一章要论证的是:AI 安全不是给传统安全前面加一个 ML 形容词 —— 底座变了,后面每一章都是这个变化的直接推论。
2026-05-10第 16 章 — 生产环境的降本策略
LLM Primer VI 章节走读收官篇。六个正交动作 —— 路由、压缩、批量、缓存、prompt 审计、输出预算 —— 复利叠加到只剩上个月账单的 20%,而用户什么都不会察觉。
2026-05-08第 14 章 — Token 经济学与 API 定价
LLM Primer VI 章节走读第 14 篇。为什么输出比输入贵 4–8 倍。输入输出混合决定优化杠杆的方向。上下文累积和看不见的 reasoning token 是账单上最贵的两个隐藏项。
2026-05-06第 13 章 — 自动扩缩与冷启动缓解
LLM Primer VI 章节走读第 13 篇。默认 HPA 在 LLM 流量上会造成故障 —— 按队列深度、TTFT、KV 占用扩缩,并用 CRIU 温存快照把冷启动压到 3–6 秒。
2026-05-05第 11 章 — 平台与编排层
LLM Primer VI 章节走读第 11 篇。平台的选择不是关于功能,而是关于哪一种运营模型贴合团队的 ops 文化。Ray Serve、KServe、BentoML、Triton —— 四种 CRD、Python actor、Bento、模型仓库,分别匹配不同的 ops grain。
2026-05-03第 7 章 — 进阶 Batching 策略
LLM Primer VI 章节走读第 7 篇。Batching 不是一项优化,是让带宽受限 decoding 变得经济可行的那个决定性动作。从静态 batching 到 continuous batching,再到 chunked prefill —— 以及后者留给 KV cache 的债务。
2026-04-29第 6 章 — 剪枝与知识蒸馏
LLM Primer VI 章节走读第 6 篇。剪枝直接砍掉参与相乘的权重数量;蒸馏把大教师的行为迁到更小的学生上。Hopper 上的 2:4 稀疏、KL 蒸馏、MiniLLM 的反向 KL,以及三种压缩叠加的顺序。
2026-04-28第 5 章 — 拆解量化
LLM Primer VI 章节走读第 5 篇。为什么 70B 模型能扛得住 4-bit 量化,而 1B 模型不能。AWQ、GPTQ、SmoothQuant、GGUF 各自在做什么,以及那份能上生产的校准纪律。
2026-04-27第 3 章 — 面向生成式 AI 的数据中心 GPU
LLM Primer VI 章节走读第 3 篇。挑一块 serving GPU,该看的是 HBM 带宽和 VRAM 容量,而不是数据表正面那个 FLOP/s 数字。这一章走 H100、H200、B200、L40S、MI300X 这五款主流硅片。
2026-04-25第 2 章 — KV Cache 的挑战
LLM Primer VI 章节走读第 2 篇。KV cache 是 serving 系统里最大的显存消费者。这一章走那道决定它大小的公式、MHA/GQA/MQA 三种架构选择,以及那道毁掉并发的碎片化问题。
2026-04-24第 8 章 — 性能、部署与成本优化
LLM Primer V 章节走读第 8 篇。把生产 LLM 的经济学当分层学科来做:最便宜的调用是那次没发生的调用,再往下每一层都是让下一次调用变便宜的那一层。语义缓存、动态路由、推理服务器内部的 PagedAttention、连续批处理、推测解码。
2026-04-21第 6 章 — AI 可观测性与追踪
LLM Primer V 章节走读第 6 篇。把一次用户 query 当作一棵因果树,不是一条请求日志,再展示要让这棵树可读需要追踪什么:分布式追踪加 GenAI 语义约定,再加上 TTFT、TPOT、成本、质量这几个指标,以及把生产 trace 送回评估集的导出管道。
2026-04-19第 2 章 — 基础模型与 prompt 工程
LLM Primer V 章节走读第 2 篇。把 prompt 工程当工程来做:版本化的模板、防御性分隔符、结构化输出,而不是靠感觉打分的手艺。模型选型、采样参数、prompt 剖面、结构化输出 —— 这四个控制面要么被主动操作,要么就接受后果。
2026-04-15第 1 章 — AI 工程这门学科
LLM Primer V 章节走读第 1 篇。demo 到生产之间那道可靠性鸿沟不是模型问题,而是工程问题 —— 而这份工程有自己的名字:围绕概率式核心构建一层确定性外壳,再把可靠性、质量、性能、成本、演进这五根柱子一根根立起来。
2026-04-14第 10 章 — 长时任务记忆
LLM Primer IV 章节走读第 10 篇。通过窗口和 ReAct scratchpad 的短期记忆,通过情景向量和语义存储的长期记忆,以及让 agent 跨小时跨天保持产出的压缩技巧。
2026-04-08第 2 章 — 揭开 Model Context Protocol(MCP)
LLM Primer IV 章节走读第 2 篇。MCP 到底标准化了什么,Host、Client、Server 三个角色的分工,动态发现和双向消息为什么在那些真正重要的场景里跟 REST 不一样,以及从能力协商开始的会话生命周期。
2026-03-31第 11 章 — 持续更新与流水线优化
LLM Primer III 章节走读最末一篇。流水线没有「做完」这件事 — 文档在变、查询在漂、模型在换 — 负它的团队学着在三种时间尺度上同时思考。结尾接到第四本 — MCP。
2026-03-28第 9 章 — RAG 评测三件套
LLM Primer III 章节走读第九篇。三种不同的故障塌成同一种症状 — 这个领域为此发明了一只三头的度量,终于告诉团队:那个症状对的是哪一种故障。
2026-03-26第 8 章 — RAG 管线里的数据匿名化
LLM Primer III 章节走读第八篇。数据是该在模型看见之前匿名化、还是在用户看见输出之前?答案改写整条流水线的样子 — 而监管框架通常会替你做出答案。
2026-03-25第 5 章 — 搭一条检索流水线
LLM Primer III 章节走读第五篇。一次向量搜索是大多数 demo 停下的地方,也是大多数生产故障开始的地方。本章一路走到生成器手里那一组候选,以及每一步存在的理由。
2026-03-22第 2 章 — 智能文档解析
LLM Primer III 章节走读第二篇。检索系统会继承它输入的质量 — 而那个让 RAG 质量平庸的最常见原因,就悄悄住在输入层。PDF 不是文本文件、版面感知解析器把哪些信号放回来,以及让模型直接读页面图像的那一路多模态。
2026-03-19第11章 — 评估、校准与推理
LLM Primer II 章节走读第十一篇。怎么去衡量一个什么都能说的机器 — 困惑度、校准、benchmark 上那条少有人写的误差线,以及"测量幻觉"那件事的数学。
2026-03-13第 11 章 — 更小的模型,更聪明的模型
LLM Primer I 章节走读第十一篇。怎么把大模型压成在真实运营里能跑起来的尺寸 — 蒸馏、量化、MoE — 以及 2026 版新加的 §11.6,专门讲推理模型。
2026-02-28第 10 章 — 多模态:走出文本
LLM Primer I 章节走读第十篇。同一个 Transformer 是怎么学会接收图像和音频的 — vision transformer 和音频 token 化 — 以及"一个模型什么都能看"这种说法老老实实的边界在哪。
2026-02-27