LLM介绍

本页面为AI爱好者提供从基础到应用的大型语言模型(LLM)指南。


共有29篇文章。 | 当前在第1页,共1页。

第 15 章 — 构建一个安全的 AI 组织

LLM Primer VII 章节走读第 15 篇。这一章把安全文化、红队、供应商风险和长期管理,当作那份跨年承载这门学科的组织基础设施。

2026-05-24

第 9 章 — 模型完整性与供应链风险

LLM Primer VII 章节走读第 9 篇。这一章把模型 artefact 当作由第三方分发的二进制来对待 —— 带着二进制分发一直带着的反序列化、后门和出处问题。

2026-05-18

第 5 章 — 输入验证与输出过滤

LLM Primer VII 章节走读第 5 篇。这一章把第 4 章的分层缓解框架变成操作纪律 —— 清洗阶段、护栏工具、结构化输出、红队,以及说得清楚的安全指标。

2026-05-14

第 4 章 — Prompt Injection 与 Jailbreak

LLM Primer VII 章节走读第 4 篇。位于 LLM 安全实操问题正中央的这一章 —— 解释为什么 prompt injection 没有一个类似参数化查询那样的结构性修复,只有分层的、部分的防御。

2026-05-13

第 1 章 — 为什么 AI 安全和以往不同

LLM Primer VII 章节走读第 1 篇。这一章要论证的是:AI 安全不是给传统安全前面加一个 ML 形容词 —— 底座变了,后面每一章都是这个变化的直接推论。

2026-05-10

第 16 章 — 生产环境的降本策略

LLM Primer VI 章节走读收官篇。六个正交动作 —— 路由、压缩、批量、缓存、prompt 审计、输出预算 —— 复利叠加到只剩上个月账单的 20%,而用户什么都不会察觉。

2026-05-08

第 14 章 — Token 经济学与 API 定价

LLM Primer VI 章节走读第 14 篇。为什么输出比输入贵 4–8 倍。输入输出混合决定优化杠杆的方向。上下文累积和看不见的 reasoning token 是账单上最贵的两个隐藏项。

2026-05-06

第 13 章 — 自动扩缩与冷启动缓解

LLM Primer VI 章节走读第 13 篇。默认 HPA 在 LLM 流量上会造成故障 —— 按队列深度、TTFT、KV 占用扩缩,并用 CRIU 温存快照把冷启动压到 3–6 秒。

2026-05-05

第 11 章 — 平台与编排层

LLM Primer VI 章节走读第 11 篇。平台的选择不是关于功能,而是关于哪一种运营模型贴合团队的 ops 文化。Ray Serve、KServe、BentoML、Triton —— 四种 CRD、Python actor、Bento、模型仓库,分别匹配不同的 ops grain。

2026-05-03

第 7 章 — 进阶 Batching 策略

LLM Primer VI 章节走读第 7 篇。Batching 不是一项优化,是让带宽受限 decoding 变得经济可行的那个决定性动作。从静态 batching 到 continuous batching,再到 chunked prefill —— 以及后者留给 KV cache 的债务。

2026-04-29

第 6 章 — 剪枝与知识蒸馏

LLM Primer VI 章节走读第 6 篇。剪枝直接砍掉参与相乘的权重数量;蒸馏把大教师的行为迁到更小的学生上。Hopper 上的 2:4 稀疏、KL 蒸馏、MiniLLM 的反向 KL,以及三种压缩叠加的顺序。

2026-04-28

第 5 章 — 拆解量化

LLM Primer VI 章节走读第 5 篇。为什么 70B 模型能扛得住 4-bit 量化,而 1B 模型不能。AWQ、GPTQ、SmoothQuant、GGUF 各自在做什么,以及那份能上生产的校准纪律。

2026-04-27

第 3 章 — 面向生成式 AI 的数据中心 GPU

LLM Primer VI 章节走读第 3 篇。挑一块 serving GPU,该看的是 HBM 带宽和 VRAM 容量,而不是数据表正面那个 FLOP/s 数字。这一章走 H100、H200、B200、L40S、MI300X 这五款主流硅片。

2026-04-25

第 2 章 — KV Cache 的挑战

LLM Primer VI 章节走读第 2 篇。KV cache 是 serving 系统里最大的显存消费者。这一章走那道决定它大小的公式、MHA/GQA/MQA 三种架构选择,以及那道毁掉并发的碎片化问题。

2026-04-24

第 8 章 — 性能、部署与成本优化

LLM Primer V 章节走读第 8 篇。把生产 LLM 的经济学当分层学科来做:最便宜的调用是那次没发生的调用,再往下每一层都是让下一次调用变便宜的那一层。语义缓存、动态路由、推理服务器内部的 PagedAttention、连续批处理、推测解码。

2026-04-21

第 6 章 — AI 可观测性与追踪

LLM Primer V 章节走读第 6 篇。把一次用户 query 当作一棵因果树,不是一条请求日志,再展示要让这棵树可读需要追踪什么:分布式追踪加 GenAI 语义约定,再加上 TTFT、TPOT、成本、质量这几个指标,以及把生产 trace 送回评估集的导出管道。

2026-04-19

第 2 章 — 基础模型与 prompt 工程

LLM Primer V 章节走读第 2 篇。把 prompt 工程当工程来做:版本化的模板、防御性分隔符、结构化输出,而不是靠感觉打分的手艺。模型选型、采样参数、prompt 剖面、结构化输出 —— 这四个控制面要么被主动操作,要么就接受后果。

2026-04-15

第 1 章 — AI 工程这门学科

LLM Primer V 章节走读第 1 篇。demo 到生产之间那道可靠性鸿沟不是模型问题,而是工程问题 —— 而这份工程有自己的名字:围绕概率式核心构建一层确定性外壳,再把可靠性、质量、性能、成本、演进这五根柱子一根根立起来。

2026-04-14

第 10 章 — 长时任务记忆

LLM Primer IV 章节走读第 10 篇。通过窗口和 ReAct scratchpad 的短期记忆,通过情景向量和语义存储的长期记忆,以及让 agent 跨小时跨天保持产出的压缩技巧。

2026-04-08

第 2 章 — 揭开 Model Context Protocol(MCP)

LLM Primer IV 章节走读第 2 篇。MCP 到底标准化了什么,Host、Client、Server 三个角色的分工,动态发现和双向消息为什么在那些真正重要的场景里跟 REST 不一样,以及从能力协商开始的会话生命周期。

2026-03-31

第 11 章 — 持续更新与流水线优化

LLM Primer III 章节走读最末一篇。流水线没有「做完」这件事 — 文档在变、查询在漂、模型在换 — 负它的团队学着在三种时间尺度上同时思考。结尾接到第四本 — MCP。

2026-03-28

第 9 章 — RAG 评测三件套

LLM Primer III 章节走读第九篇。三种不同的故障塌成同一种症状 — 这个领域为此发明了一只三头的度量,终于告诉团队:那个症状对的是哪一种故障。

2026-03-26

第 8 章 — RAG 管线里的数据匿名化

LLM Primer III 章节走读第八篇。数据是该在模型看见之前匿名化、还是在用户看见输出之前?答案改写整条流水线的样子 — 而监管框架通常会替你做出答案。

2026-03-25

第 5 章 — 搭一条检索流水线

LLM Primer III 章节走读第五篇。一次向量搜索是大多数 demo 停下的地方,也是大多数生产故障开始的地方。本章一路走到生成器手里那一组候选,以及每一步存在的理由。

2026-03-22

第 4 章 — 选对向量数据库

LLM Primer III 章节走读第四篇。RAG 系统里长得最快、上量后最贵、把团队锁得最死的那一层 — 用技术指标比着选,用运维条件决定。

2026-03-21

第 2 章 — 智能文档解析

LLM Primer III 章节走读第二篇。检索系统会继承它输入的质量 — 而那个让 RAG 质量平庸的最常见原因,就悄悄住在输入层。PDF 不是文本文件、版面感知解析器把哪些信号放回来,以及让模型直接读页面图像的那一路多模态。

2026-03-19

第11章 — 评估、校准与推理

LLM Primer II 章节走读第十一篇。怎么去衡量一个什么都能说的机器 — 困惑度、校准、benchmark 上那条少有人写的误差线,以及"测量幻觉"那件事的数学。

2026-03-13

第 11 章 — 更小的模型,更聪明的模型

LLM Primer I 章节走读第十一篇。怎么把大模型压成在真实运营里能跑起来的尺寸 — 蒸馏、量化、MoE — 以及 2026 版新加的 §11.6,专门讲推理模型。

2026-02-28

第 10 章 — 多模态:走出文本

LLM Primer I 章节走读第十篇。同一个 Transformer 是怎么学会接收图像和音频的 — vision transformer 和音频 token 化 — 以及"一个模型什么都能看"这种说法老老实实的边界在哪。

2026-02-27