LLM介绍

本页面为AI爱好者提供从基础到应用的大型语言模型(LLM)指南。


共有24篇文章。 | 当前在第1页,共1页。

第 9 章 — 模型完整性与供应链风险

LLM Primer VII 章节走读第 9 篇。这一章把模型 artefact 当作由第三方分发的二进制来对待 —— 带着二进制分发一直带着的反序列化、后门和出处问题。

2026-05-18

第 8 章 — 针对模型的对抗性攻击

LLM Primer VII 章节走读第 8 篇。这一章追溯对抗性攻击 —— 从 Goodfellow 2014 年的图像分类器工作,一路到 TextFooler、通用后缀,再到针对生产 API 的模型窃取。

2026-05-17

第 5 章 — 输入验证与输出过滤

LLM Primer VII 章节走读第 5 篇。这一章把第 4 章的分层缓解框架变成操作纪律 —— 清洗阶段、护栏工具、结构化输出、红队,以及说得清楚的安全指标。

2026-05-14

第 4 章 — Prompt Injection 与 Jailbreak

LLM Primer VII 章节走读第 4 篇。位于 LLM 安全实操问题正中央的这一章 —— 解释为什么 prompt injection 没有一个类似参数化查询那样的结构性修复,只有分层的、部分的防御。

2026-05-13

第 3 章 — 数据安全与隐私

LLM Primer VII 章节走读第 3 篇。这一章把数据当作一份有生命周期的资产来处理 —— 从被模型部分记住的训练语料,到 Samsung 工程师在这个事件还没被命名之前粘进 ChatGPT 的那些代码。

2026-05-12

第 1 章 — 为什么 AI 安全和以往不同

LLM Primer VII 章节走读第 1 篇。这一章要论证的是:AI 安全不是给传统安全前面加一个 ML 形容词 —— 底座变了,后面每一章都是这个变化的直接推论。

2026-05-10

第 15 章 — Serverless API 对比自建基础设施

LLM Primer VI 章节走读第 15 篇。GPU 租金分项决定 token 那道算术;平台工程分项决定这单交易。混合姿态几乎总是对的答案,应用边界那个路由器是承重的那一块。

2026-05-07

第 12 章 — 拆分部署与 Kubernetes

LLM Primer VI 章节走读第 12 篇。把 prefill 和 decode 拆到不同 GPU 池,让每一池按自己的工作负载调优。LeaderWorkerSet、Grove PodCliqueSet、KAI Scheduler —— 表达这次拆分的 Kubernetes 原语。

2026-05-04

第 11 章 — 平台与编排层

LLM Primer VI 章节走读第 11 篇。平台的选择不是关于功能,而是关于哪一种运营模型贴合团队的 ops 文化。Ray Serve、KServe、BentoML、Triton —— 四种 CRD、Python actor、Bento、模型仓库,分别匹配不同的 ops grain。

2026-05-03

第 8 章 — 新一代 KV Cache 管理

LLM Primer VI 章节走读第 8 篇。把 KV cache 当成分页虚拟内存来管理:小 block、page table、引用计数共享 —— continuous batching 那道内存债就还得起。PagedAttention、H2O、InfiniGen、前缀缓存。

2026-04-30

LLM Primer VI — 系列导读与目录

《LLM Primer VI: Scaling AI Systems》章节走读的第一篇。这一卷把 LLM 推理当成一门工程学科:内存带宽、调度、每一美元的账单,在同一块芯片上撞在一起。十六章分成六个部分,一层层走过硬件、模型压缩、运行时、平台和经济学。

2026-04-22

第 8 章 — 性能、部署与成本优化

LLM Primer V 章节走读第 8 篇。把生产 LLM 的经济学当分层学科来做:最便宜的调用是那次没发生的调用,再往下每一层都是让下一次调用变便宜的那一层。语义缓存、动态路由、推理服务器内部的 PagedAttention、连续批处理、推测解码。

2026-04-21

第 6 章 — AI 可观测性与追踪

LLM Primer V 章节走读第 6 篇。把一次用户 query 当作一棵因果树,不是一条请求日志,再展示要让这棵树可读需要追踪什么:分布式追踪加 GenAI 语义约定,再加上 TTFT、TPOT、成本、质量这几个指标,以及把生产 trace 送回评估集的导出管道。

2026-04-19

第 3 章 — 检索增强生成

LLM Primer V 章节走读第 3 篇。走完 RAG 五阶段管道 —— 加载、切分、embedding、检索、生成 —— 顺带把 demo 阶段的 RAG 和真正扛得住真实语料的生产 RAG 分开:混合检索加重排器、结构感知加语义组合的切分,以及按 query 派发的变换路由。

2026-04-16

第 2 章 — 基础模型与 prompt 工程

LLM Primer V 章节走读第 2 篇。把 prompt 工程当工程来做:版本化的模板、防御性分隔符、结构化输出,而不是靠感觉打分的手艺。模型选型、采样参数、prompt 剖面、结构化输出 —— 这四个控制面要么被主动操作,要么就接受后果。

2026-04-15

第 3 章 — 服务器原语:暴露上下文与能力

LLM Primer IV 章节走读第 3 篇。MCP server 能给的三个名词 — Resources(读状态)、Prompts(可复用脚手架)、Tools(写操作) — 它们的 schema、生命周期、错误模型,以及挑对原语这件事的纪律。

2026-04-01

第 2 章 — 揭开 Model Context Protocol(MCP)

LLM Primer IV 章节走读第 2 篇。MCP 到底标准化了什么,Host、Client、Server 三个角色的分工,动态发现和双向消息为什么在那些真正重要的场景里跟 REST 不一样,以及从能力协商开始的会话生命周期。

2026-03-31

第 6 章 — RAG 的威胁模型

LLM Primer III 章节走读第六篇。纯 LLM 只有一条信任边界。一套 RAG 系统有很多 — 入库、解析、分块、嵌入、索引、检索、重排、生成、工具、输出 — 每一条都连着对手能塑形的输入。

2026-03-23

第 3 章 — 进阶分块框架

LLM Primer III 章节走读第三篇。朴素的分块选择最会悄悄拖垮下游 — 以及最近两项把可能的上限都改写了的技术:contextual retrieval 与 late chunking。

2026-03-20

第 2 章 — 智能文档解析

LLM Primer III 章节走读第二篇。检索系统会继承它输入的质量 — 而那个让 RAG 质量平庸的最常见原因,就悄悄住在输入层。PDF 不是文本文件、版面感知解析器把哪些信号放回来,以及让模型直接读页面图像的那一路多模态。

2026-03-19

第 10 章 — 多模态:走出文本

LLM Primer I 章节走读第十篇。同一个 Transformer 是怎么学会接收图像和音频的 — vision transformer 和音频 token 化 — 以及"一个模型什么都能看"这种说法老老实实的边界在哪。

2026-02-27

第 9 章 — RAG:把新鲜信息缝进上下文

LLM Primer I 章节走读第九篇。RAG(检索增强生成)到底在做什么、它是怎么补上模型的时间缺失和事实弱点的,以及好 RAG 和坏 RAG 的分水岭从哪儿开始。

2026-02-26

第 2 章 — 概率、token 和文本

LLM Primer I 章节走读第二篇。token 和单词的区别、模型每一步构造出的那整张"下一个 token 概率分布"到底是什么,以及 temperature 和 top-p 怎么改变同一个模型的输出性格。

2026-02-19

第 1 章 — 所以,大语言模型究竟是什么?

LLM Primer I 章节走读第一篇。"大"、"语言"和"模型"这三个词到底分别意味着什么、从规则系统到神经网络我们是怎么一步步走过来的,以及三个值得尽早摆脱的误解。

2026-02-18