LLM介绍

本页面为AI爱好者提供从基础到应用的大型语言模型(LLM)指南。


共有27篇文章。 | 当前在第1页,共1页。

第 10 章 — 设计安全的 LLM 架构

LLM Primer VII 章节走读第 10 篇。这一章把架构当作首要安全学科来处理 —— 因为一个概率组件最安全的配置,是那种爆炸半径由结构而不是由组件自己的克制来限定的配置。

2026-05-19

第 9 章 — 模型完整性与供应链风险

LLM Primer VII 章节走读第 9 篇。这一章把模型 artefact 当作由第三方分发的二进制来对待 —— 带着二进制分发一直带着的反序列化、后门和出处问题。

2026-05-18

第 8 章 — 针对模型的对抗性攻击

LLM Primer VII 章节走读第 8 篇。这一章追溯对抗性攻击 —— 从 Goodfellow 2014 年的图像分类器工作,一路到 TextFooler、通用后缀,再到针对生产 API 的模型窃取。

2026-05-17

第 5 章 — 输入验证与输出过滤

LLM Primer VII 章节走读第 5 篇。这一章把第 4 章的分层缓解框架变成操作纪律 —— 清洗阶段、护栏工具、结构化输出、红队,以及说得清楚的安全指标。

2026-05-14

第 4 章 — Prompt Injection 与 Jailbreak

LLM Primer VII 章节走读第 4 篇。位于 LLM 安全实操问题正中央的这一章 —— 解释为什么 prompt injection 没有一个类似参数化查询那样的结构性修复,只有分层的、部分的防御。

2026-05-13

第 3 章 — 数据安全与隐私

LLM Primer VII 章节走读第 3 篇。这一章把数据当作一份有生命周期的资产来处理 —— 从被模型部分记住的训练语料,到 Samsung 工程师在这个事件还没被命名之前粘进 ChatGPT 的那些代码。

2026-05-12

LLM Primer VII — 系列引言与索引

《LLM Primer VII: AI Security》章节走读的系列引言与索引 —— LLM Primer 系列的收官之作,把七卷的工程弧线落到那门决定这一切能否在对手、监管者和概率系统日常故障模式面前存活下来的学科。

2026-05-09

第 15 章 — Serverless API 对比自建基础设施

LLM Primer VI 章节走读第 15 篇。GPU 租金分项决定 token 那道算术;平台工程分项决定这单交易。混合姿态几乎总是对的答案,应用边界那个路由器是承重的那一块。

2026-05-07

第 12 章 — 拆分部署与 Kubernetes

LLM Primer VI 章节走读第 12 篇。把 prefill 和 decode 拆到不同 GPU 池,让每一池按自己的工作负载调优。LeaderWorkerSet、Grove PodCliqueSet、KAI Scheduler —— 表达这次拆分的 Kubernetes 原语。

2026-05-04

第 11 章 — 平台与编排层

LLM Primer VI 章节走读第 11 篇。平台的选择不是关于功能,而是关于哪一种运营模型贴合团队的 ops 文化。Ray Serve、KServe、BentoML、Triton —— 四种 CRD、Python actor、Bento、模型仓库,分别匹配不同的 ops grain。

2026-05-03

第 8 章 — 新一代 KV Cache 管理

LLM Primer VI 章节走读第 8 篇。把 KV cache 当成分页虚拟内存来管理:小 block、page table、引用计数共享 —— continuous batching 那道内存债就还得起。PagedAttention、H2O、InfiniGen、前缀缓存。

2026-04-30

LLM Primer VI — 系列导读与目录

《LLM Primer VI: Scaling AI Systems》章节走读的第一篇。这一卷把 LLM 推理当成一门工程学科:内存带宽、调度、每一美元的账单,在同一块芯片上撞在一起。十六章分成六个部分,一层层走过硬件、模型压缩、运行时、平台和经济学。

2026-04-22

第 8 章 — 性能、部署与成本优化

LLM Primer V 章节走读第 8 篇。把生产 LLM 的经济学当分层学科来做:最便宜的调用是那次没发生的调用,再往下每一层都是让下一次调用变便宜的那一层。语义缓存、动态路由、推理服务器内部的 PagedAttention、连续批处理、推测解码。

2026-04-21

第 6 章 — AI 可观测性与追踪

LLM Primer V 章节走读第 6 篇。把一次用户 query 当作一棵因果树,不是一条请求日志,再展示要让这棵树可读需要追踪什么:分布式追踪加 GenAI 语义约定,再加上 TTFT、TPOT、成本、质量这几个指标,以及把生产 trace 送回评估集的导出管道。

2026-04-19

第 4 章 — AI 智能体与工具调用

LLM Primer V 章节走读第 4 篇。把智能体当作一个针对工具循环起来的语言模型来处理:工具 schema、错误合同、以及记忆的写入纪律,是整个系统里杠杆率最高的工程面。ReAct 循环、工具作为合同,以及智能体真正需要的三层记忆。

2026-04-17

第 3 章 — 检索增强生成

LLM Primer V 章节走读第 3 篇。走完 RAG 五阶段管道 —— 加载、切分、embedding、检索、生成 —— 顺带把 demo 阶段的 RAG 和真正扛得住真实语料的生产 RAG 分开:混合检索加重排器、结构感知加语义组合的切分,以及按 query 派发的变换路由。

2026-04-16

第 2 章 — 基础模型与 prompt 工程

LLM Primer V 章节走读第 2 篇。把 prompt 工程当工程来做:版本化的模板、防御性分隔符、结构化输出,而不是靠感觉打分的手艺。模型选型、采样参数、prompt 剖面、结构化输出 —— 这四个控制面要么被主动操作,要么就接受后果。

2026-04-15

第 1 章 — AI 工程这门学科

LLM Primer V 章节走读第 1 篇。demo 到生产之间那道可靠性鸿沟不是模型问题,而是工程问题 —— 而这份工程有自己的名字:围绕概率式核心构建一层确定性外壳,再把可靠性、质量、性能、成本、演进这五根柱子一根根立起来。

2026-04-14

LLM Primer V — 系列导读与索引

LLM Primer V 章节走读的系列导读。这一卷把 AI 工程当作一门独立的工程学科来讲,而不是一套 prompt 技巧;八个章节按栈的方式排列 —— 基础模型、prompt、检索、智能体、评估、可观测性、安全、以及部署经济学 —— 一层一层填出包在概率核心外面的确定性外壳。

2026-04-13

第 2 章 — 揭开 Model Context Protocol(MCP)

LLM Primer IV 章节走读第 2 篇。MCP 到底标准化了什么,Host、Client、Server 三个角色的分工,动态发现和双向消息为什么在那些真正重要的场景里跟 REST 不一样,以及从能力协商开始的会话生命周期。

2026-03-31

第 6 章 — RAG 的威胁模型

LLM Primer III 章节走读第六篇。纯 LLM 只有一条信任边界。一套 RAG 系统有很多 — 入库、解析、分块、嵌入、索引、检索、重排、生成、工具、输出 — 每一条都连着对手能塑形的输入。

2026-03-23

第 3 章 — 进阶分块框架

LLM Primer III 章节走读第三篇。朴素的分块选择最会悄悄拖垮下游 — 以及最近两项把可能的上限都改写了的技术:contextual retrieval 与 late chunking。

2026-03-20

第 9 章 — RAG:把新鲜信息缝进上下文

LLM Primer I 章节走读第九篇。RAG(检索增强生成)到底在做什么、它是怎么补上模型的时间缺失和事实弱点的,以及好 RAG 和坏 RAG 的分水岭从哪儿开始。

2026-02-26

第 5 章 — 还是有些小毛病

LLM Primer I 章节走读第五篇。即便是训得很好的 LLM 也还在犯的那几样毛病 — 幻觉、对时间没概念、算术、一致性抖动 — 为什么这些不是 bug,而是同一个"下一个 token 预测"机制的特性。

2026-02-22

第 2 章 — 概率、token 和文本

LLM Primer I 章节走读第二篇。token 和单词的区别、模型每一步构造出的那整张"下一个 token 概率分布"到底是什么,以及 temperature 和 top-p 怎么改变同一个模型的输出性格。

2026-02-19

第 1 章 — 所以,大语言模型究竟是什么?

LLM Primer I 章节走读第一篇。"大"、"语言"和"模型"这三个词到底分别意味着什么、从规则系统到神经网络我们是怎么一步步走过来的,以及三个值得尽早摆脱的误解。

2026-02-18

LLM Primer I — 章节走读:序言与目录

LLM Primer I 章节走读的开篇。整本书是怎么搭起来的、每一章给出什么,以及 2 月 18 日到 3 月 1 日这十二篇连载的发布日程。

2026-02-17