LLM介绍

本页面为AI爱好者提供从基础到应用的大型语言模型(LLM)指南。


共有14篇文章。 | 当前在第1页,共1页。

第 15 章 — Serverless API 对比自建基础设施

LLM Primer VI 章节走读第 15 篇。GPU 租金分项决定 token 那道算术;平台工程分项决定这单交易。混合姿态几乎总是对的答案,应用边界那个路由器是承重的那一块。

2026-05-07

第 14 章 — Token 经济学与 API 定价

LLM Primer VI 章节走读第 14 篇。为什么输出比输入贵 4–8 倍。输入输出混合决定优化杠杆的方向。上下文累积和看不见的 reasoning token 是账单上最贵的两个隐藏项。

2026-05-06

第 12 章 — 拆分部署与 Kubernetes

LLM Primer VI 章节走读第 12 篇。把 prefill 和 decode 拆到不同 GPU 池,让每一池按自己的工作负载调优。LeaderWorkerSet、Grove PodCliqueSet、KAI Scheduler —— 表达这次拆分的 Kubernetes 原语。

2026-05-04

第 3 章 — 面向生成式 AI 的数据中心 GPU

LLM Primer VI 章节走读第 3 篇。挑一块 serving GPU,该看的是 HBM 带宽和 VRAM 容量,而不是数据表正面那个 FLOP/s 数字。这一章走 H100、H200、B200、L40S、MI300X 这五款主流硅片。

2026-04-25

第 1 章 — Token 生成的机制

LLM Primer VI 章节走读第 1 篇。这一章说的是:LLM serving 里几乎每一个难题都能追溯到同一件事 —— 生成每一个 token 的那个循环是内存带宽受限的,你花大价钱买的算力有 99.7% 的时间在空转。

2026-04-23

第 6 章 — AI 可观测性与追踪

LLM Primer V 章节走读第 6 篇。把一次用户 query 当作一棵因果树,不是一条请求日志,再展示要让这棵树可读需要追踪什么:分布式追踪加 GenAI 语义约定,再加上 TTFT、TPOT、成本、质量这几个指标,以及把生产 trace 送回评估集的导出管道。

2026-04-19

第 11 章 — 攻击面与协议漏洞

LLM Primer IV 章节走读第 11 篇。被改造到 MCP 上的几个经典攻击 — Confused Deputy、Token Passthrough、Session Hijacking — 围绕能力升级和未认证 sampling 的协议级缺陷,以及让上下文投毒变成结构性问题而不是卫生问题的隐式信任传播。

2026-04-09

LLM Primer IV — 系列导读与目录

本文开启 LLM Primer 系列第四卷《用 MCP 设计 AI 认知》的章节走读。为什么智能体要靠一层协议才能从 demo 走到生产,这本书写给谁,以及 3 月 30 日到 4 月 12 日 14 篇连载的时间表。

2026-03-29

第 10 章 — 多模态:走出文本

LLM Primer I 章节走读第十篇。同一个 Transformer 是怎么学会接收图像和音频的 — vision transformer 和音频 token 化 — 以及"一个模型什么都能看"这种说法老老实实的边界在哪。

2026-02-27

第 7 章 — 把提示工程当成一门手艺

LLM Primer I 章节走读第七篇。真正扛事的四个 prompt 模式 — system prompt、few-shot、思维链、角色 — 以及每个为什么能行,从下一个 token 的机制里讲清。

2026-02-24

第 5 章 — 还是有些小毛病

LLM Primer I 章节走读第五篇。即便是训得很好的 LLM 也还在犯的那几样毛病 — 幻觉、对时间没概念、算术、一致性抖动 — 为什么这些不是 bug,而是同一个"下一个 token 预测"机制的特性。

2026-02-22

第 4 章 — 模型是怎么学的

LLM Primer I 章节走读第四篇。为什么预训练决定能力上限,为什么微调塑造性格,以及 RLHF 是怎么把一个原始的"下一个 token 预测器"变成我们每天信任的那位助手。

2026-02-21

第 3 章 — 文本在模型里是怎么流动的

LLM Primer I 章节走读第三篇。token 进了模型之后到底经历了什么 — 嵌入、注意力、Transformer — 不被矩阵淹没,也不丢精度。

2026-02-20

第 2 章 — 概率、token 和文本

LLM Primer I 章节走读第二篇。token 和单词的区别、模型每一步构造出的那整张"下一个 token 概率分布"到底是什么,以及 temperature 和 top-p 怎么改变同一个模型的输出性格。

2026-02-19