LLM介绍

本页面为AI爱好者提供从基础到应用的大型语言模型（LLM）指南。

共有2篇文章。 | 当前在第1页，共1页。

第10章 — 后训练与对齐的数学

LLM Primer II 章节走读第十篇。后训练那一整套机器 — 监督微调、奖励模型、RLHF 上的 KL 缰绳,以及 DPO 那个把整条流水线塌成一条监督损失的漂亮推导。

2026-03-12

LLM Primer I 章节走读第四篇。为什么预训练决定能力上限,为什么微调塑造性格,以及 RLHF 是怎么把一个原始的"下一个 token 预测器"变成我们每天信任的那位助手。

2026-02-21