Введение в LLM
Эта страница предоставляет понятное руководство по большим языковым моделям (LLM), от основ до приложений для любителей ИИ.
Глава 12 — Дизагрегированный serving и Kubernetes
Глава 12 — Дизагрегированный serving и Kubernetes Двенадцатый пост поглавного разбора LLM Primer VI: Scaling AI Systems. Глава, наконец разделяющая prefill и de…
2026-05-04Глава 10 — Слой движка LLM
Глава 10 — Слой движка LLM Десятый пост поглавного разбора LLM Primer VI: Scaling AI Systems. Глава, называющая границу между движком и платформой и обходящая п…
2026-05-02Глава 6 — Обрезка и дистилляция знаний
Глава 6 — Обрезка и дистилляция знаний Шестой пост поглавного разбора LLM Primer VI: Scaling AI Systems. Глава, атакующая количество весов напрямую — сначала об…
2026-04-28Глава 5 — Демистификация квантизации
Глава 5 — Демистификация квантизации Пятый пост поглавного разбора LLM Primer VI: Scaling AI Systems. Глава, объясняющая, почему 70B-модель выживает 4-битную кв…
2026-04-27LLM Primer VI — Введение в серию и указатель
LLM Primer VI — Введение в серию и указатель Поглавный разбор книги LLM Primer VI: Scaling AI Systems — тома, где инференс LLM рассматривается как инженерная ди…
2026-04-22Глава 4 — ИИ-агенты и вызов инструментов
Глава 4 — ИИ-агенты и вызов инструментов Четвёртый пост поглавного разбора LLM Primer V: Building Real-World LLM Applications. Глава, относящаяся к агенту как к…
2026-04-17Глава 13 — Фреймворки и облачная интеграция
Четырнадцатый пост поглавного разбора LLM Primer IV. Strands с Bedrock, AWS state-layer-паттерн, Microsoft Agent Framework, LangChain, Semantic Kernel — и три продакшен-формы интеграции, к которым команды приходят независимо.
2026-04-11Глава 10 — Память для долгих задач
Десятый пост поглавного разбора LLM Primer IV. Краткосрочная память через окна и ReAct-черновики, долгосрочная память через эпизодические векторы и семантические хранилища, и техники сжатия, держащие агента продуктивным часами и днями.
2026-04-08Глава 7 — Реализация контроля доступа
Седьмой пост разбора LLM Primer III. Документ-уровневые ACL как фундамент, RBAC с метками чувствительности Microsoft Purview, ReBAC с Zanzibar и SpiceDB и дисциплина pre-filter против post-filter, работающая под всеми ними.
2026-03-24Глава 1 — Эволюция архитектуры RAG
Первый пост разбора LLM Primer III. Четыре архитектурные позы RAG — Naive, Advanced, Modular, Agentic — читаются как история о передаче LLM всё большей агентности по одному решению за раз, и честный ответ на вопрос, когда дообучение лучше поиска.
2026-03-18Глава 3 — Как текст течёт внутри модели
Третий пост разбора LLM Primer I по главам. Как меняется токен внутри модели — эмбеддинги, внимание, трансформер — без матриц, но без потери точности.
2026-02-20