Introduction to LLM
This page provides an easy-to-understand guide on LLMs (Large Language Models) from basics to applications for AI enthusiasts.
제10장 — 안전한 LLM 아키텍처 설계
격리가 폭발 반경을 제한하는 방식, 계층화된 검증과 선언적 정책, 그리고 모델 호출에 적용된 제로 트러스트로 침해된 프롬프트가 시스템 침해로 상승하지 못하게 하는 아키텍처.
2026-05-19제4장 — 프롬프트 인젝션과 탈옥
프롬프트 인젝션에 파라미터화된 쿼리 같은 구조적 해결책이 없는 이유. 직접·간접 인젝션, 탈옥 분류학, 그리고 네 층의 완화 아키텍처.
2026-05-13제14장 — 토큰 경제학과 API 가격
제1장의 물리를 청구서의 라인 아이템에 연결하고, 첫 달의 청구서가 왜 팀이 모델링한 것과 닮지 않는 경우가 많은지 설명하는 장.
2026-05-06제13장 — 오토스케일링과 콜드 스타트 완화
기본 쿠버네티스 오토스케일러가 LLM 트래픽에서 왜 장애를 만드는지, 그리고 KEDA·Knative·CRIU가 어떻게 그 해법을 구성하는지 설명하는 장.
2026-05-05제12장 — 분리 서빙과 쿠버네티스
프리필과 디코드를 별도 GPU 풀로 나누고, 파드가 인터커넥트의 올바른 쪽에 안착하도록 하는 쿠버네티스 프리미티브를 걷는 장.
2026-05-04제8장 — 차세대 KV 캐시 관리
운영체제의 페이징 통찰을 추론 엔진으로 옮겨 오는 장 — KV 캐시를 예약된 바이트 슬래브에서 공유·축출·프리픽스 캐시가 가능한 자원으로 바꿉니다.
2026-04-30제6장 — 프루닝과 지식 증류
가중치 개수를 직접 공격하는 장 — 먼저 중요하지 않은 가중치를 영으로 만들고, 그다음에는 큰 모델의 행동을 더 작은 모델로 옮깁니다.
2026-04-28제3장 — 생성 AI를 위한 데이터센터 GPU
서빙용 GPU는 스펙 시트 앞면의 FLOP/s 숫자가 아니라 HBM 대역폭과 VRAM 용량으로 사야 한다는 주장을 하는 장입니다.
2026-04-25제2장 — KV 캐시라는 과제
KV 캐시는 산술을 메모리와 맞바꿉니다 — 그리고 그 메모리는 배치, 시퀀스 길이, 레이어 수, 헤드 수, 헤드 차원에 동시에 비례합니다. 그래서 서빙 클러스터는 다른 어떤 자원보다 VRAM이 먼저 떨어집니다.
2026-04-24제1장 — 토큰 생성의 기제
LLM 서빙의 거의 모든 어려운 질문은 한 사실에서 내려옵니다 — 각 토큰을 만드는 루프는 메모리 대역폭에 묶여 있고, 비싼 연산 유닛은 99.7퍼센트의 시간을 놀립니다.
2026-04-23LLM Primer VI — 시리즈 서문 및 목차
LLM Primer VI — AI 시스템 확장하기의 16개 챕터를 하루 한 편씩 걷는 워크스루의 서문입니다. 메모리 대역폭, 스케줄링, 그리고 청구서가 만나는 지점에서 LLM 추론을 엔지니어링 학문으로 다룹니다.
2026-04-22제3장 — 검색 증강 생성
RAG 파이프라인을 끝에서 끝까지 걷고, 열 개의 즐겨찾기 문서에서만 잘 돌아가는 데모와 실제 코퍼스와 접촉하고도 살아남는 시스템 사이의 차이를 그리는 장.
2026-04-16제2장 — 파운데이션 모델과 프롬프트 엔지니어링
프롬프트 엔지니어링을 예술이 아니라 엔지니어링으로 다루는 장. 모델 선택, 샘플링 파라미터, 방어적 프롬프트 해부학, 그리고 스키마를 강제하는 구조화 출력 — 네 개의 제어 표면.
2026-04-15LLM Primer V — 시리즈 소개 및 목차
LLM Primer V 워크스루 시리즈의 시작. AI 엔지니어링을 프롬프트 트릭이 아니라 하나의 학문 분야로 다루는 제5권을, 8개 장을 따라 하루에 한 편씩 살핍니다.
2026-04-13제1장 — AI 통합 위기와 에이전트형 아키텍처의 부상
LLM Primer IV 워크스루의 첫 번째 글입니다. 시스템 프롬프트가 자라며 모놀리식 에이전트가 닳아 가는 과정, 그 밑에 숨은 N 곱하기 M 통합 문제, 그리고 MCP가 가능하게 하기 위해 만들어진 프롬프트 엔지니어링에서 컨텍스트 엔지니어링으로의 이행을 살핍니다.
2026-03-30제7장 — 모델을 더 영리하게 쓰는 방식: 프롬프트 엔지니어링
LLM Primer I 시리즈 제7장입니다. 같은 모델을 두 배쯤 영리하게 만들어주는 프롬프트의 갈래들 — 시스템 프롬프트, 퓨샷 예시, 사고의 사슬, 역할 설정 — 그리고 그 갈래들이 왜 통하는지를, 다음 토큰 예측의 메커니즘과 이어 풀어 봅니다.
2026-02-24LLM 가이드 (대규모 언어 모델): 생성형 AI의 기초 이해
이 가이드는 GPT, BERT, T5와 같은 대규모 언어 모델(LLM)의 개념과 원리를 쉽게 이해할 수 있도록 정리했습니다. 생성형 AI를支える 핵심 기술인 트랜스포머 구조, 어텐션 메커니즘, 학습 과정, 그리고 실제 응용 사례까지 폭넓게 다룹니다. 머신러닝과 자연어 처리에 관심 있는 독자라면, 이 글을 통해 LLM의 기반을 체계적으로 이해할 수 있습니다.
2024-09-01