Introduction to LLM
This page provides an easy-to-understand guide on LLMs (Large Language Models) from basics to applications for AI enthusiasts.
제6장 — 프루닝과 지식 증류
가중치 개수를 직접 공격하는 장 — 먼저 중요하지 않은 가중치를 영으로 만들고, 그다음에는 큰 모델의 행동을 더 작은 모델로 옮깁니다.
2026-04-28제3장 — 생성 AI를 위한 데이터센터 GPU
서빙용 GPU는 스펙 시트 앞면의 FLOP/s 숫자가 아니라 HBM 대역폭과 VRAM 용량으로 사야 한다는 주장을 하는 장입니다.
2026-04-25제1장 — 토큰 생성의 기제
LLM 서빙의 거의 모든 어려운 질문은 한 사실에서 내려옵니다 — 각 토큰을 만드는 루프는 메모리 대역폭에 묶여 있고, 비싼 연산 유닛은 99.7퍼센트의 시간을 놀립니다.
2026-04-23LLM Primer VI — 시리즈 서문 및 목차
LLM Primer VI — AI 시스템 확장하기의 16개 챕터를 하루 한 편씩 걷는 워크스루의 서문입니다. 메모리 대역폭, 스케줄링, 그리고 청구서가 만나는 지점에서 LLM 추론을 엔지니어링 학문으로 다룹니다.
2026-04-22제4장 — 올바른 벡터 데이터베이스 선택
LLM Primer III 워크스루의 네 번째 글입니다. 목적별 벡터 데이터베이스와 Postgres 류 확장의 아키텍처적 분기, 매니지드의 선두 주자(Pinecone, Vertex), 오픈소스의 진영(Qdrant, Milvus, Weaviate), 임베디드 옵션, 그리고 실제 선택을 가르는 세 운영 축 — 데이터 거주성, 운영, 비용 — 을 함께 살펴봅니다.
2026-03-21제11장 — 모델을 더 작게, 더 영리하게
LLM Primer I 시리즈 제11장입니다. 큰 모델을 어떻게 작고 빠르게 만들어 운영의 결에 맞추는가 — 디스틸레이션, 양자화, MoE — 그리고 2026 에디션의 새 절 §11.6 "추론 모델"의 큰 그림을 함께 풀어 봅니다.
2026-02-28제10장 — 멀티모달: 텍스트를 넘어선 입력
LLM Primer I 시리즈 제10장입니다. 같은 트랜스포머가 어떻게 이미지와 오디오까지 받아들이게 되었는지 — 비전 트랜스포머와 오디오 토큰화의 메커니즘을 풀어내고, "한 모델이 모든 입력을 다 본다"는 그림의 한계와 강점을 정직하게 짚어 봅니다.
2026-02-27LLM Primer I 챕터별 워크스루 — 시리즈 서문과 인덱스
『LLM Primer I: 생성 AI는 어떻게 작동하는가』를 챕터별로 소개하는 12회 시리즈의 서문과 인덱스입니다. 2026년 2월 18일부터 3월 1일까지 매일 한 편씩. 차례로 따라 읽어도, 관심 가는 챕터만 골라 읽어도 됩니다. 열두 편의 글을 여기서 한꺼번에 찾을 수 있습니다.
2026-02-17LLM 가이드 (대규모 언어 모델): 생성형 AI의 기초 이해
이 가이드는 GPT, BERT, T5와 같은 대규모 언어 모델(LLM)의 개념과 원리를 쉽게 이해할 수 있도록 정리했습니다. 생성형 AI를支える 핵심 기술인 트랜스포머 구조, 어텐션 메커니즘, 학습 과정, 그리고 실제 응용 사례까지 폭넓게 다룹니다. 머신러닝과 자연어 처리에 관심 있는 독자라면, 이 글을 통해 LLM의 기반을 체계적으로 이해할 수 있습니다.
2024-09-01