Introduction to LLM

This page provides an easy-to-understand guide on LLMs (Large Language Models) from basics to applications for AI enthusiasts.


Total of 10 articles available. | Currently on page 1 of 1.

제15장 — 서버리스 API 대 전용 인프라

손익분기 산수를 테이블에 올리고, 대부분의 팀에게 답을 뒤집는 플랫폼 엔지니어링 라인 아이템에 이름을 붙이는 장.

2026-05-07

제14장 — 토큰 경제학과 API 가격

제1장의 물리를 청구서의 라인 아이템에 연결하고, 첫 달의 청구서가 왜 팀이 모델링한 것과 닮지 않는 경우가 많은지 설명하는 장.

2026-05-06

제10장 — LLM 엔진 계층

엔진과 플랫폼 사이의 경계에 이름을 붙이고, 2026년 그 계층을 지배하는 다섯 엔진을 걷는 장.

2026-05-02

제8장 — 차세대 KV 캐시 관리

운영체제의 페이징 통찰을 추론 엔진으로 옮겨 오는 장 — KV 캐시를 예약된 바이트 슬래브에서 공유·축출·프리픽스 캐시가 가능한 자원으로 바꿉니다.

2026-04-30

제7장 — 고급 배칭 전략

배칭은 최적화가 아니라 대역폭에 묶인 디코딩을 감당 가능하게 만드는 하중 지지 수이며, 배치는 명사가 아니라 동사입니다.

2026-04-29

제6장 — 프루닝과 지식 증류

가중치 개수를 직접 공격하는 장 — 먼저 중요하지 않은 가중치를 영으로 만들고, 그다음에는 큰 모델의 행동을 더 작은 모델로 옮깁니다.

2026-04-28

제3장 — 생성 AI를 위한 데이터센터 GPU

서빙용 GPU는 스펙 시트 앞면의 FLOP/s 숫자가 아니라 HBM 대역폭과 VRAM 용량으로 사야 한다는 주장을 하는 장입니다.

2026-04-25

제14장 — 벤치마킹, 테스트, 성능

LLM Primer IV 워크스루의 열다섯 번째이자 마지막 글입니다. 실제 서버 위의 MCP-Universe 벤치마크, 그것이 드러낸 두 가지 시스템적 실패 모드, 세션당 요청과 공유 세션 풀 사이의 10배 처리량 격차, 그리고 제5권으로의 다리를 살핍니다.

2026-04-12

제13장 — 프레임워크와 클라우드 통합

LLM Primer IV 워크스루의 열세 번째 글입니다. Bedrock과 함께한 Strands, AWS 상태 층 패턴, Microsoft Agent Framework, LangChain, Semantic Kernel — 그리고 팀이 독립적으로 거듭 도착하는 세 가지 프로덕션 통합 모양을 살핍니다.

2026-04-11

제2장 — 지능형 문서 파싱

LLM Primer III 워크스루의 두 번째 글입니다. PDF가 텍스트 파일이 아닌 이유, 레이아웃 인지 파서가 실제로 보존하는 것, 현재 도구 지형(LlamaParse, Docling, Unstructured, Marker-PDF, Firecrawl, DeepSeek-OCR), 그리고 페이지 이미지 위에서 직접 검색하는 멀티모달 트랙을 함께 살펴봅니다.

2026-03-19