Introduction to LLM
This page provides an easy-to-understand guide on LLMs (Large Language Models) from basics to applications for AI enthusiasts.
제17장 — 미래의 위협과 새롭게 등장하는 방어
자율 에이전트의 폭발 반경, 멀티모달 표면이 넓히는 인젝션 채널, 합성 신원과 AI 대 AI 동역학, 그리고 LLM Primer 시리즈의 마지막 마무리.
2026-05-26제16장 — 안전한 파인튜닝과 적응
파인튜닝된 모델을 물려받는 것이 아니라 획득해야 할 아티팩트로 다루기. 정렬 침식, 소규모 데이터 오염, CI 평가 게이트, 그리고 롤백 규율.
2026-05-25제14장 — 편향, 공정성, 책임 있는 AI
편향의 다섯 근원, 서로 불일치하는 공정성 지표, 안전-유용성 트레이드오프, 그리고 설명 가능성이 규제와 만나지 못하는 간극을 다루는 조직의 AI 정책.
2026-05-23제13장 — 규제 지형
EU AI 법의 단계적 적용, AI 시스템에도 여전히 구속력을 갖는 GDPR·CCPA·PIPL, 그리고 감사 가능성·모델 카드·위험 분류가 만드는 운영 형태.
2026-05-22제12장 — 접근 제어와 신원
OAuth·mTLS·RBAC·ABAC의 LLM 이식, 멀티테넌트 격리의 세 접근, 그리고 SAML·SCIM·감사 로그가 만드는 엔터프라이즈 거버넌스 오버레이.
2026-05-21제11장 — 관측 가능성, 로깅, 사건 대응
확률적 시스템에서 로깅해야 할 것, 시그니처·통계·행동 신호를 조합한 탐지, 그리고 재현 가능성을 확보하는 NIST 800-61 형태의 사건 대응.
2026-05-20제9장 — 모델 무결성과 공급망 위험
모델을 서드파티가 배포한 바이너리로 다루기. BadNets에서 Sleeper Agents까지, 피클 대 safetensors, 그리고 SLSA·Sigstore·드리프트 모니터링.
2026-05-18제8장 — 모델에 대한 적대적 공격
FGSM에서 TextFooler·보편적 접미사까지의 계보, API 예산이 시사하는 것보다 저렴한 블랙박스 공격, 그리고 블랙박스를 사실상 화이트박스로 바꾸는 모델 탈취.
2026-05-17제7장 — 환각과 신뢰성
환각의 두 메커니즘 — 사실성과 충실성 실패, 신경망의 구조적 과신, 그리고 캘리브레이션·RAG 접지·human-in-the-loop로 이루어지는 신뢰성 엔지니어링.
2026-05-16제6장 — 검색 증강 생성의 위험
RAG 파이프라인의 다섯 신뢰 경계, 인덱스를 통한 인젝션 공격, PoisonedRAG와 BadRAG, 그리고 아키텍처적으로 안전한 검색 패턴.
2026-05-15제5장 — 입력 검증과 출력 필터링
단계적 위생 처리, 방어로서의 구조화된 출력, Llama Guard와 NeMo Guardrails, 그리고 Garak·PyRIT로 안전을 측정하는 방법.
2026-05-14제4장 — 프롬프트 인젝션과 탈옥
프롬프트 인젝션에 파라미터화된 쿼리 같은 구조적 해결책이 없는 이유. 직접·간접 인젝션, 탈옥 분류학, 그리고 네 층의 완화 아키텍처.
2026-05-13제3장 — 데이터 보안과 프라이버시
LLM 시스템에서 데이터를 수명주기 자산으로 다루기. 학습 코퍼스의 저작권과 PII, 암기와 추출 공격, 그리고 Samsung과 Garante 사건이 규정한 사용자 입력 처리 규율.
2026-05-12제2장 — LLM 시스템의 위협 모델링
Shostack의 네 질문, STRIDE와 PASTA, MITRE ATLAS를 LLM 시스템에 적용. 자산 목록·적대자 카탈로그·위협 등록부를 채우는 작업 템플릿을 걷습니다.
2026-05-11제1장 — 왜 AI 보안은 다른가
LLM 보안이 코드 보안이 아닌 이유. 확률적 시스템의 행동 포락선이 공격 표면이 되며, 프롬프트·검색·도구·학습·모델·출력의 여섯 표면이 새로운 신뢰 경계를 규정합니다.
2026-05-10LLM Primer VII — 시리즈 소개 및 목차
LLM Primer VII: AI 보안의 챕터별 워크스루 소개. 위협 모델부터 규제 경계까지, 시리즈의 마지막 권에서 엔지니어링 아크가 적대자와 만나는 지점을 다룹니다.
2026-05-09제6장 — 프루닝과 지식 증류
가중치 개수를 직접 공격하는 장 — 먼저 중요하지 않은 가중치를 영으로 만들고, 그다음에는 큰 모델의 행동을 더 작은 모델로 옮깁니다.
2026-04-28제2장 — Model Context Protocol(MCP)의 베일 벗기
LLM Primer IV 워크스루의 두 번째 글입니다. MCP가 실제로 무엇을 표준화하는지, Host·Client·Server의 세 역할 분할, 중요한 경우에 동적 발견과 양방향 메시징이 REST와 어떻게 다른지, 그리고 능력 협상으로 열리는 세션 라이프사이클을 봅니다.
2026-03-31제9장 — RAG 평가 트라이어드
LLM Primer III 워크스루의 아홉 번째 글입니다. RAG 시스템은 세 곳에서 다르게 실패할 수 있고 밖에서 보면 그 실패가 똑같이 보입니다 — 컨텍스트 적합도, 근거성, 답변 적합도로 이루어진 평가 트라이어드는, 다른 버그를 고치며 또 다른 것을 측정하는 실수를 막아 주는 작은 어휘입니다.
2026-03-26제7장 — 접근 제어 구현
LLM Primer III 워크스루의 일곱 번째 글입니다. 문서 수준 ACL을 토대로, Microsoft Purview 민감도 레이블과 함께 가는 RBAC, Zanzibar와 SpiceDB로 가는 ReBAC, 그리고 그 모두 아래에서 도는 사전 필터와 사후 필터의 규율을 함께 살펴봅니다.
2026-03-24제6장 — RAG 위협 모델과 취약점
LLM Primer III 워크스루의 여섯 번째 글입니다. 순수 LLM은 단 하나의 신뢰 경계를 가졌습니다. RAG 시스템은 여럿을 갖습니다 — 수집, 파서, 청커, 임베더, 인덱스, 리트리버, 리랭커, 생성기, 도구, 출력 — 그리고 각각이 적대자가 빚을 수 있는 입력에 닿아 있습니다.
2026-03-23제5장 — 검색 파이프라인 설계
LLM Primer III 워크스루의 다섯 번째 글입니다. 단일 벡터 검색이 왜 파이프라인이 아닌지 — 하이브리드 검색, RRF, 크로스 인코더 리랭킹, 그리고 쿼리 측 재작성과 HyDE — 가 어떻게 성숙한 RAG 시스템이 수렴하는 프로덕션 아키텍처로 조립되는지를 함께 살펴봅니다.
2026-03-22LLM Primer III — 시리즈 소개 및 인덱스
LLM Primer 시리즈 제3권의 챕터별 워크스루를 여는 글입니다. 검색 증강 생성이 밖에서는 단순해 보이지만 안에서는 여러 분야가 겹친 스택임을 짚고, 누구를 위해 이 책을 썼는지, 그리고 3월 18일부터 28일까지 이어질 열한 편의 포스트 일정을 정리합니다.
2026-03-17제11장 — 평가, 보정, 추론
LLM Primer II 시리즈 제11장입니다. 무엇이든 말할 수 있는 기계를 도대체 어떻게 잰단 말인가 — 그리고 "확신에 찬 모델은 거의 늘 보정이 나쁜 모델이라는 사실"을 마주하게 되는 자리. 퍼플렉시티, 보정, 벤치마크의 오차 막대, 환각의 수학을 함께 풀어 봅니다.
2026-03-13제10장 — 사후 학습과 정렬의 수학
LLM Primer II 시리즈 제10장입니다. 똑똑하지만 길들지 않은 다음 토큰 예측기를, 쓸 만한 어시스턴트로 길들이는 자리 — 지도 파인튜닝, 보상 모델, KL 페널티 위의 RLHF, 그리고 강화학습 파이프라인 전체가 하나의 지도학습 손실로 접히는 DPO의 우아한 유도까지 함께 풀어 봅니다.
2026-03-12제9장 — RAG: 모델에 최신의 결을 흘려보내는 길
LLM Primer I 시리즈 제9장입니다. 검색 보강 생성(RAG)이 정확히 무엇이고, 모델의 시간 인지의 결손과 사실 정확성의 결을 어떻게 뒷받침해 주는지 — 그리고 좋은 RAG와 나쁜 RAG의 갈림은 어디서 시작되는지를 풀어 봅니다.
2026-02-26제5장 — 그래도 작은 결함이 남아 있다
LLM Primer I 시리즈 제5장입니다. 잘 학습된 LLM도 여전히 갖고 있는 결함 — 환각, 시간 감각의 결손, 계산의 약점, 출력의 일관성 흔들림 — 의 정체를 들여다보고, 그것이 왜 "버그"가 아니라 같은 메커니즘에서 함께 나오는 "특성"인지를 풀어 봅니다.
2026-02-22제4장 — 모델은 어떻게 학습되는가
LLM Primer I 시리즈 제4장입니다. 사전학습이 학습 결과를 형성하는 큰 무대인 이유, 파인튜닝이 모델 인격을 조각해 가는 정밀 작업인 이유, 그리고 RLHF가 단순한 "다음 토큰 예측기"를 매일 우리가 신뢰하는 그 어시스턴트로 만들어주는 방식을 풀어 봅니다.
2026-02-21제3장 — 모델 안에서 텍스트는 어떻게 흐르는가
LLM Primer I 시리즈 제3장입니다. 토큰이 모델 내부에서 어떤 모습으로 변신해 가는지 — 임베딩, 어텐션, 트랜스포머 — 를, 수식의 함정에 빠지지 않으면서 정확함을 잃지 않을 정도로 풀어냅니다.
2026-02-20제1장 — 대규모 언어 모델이란 무엇인가 (헤드라인 너머)
LLM Primer I 시리즈 제1장입니다. "대규모", "언어", "모델"이 정말로 가리키는 것이 무엇인지 풀어내고, 룰 기반 시스템에서 뉴럴 네트워크로 옮겨온 과정을 짚고, 현대 LLM의 작동에 대한 세 가지 큰 오해를 다룹니다. 앞으로 이어질 모든 내용의 토대가 될, 명료하고 읽기 쉬운 입구입니다.
2026-02-18LLM Primer I 챕터별 워크스루 — 시리즈 서문과 인덱스
『LLM Primer I: 생성 AI는 어떻게 작동하는가』를 챕터별로 소개하는 12회 시리즈의 서문과 인덱스입니다. 2026년 2월 18일부터 3월 1일까지 매일 한 편씩. 차례로 따라 읽어도, 관심 가는 챕터만 골라 읽어도 됩니다. 열두 편의 글을 여기서 한꺼번에 찾을 수 있습니다.
2026-02-17LLM 입문서 시리즈 — 생성형 AI를 한 권씩 풀어내는 일곱 권의 안내서
LLM Primer 시리즈 — Sho Shimoda의 생성형 AI 필드 가이드, 이제 완결. 기초부터 보안까지 7권 전권. 자매 볼륨 Physical AI도 포함. 7권 모두 Amazon에서 판매 중.
2026-02-15LLM 정의와 개요: 파라미터, 학습 방식, 그리고 확장성 이해
LLM(대규모 언어 모델)은 수억~수조 개의 파라미터로 학습된 신경망 기반 모델입니다. 본 섹션에서는 LLM의 정의와 개요, 파라미터의 역할, 사전 학습과 파인튜닝, 자기 지도 학습, 그리고 확장성에 대해 설명합니다.
2024-09-03LLM 가이드: 생성형 AI의 기초와 대규모 언어 모델 이해
LLM(대규모 언어 모델)은 GPT, BERT, T5와 같은 최신 AI 기술의 핵심입니다. 본 가이드는 LLM의 정의, NLP에서의 역할, 기존 기계학습과의 차이를 체계적으로 설명합니다.
2024-09-02LLM 가이드 (대규모 언어 모델): 생성형 AI의 기초 이해
이 가이드는 GPT, BERT, T5와 같은 대규모 언어 모델(LLM)의 개념과 원리를 쉽게 이해할 수 있도록 정리했습니다. 생성형 AI를支える 핵심 기술인 트랜스포머 구조, 어텐션 메커니즘, 학습 과정, 그리고 실제 응용 사례까지 폭넓게 다룹니다. 머신러닝과 자연어 처리에 관심 있는 독자라면, 이 글을 통해 LLM의 기반을 체계적으로 이해할 수 있습니다.
2024-09-01