LLM SYSTEMS ENGINEERING · 한국어 학습 노트
모델이 실행되는
시스템을 이해하기.
모델, 하드웨어, 워크로드.
세 가지 관점으로 공통 개념부터 추론·학습·RL까지 차근차근 연결합니다.
LEARNING PATH
작은 실행에서 시작하는 네 단계
공통
모델의 계산이 GPU 실행으로 이어지는 과정
추론
고정된 가중치로 요청을 효율적으로 처리하기
학습
Pretraining과 SFT, 한 GPU에서 여러 노드까지
RL
생성·평가·학습을 하나의 과정으로 연결하기
이곳에서는 Pretraining·SFT를 학습 과정으로, RL을 별도 과정으로 다룹니다. 일반적인 용어에서 SFT도 post-training에 포함됩니다.
ARTICLES
지금 읽을 수 있는 글
LLM 시스템 엔지니어링: 모델, 하드웨어, 워크로드를 연결하는 일
모델·하드웨어·워크로드로 실행 시스템을 이해하는 관점과 시리즈의 학습 순서를 소개합니다.
공통 · 2026-09-09LLM의 전체 구조: 임베딩 층에서 LM Head까지
텍스트가 토큰 ID와 벡터를 거쳐 어휘별 점수로 바뀌는 흐름과 임베딩 층, 디코더 블록, LM Head의 역할을 살펴봅니다.
공통 · 2026-09-09디코더 블록의 기본 흐름: Residual과 RMSNorm
Residual stream을 중심으로 디코더 블록의 구조를 살펴보고, d차원 벡터의 덧셈과 RMSNorm의 계산을 설명합니다.
공통 · 2026-09-09Attention과 MLP: 토큰 사이의 정보와 토큰 내부의 변환
Attention과 MLP의 역할을 비교하고, 행렬 곱부터 기본 MLP와 Gated MLP의 내부 계산까지 살펴봅니다.
공통 · 2026-09-09Attention의 projection: Q·K·V와 멀티 헤드
Q·K·V projection과 멀티 헤드의 구성을 살펴보고, 출력 projection이 같은 토큰의 여러 head 결과를 조합하는 과정을 설명합니다.
공통 · 2026-09-09Core Attention: 토큰 사이의 정보 조합하기
Head별 Core Attention의 흐름을 따라 QKᵀ, 스케일링, Causal mask, Softmax, Value 가중합을 살펴봅니다.
공통 · 2026-09-10RoPE: 토큰 위치를 Attention에 반영하기
Q와 K의 성분을 토큰 위치에 따라 회전하는 방법과, 상대 위치가 Attention 점수에 반영되는 과정을 살펴봅니다.
공통 · 2026-09-10MoE: 토큰마다 사용할 MLP 선택하기
Dense MLP와 MoE를 비교하고, Router의 선택과 가중치 계산부터 Dispatch, Expert 계산, Combine, Shared expert까지 살펴봅니다.
공통 · 2026-09-10모델 전체 흐름 다시 보기
Embedding부터 LM Head까지 구성 요소를 연결하고, Attention과 MLP·MoE의 역할과 토큰 사이의 정보가 합쳐지는 위치를 정리합니다.
공통 · 2026-09-10CPU와 GPU: 모델의 계산을 실행하는 두 장치
GPU를 사용하는 이유와 CPU·GPU의 구조 차이를 살펴보고, Host·Device의 실행 흐름과 데이터 공급의 중요성을 설명합니다.