← 인텔리전스 대시보드
개념 인터랙티브 AI 모델 → 인프라 구조 · 2026-07-24 정리

AI와 그 인프라 구조 — 학습·추론에서 계층·병렬화, GPU 랙까지 한 장에

아래 한 장 지도에서 모듈을 누르면 그 부분의 상세 + 관련 문서(뉴스레터 변환본) + 관련 신호가 바로 아래 열린다.

빠른 찾기

★ 전체 구조 한 칸에 — 모듈을 눌러보세요

국면학습추론Prefill = 연산 병목 · Decode = 대역폭 병목클릭 ▾
AI 모델 (LLM)
Layer N — Transformer Block × 수십
① Attention — 토큰 간(가로)클릭 ▾
MHA·GQATPHead 단위 · 계보 MHA→MQA→GQA→MLA→선형
② MLP / FFN — 토큰 내부(세로)클릭 ▾
DenseMoEEPExpert 단위
↓ 이 분할을 여러 GPU에 태움 (병렬) ↓
5D 병렬DP · TP · PP · EP · SP클릭 ▾
↓ 물리 하드웨어에 얹음 ↓
GPU Rubin·HBM4 Tray +Vera Rack NVL72 스케일업 Pod 스케일아웃 팩토리
클릭 ▾
메모리 소비 · 전 구간가중치(정적) · KV 캐시(동적 — 컨텍스트×배치)클릭 ▾
정밀도 · 전 구간FP32 → BF16 → FP8 → FP4클릭 ▾
파란=구조적(모델 효율화) · 주황=병렬(인프라 분산) — 모듈 클릭 시 아래에 상세·문서·신호

국면 — 학습 vs 추론, Prefill vs Decode

어느 국면·단계냐가 병목을 정한다 — 학습·Prefill은 연산(FLOPs), Decode는 메모리 대역폭.

AI 모델을 쓰는 방식은 두 국면. 추론은 다시 두 단계로 쪼개진다. 어느 국면·단계냐가 병목과 핵심 기법을 정한다.

국면·단계연산 방식병목핵심 기법
학습순전파+역전파, 대배치FLOPs (compute)TP·EP·PP·DP 병렬 + MoE
Prefill입력 토큰 동시 처리 (GEMM)FLOPs (compute)TP·MoE · 전용칩(Rubin CPX)
Decode토큰 1개씩 순차 생성메모리 대역폭 (KV·가중치)GQA·선형어텐션 · NVL72 스케일업

Prefill=연산, Decode=대역폭 → 그래서 추론을 Prefill/Decode로 분리(disaggregation)해 서로 다른 하드웨어에 태운다.

① Attention — 토큰 간 맥락, KV를 줄이는 진화

토큰 간(가로) 맥락 연산. 계보 전체가 KV 캐시를 줄이는 방향 — MHA→MQA→GQA→MLA→선형.

Inter-token 정보 교환 — 문장 내 다른 모든 토큰을 둘러봐 맥락을 잡는다. 나누는 단위는 Head.

MHA / GQA 구조적
MHA: Q·K·V Head 1:1:1. GQA: 여러 Query Head가 1개 K/V Head 그룹 공유 → KV Cache 메모리 절감.
TP · Tensor Parallel 병렬
연산을 Head 단위로 쪼개 여러 GPU가 동시 수행 (예: 32 Head → 4 GPU가 8개씩).

어텐션 변종은 KV Cache를 줄이는 방향으로 진화 — Decode 대역폭 병목이 동력.

MHAMQAGQAMLA선형/SSM KDA·Mamba
변종K/V 처리KV Cache대표
MHAQ·K·V Head 1:1:1최대초기 GPT
MQA모든 Query가 K/V 1개 공유최소 (품질 손실)PaLM
GQA그룹별 K/V 공유 (절충)중간Llama 2/3
MLAK/V를 저차원 latent로 압축대폭↓ + 품질 유지DeepSeek V2~V4
선형/SSM선형복잡도 상태로 압축상태 고정 (대역폭 10배↓)Kimi K3 KDA, Mamba

② MLP / FFN — 토큰 내부 가공, Dense에서 MoE로

토큰 내부(세로) 특징 가공. Dense→MoE로 파라미터 용량은 키우되 실제 FLOPs는 라우팅으로 절감.

Intra-token 특징 변환 — 각 토큰이 독립적으로 지식·의미를 깊게 가공. 나누는 단위는 Expert.

Dense 기존
모든 토큰이 단 하나의 거대한 MLP 가중치를 통과.
MoE · Mixture of Experts 구조적
MLP를 통째로 여러 개 복사해 독립 Expert로 분할. Router가 토큰별 1~2개만 선택 → 파라미터 용량↑, 실제 FLOPs는 절감.
EP · Expert Parallel 병렬
MoE의 각 Expert를 서로 다른 GPU에 분산 배치.

병렬화 완전체 — 5D 병렬

학습·대규모 추론은 DP·TP·PP·EP·SP 5개 축을 겹쳐 쓴다 — 각기 다른 축·통신·무대.

TP·EP는 병렬의 일부. 학습·대규모 추론은 아래 5개 축을 겹쳐서 쓴다.

병렬나누는 축통신 패턴주 무대
DP Data배치 (모델 복제)gradient all-reduce스케일아웃
TP Tensor 병렬레이어 가중치 (Head·Matrix)activation all-reduce스케일업
PP Pipeline레이어 (깊이)activation P2P스케일아웃
EP Expert 병렬MoE Expertall-to-all스케일업/아웃 혼합
SP Sequence시퀀스 (토큰 축)ring / all-gather초장문 컨텍스트

프론티어 학습은 5D를 동시에 겹침 — 예: MoE 세계기록(GB300 NVL72).

물리 계층 — GPU → 랙 → 클러스터, 스케일업 vs 스케일아웃

NVLink로 묶인 랙(NVL72) 안은 스케일업, 랙 밖은 스케일아웃 — 이 경계가 병렬 기법을 가른다.

NVLink로 묶인 랙(NVL72) 안은 스케일업, 랙과 랙 사이는 스케일아웃. 이 경계가 병렬 기법이 갈리는 선.

AI 팩토리 (데이터센터) — Pod 여러 개
Pod / 클러스터 — Ethernet·InfiniBand스케일아웃
Rack = NVL72 — 72 Rubin GPU + 36 Vera CPU, NVLink스케일업
└ Compute Tray — Vera CPU 1 + Rubin GPU 2 (NVLink-C2C, 액냉)
└ GPU (Rubin) — HBM4 288GB · NVLink 6 (3.6TB/s)

스케일업

노드 내부 · 초고대역

NVLink · NVL72
통신 잦은 TP·EP. 대역폭 벽을 노드 안에서 해결.

스케일아웃

노드 간 · 대수 확장

Spectrum-X · IB · RNG
통신 덜한 DP·PP. 클러스터 규모로.

GPU 자체 내부 구조는 GPU 구조 시뮬레이터 ↗.

정밀도·양자화 — FP16 → FP4

비트를 줄여 메모리·대역폭·용량을 산다 — FP32→BF16→FP8→FP4, Decode 대역폭 병목에 특효.

비트↓ = 메모리·대역폭·용량↓, 처리량↑. Decode(대역폭 병목)에 특효. 학습 BF16/FP8, 추론 FP8/FP4.

FP32 기준BF16 학습 표준FP8 Hopper~FP4 NVFP4·MXFP · Blackwell·Rubin

품질 손실은 블록 스케일링(MXFP)·LUT로 방어. 단 비트를 줄여도 용량은 남는다 — Kimi K3 2.8T는 FP4로 눌러도 단일 B200에 안 들어가 NVL72급 필요. Rubin은 NVFP4 50PFLOPS.

메모리 소비 — 가중치(정적) vs KV 캐시(동적)

추론 메모리 = 가중치(정적·고정비) + KV 캐시(동적·변동비). 이 둘이 배치·컨텍스트 한계를 정한다.

추론 중 GPU HBM을 채우는 건 크게 . 이 둘의 합이 배치 크기·컨텍스트 한계와 Decode 대역폭 병목을 정한다.

구성성격크기 결정줄이는 법
Model Weight
가중치
정적 — 요청과 무관, 항상 상주 (고정비)파라미터 수 × 비트폭
(예: 1.6T FP4 ≈ 800GB)
양자화(FP8·FP4) · MoE(활성 파라미터↓)
KV Cache동적 — 토큰마다 누적, 요청별 (변동비)레이어 × 2 × K/V차원 × 컨텍스트 × 배치 × 비트폭GQA·MLA(K/V 압축) · 선형/SSM(상태 고정) · 양자화

가중치는 한 번 올리면 끝인 고정비, KV 캐시는 긴 컨텍스트·큰 배치일수록 폭증하는 변동비. 그래서 어텐션 계보(MHA→MLA→선형)와 양자화는 모두 가중치·KV를 HBM 대역폭 안에 욱여넣는 싸움이다. 용량이 한 GPU를 넘으면 TP·스케일업(NVL72)으로 분산.

세 번째 소비원 = 활성화(Activation) — 레이어 통과 중 생기는 중간 텐서. 추론에선 쓰고 바로 버려 작지만(그래서 위 표는 가중치·KV 둘로 압축), 학습에선 역전파용으로 전부 붙잡아야 해 급증 + 그래디언트·옵티마이저 상태까지 얹힌다 → 활성화 체크포인팅(재계산)으로 방어. ※ MoE의 "활성 파라미터"는 이와 다른 개념(가중치 중 실제 켜지는 몫).

연결 — 가중치: TP(레이어 가중치 분할)·MoE로 다룸(② MLP). KV 캐시: 어텐션 변종·SP(시퀀스 분할)로 다룸(① Attention). 정밀도(FP4)는 둘 다에 작용.

★ 종합 치트시트 — AI 모델 × 인프라 한 장 (펼치기)

4개 축이 직교 — 블록(Attn/MLP) · 유형(구조적/병렬) · 단계(학습/Prefill/Decode) · 네트워크(스케일업/아웃).

핵심 단계기법블록·대상유형물리목적 한 줄
학습DP배치 (모델 복제)병렬스케일아웃데이터 병렬 처리
학습PP레이어 깊이병렬스케일아웃레이어 깊이 분할
학습·PrefillTPAttn·MLP 가중치병렬스케일업큰 연산을 GPU에 분산
학습·추론EPMoE Expert병렬업+아웃Expert를 GPU에 분산
전 단계MoEMLP 전체구조적FLOPs 고정, 모델 용량↑
DecodeGQA·MLA·선형Attention K/V구조적노드 무관KV Cache↓ = 대역폭 절감
Decode양자화가중치·활성 비트폭구조적메모리·대역폭↓, 처리량↑
장문SP시퀀스 (토큰축)병렬업+아웃컨텍스트 길이 확장
구조적 (모델 · 메모리·FLOPs 절감) 병렬 (인프라 · GPU 분산) Attention · Prefill MLP · Decode
한 장 지도에서 모듈 클릭 → 상세·관련 문서(뉴스레터 변환본)·신호. 코퍼스 문서는 gen_conceptmap_docs.py로 자동 갱신. 블로그·세미나 자료로 재사용 가능.