LLM 그리고 GPU 2026년 7월

LLM Landscape · Document 2 of 2

LLM 자체 구동 서버 자원 산출

B300 · H200 · H100 8-GPU 노드를 기준점으로, 오픈웨이트 모델 8종을 사내에서 직접 서빙할 때 몇 대가 필요하고, KV 캐시로 컨텍스트를 얼마나 운영할 수 있으며, 동시에 몇 명을 받을 수 있는지 산출합니다. 모델 목록과 API 단가는 1번 문서를 따릅니다.

작성 기준일 2026-07-22 장비가 기준 2026 상반기 견적 · Q1 앵커가 환율 1 USD = 1,480원 (2026-07 중순) 전기요금 173원/kWh PUE 1.4 감가 3년
← 문서 1: LLM 모델 카탈로그 & API 단가

01결론부터

가장 경제적인 단일 노드
B300 × 8, 1대
2,304GB HBM · FP4로 1.6T 모델까지 단일 노드 수용 · $350K / 5.18억원
HBM이 곧 병목
가중치 → KV 순
GLM-5.2를 H200 1대에 올리면 KV 풀이 271GB만 남아 128K 동시 세션 11개가 한계
현실적 스위트스팟
Kimi K2.7 · B300 1대
32K 컨텍스트 동시 1,366 스트림 = 사내 약 17,000명 · 손익분기 가동률 3.3%
자체 구동이 손해인 경우
gpt-oss-120b
API 단가가 너무 싸서(단위 $0.066) H200·H100에서는 100% 가동해도 API를 못 이깁니다
세 줄 요약.
  • 대형 MoE는 B300 아니면 답이 없습니다. FP4 네이티브 지원으로 가중치가 절반이 되고, 남은 HBM이 전부 KV 캐시가 됩니다. 같은 모델을 H200에 올리면 노드가 2~4배 필요합니다.
  • “몇 명 수용”은 KV 캐시와 처리량 중 더 낮은 쪽이 정합니다. 짧은 컨텍스트에서는 처리량이, 128K 이상에서는 KV 캐시가 먼저 바닥납니다.
  • 자체 구동의 승부처는 가동률입니다. 손익분기 가동률이 20% 아래면 도입 근거가 분명하고, 60%를 넘으면 API가 낫습니다.

02기준 서버 하드웨어

시장에서 가장 많이 팔리는 8-GPU SXM 베이스보드 노드 형태를 기준점으로 잡았습니다. 세 구성 모두 CPU 2소켓 · DDR5 2TB · NVMe 8본 · 400G 이상 NIC 8장이라는 같은 골격을 쓰고, GPU와 전력만 달라집니다.

HGX / DGX B300 8-GPU
Blackwell Ultra · 2026년 신규 도입 표준
GPU
8 × B300 SXM 288GB HBM3e
노드 HBM
2,304 GB @ 8.0 TB/s
연산
144 PFLOPS (FP4 sparse)
CPU
2 × Xeon 6776P (64C · 3.6GHz)
시스템 메모리
2 TB DDR5 (최대 4 TB)
네트워크
8 × ConnectX-8 (800G)
스토리지
8 × 3.84TB NVMe Gen5
소비 전력
14.5 kW
정밀도
NVFP4 / FP8 네이티브
$300,000 ~ $350,000
₩4.44억 ~ ₩5.18억 / 1대
본 문서 계산 기준값 $350,000 (₩5.18억)
가격 성격 DGX 리스트 앵커가 (공급사 제시)
기준일 2026 Q1 최초 · 2026-07 시점 유지 확인
참고 GPU 단품 $53,000/장 (2026-07) → 8장 $424,000
HGX H200 8-GPU
Hopper 141GB · 현재 가장 널리 깔린 추론 노드
GPU
8 × H200 SXM5 141GB HBM3e
노드 HBM
1,128 GB @ 4.8 TB/s
연산
~32 PFLOPS (FP8 sparse)
CPU
2 × Xeon 8480C (56C) 또는 EPYC 9004
시스템 메모리
2 TB DDR5
네트워크
8 × ConnectX-7 (400G)
스토리지
8 × 3.84TB NVMe
소비 전력
10.2 kW
정밀도
FP8 네이티브 (FP4 미지원)
$320,000 ~ $420,000
₩4.74억 ~ ₩6.22억 / 1대
본 문서 계산 기준값 $370,000 (₩5.48억) · GPU당 환산 $46,000
가격 성격 OEM 통합 견적 (수요·할당이 반영된 실거래대)
기준일 2026년 상반기 견적 · 2026-07 조사
참고 H200 SXM5/NVL 단품 $31,000~$40,000 · 2025-10→2026-03 계약가 약 +40%
HGX H100 8-GPU
Hopper 80GB · 중고·기존 자산 활용 기준선
GPU
8 × H100 SXM5 80GB HBM3
노드 HBM
640 GB @ 3.35 TB/s
연산
~32 PFLOPS (FP8 sparse)
CPU
2 × Xeon 8480C (56C) 또는 EPYC 9004
시스템 메모리
2 TB DDR5
네트워크
8 × ConnectX-7 (400G)
스토리지
8 × 3.84TB NVMe
소비 전력
10.2 kW
정밀도
FP8 네이티브 (FP4 미지원)
$250,000 ~ $320,000
₩3.70억 ~ ₩4.74억 / 1대
본 문서 계산 기준값 $285,000 (₩4.22억) · GPU 단품 $25,000~40,000
가격 성격 OEM 통합 견적
기준일 2026년 상반기 견적 · 2026-07 조사
참고 공급 완화 시 단품 $20,000선 전망도 병존 — 출처 간 편차 큼

왜 신형 B300이 구형 H200보다 싸게 나오나

표를 그대로 읽으면 B300 8-GPU($350K) < H200 8-GPU($370K)가 됩니다. 신형이 구형보다 싸다는 뜻이 아니라, 두 숫자가 애초에 다른 종류의 가격이기 때문입니다. 이 절은 그 차이를 분해합니다 — 조달 협상에 그대로 쓰는 근거가 됩니다.

구분B300 8-GPUH200 8-GPU의미
가격의 성격DGX 리스트 앵커가OEM 통합 견적가앞은 공급사가 제시한 값, 뒤는 수요·할당이 반영된 값. 후자가 시장 현실에 가깝습니다.
기준 시점2026 Q1 설정 → 2026-07 유지2026 상반기 견적앵커가는 반년 넘게 고정된 값이라 최근 수급을 반영하지 못합니다.
수급 상태하이퍼스케일러 선구매가 Q3 2026까지 물량 흡수Hopper 물량 Q3 2026까지 소진둘 다 품귀입니다. 리스트가에 살 수 있다는 보장이 없습니다.
메모리 원가288GB HBM3e141GB HBM3e2026년 HBM3e 계약가가 약 20% 인상(2025-12 발표)되어 양쪽 모두 원가가 올랐습니다.
최근 가격 추세앵커가 변동 없음2025-10 → 2026-03 약 +40%H200 가격은 실제로 올랐고, B300 표기가는 안 움직였습니다. 역전은 여기서 생깁니다.
단품가 정합성$53,000 × 8 = $424,000$31,000~$40,000 × 8B300은 단품 합이 시스템 앵커가를 초과합니다. 앵커가가 현재 조달 현실과 어긋난다는 직접 증거입니다.
결론: B300이 실제로 더 싸다고 읽으면 안 됩니다. 실조달가는 B300 ≥ H200이 정상이며, 표의 역전은 출처 간 가격 종류·기준일 차이에서 생긴 인공물입니다. 본 문서는 출처 값을 임의로 보정하지 않고 그대로 두되, 계산 기준값을 명시하고 이 한계를 여기에 남깁니다.
  • 이 문서의 CAPEX·TCO·손익분기 숫자는 위 기준값을 그대로 쓴 결과입니다. B300 실구매가가 $450K라면 B300 열의 CAPEX·TCO는 약 1.3배, 손익분기 가동률도 그만큼 올라갑니다.
  • 실제 구매 판단은 반드시 OEM 실견적으로 하십시오. 동일 사양에서도 OEM 간 스프레드가 최대 25%입니다(Supermicro 최저, Dell·HPE는 지원 등급에 따른 프리미엄).
  • 견적을 받을 때는 가격의 종류를 명시해 요청하십시오 — 리스트가인지, 할당 포함 실납품가인지, 리드타임이 몇 주인지. 품귀 국면에서는 가격보다 납기가 실질 제약인 경우가 많습니다.
  • H100은 공급 완화 시 단품 $20,000선 전망도 병존해 출처 간 편차가 가장 큽니다. 중고·기존 자산 활용 시나리오는 별도 실사가 필요합니다.
이 문서에 쓰인 모든 기준값과 그 기준일
  • B300 8-GPU $350,000 — DGX 앵커가 상단 · 2026 Q1 설정, 2026-07 유지 확인
  • H200 8-GPU $370,000 — OEM 통합 견적 통상값($320K~$420K) · 2026 상반기
  • H100 8-GPU $285,000 — OEM 통합 견적 통상값($250K~$320K) · 2026 상반기
  • 환율 1 USD = 1,480원 — 2026-07 중순 USD/KRW 1,475~1,480원대
  • 산업용 전기 173원/kWh — 2026년 국내 산업용 기준
  • 처리량 계수 — vLLM·SGLang의 8×H200 DeepSeek 계열 실측(2,700~6,300 tok/s) · 2025-12~2026 공개분
  • 모델 스펙·API 단가 — 2026-07-21 조사분 (문서 1 기준)
  • 문서 작성 기준일 — 2026-07-22

03산출 방법론

아래 다섯 개 식이 이 문서의 모든 숫자를 만듭니다. 가정값을 바꾸고 싶으면 이 식을 그대로 다시 계산하면 됩니다.

① 가용 HBM 가용 HBM = 노드 HBM × 노드 수 × 0.90 // vLLM gpu_memory_utilization② 가중치 점유 가중치(GB) = 총 파라미터(B) × 정밀도 바이트 // FP8=1.0, NVFP4=0.5 필요 노드 수 = ceil( 가중치 × 1.15 ÷ 노드 가용 HBM ) → 2의 거듭제곱으로 정렬③ KV 캐시 풀 — 남는 것이 전부 KV KV 풀 = 가용 HBM − 가중치 KV/토큰(GQA) = 2 × 층수 × KV헤드 × head_dim × 1바이트(FP8) KV/토큰(MLA) = 층수 × 576 × 1바이트 // 압축 잠재벡터 512 + RoPE 64④ 동시 수용 — 두 상한 중 낮은 쪽 KV 상한 = KV 풀 ÷ (KV/토큰 × 평균 컨텍스트) 처리량 상한 = 총 출력 처리량(tok/s) ÷ 25 tok/s // 1인당 체감 쾌적 속도 동시 스트림 = min(KV 상한, 처리량 상한) 수용 사용자 = 동시 스트림 ÷ 0.08 // 등록자 중 동시에 생성 중인 비율⑤ 3년 총소유비용 TCO = CAPEX + (kW × 1.4 × 8,760h × 3년 × 173원) + CAPEX × 5% × 3년 손익분기 가동률 = 자체 구동 단가 ÷ API 단가 // 단위 = 입력 1M + 출력 200K
처리량 계수는 실측 벤치마크에 맞춰 보정했습니다. DeepSeek급 MoE(37B 활성) 기준 단일 8-GPU 노드 출력 처리량을 H200 = 5,000 tok/s(vLLM 2,700 ~ SGLang 6,300 실측 구간의 중앙), H100 = 3,440 tok/s(메모리 대역폭 비례), B300 = 12,000 tok/s(대역폭 1.67배 × FP4 이득)로 두고, 모델별로 37 ÷ 활성 파라미터(상한 3.5배)로 스케일했습니다. 소형 밀집 모델은 TP가 아니라 복제(replica) 배치를 전제로 2.2배 보정했습니다.

04모델 × 노드 배치 매트릭스

오픈웨이트 8종 각각에 대해, 세 가지 노드로 최소 구성을 잡았을 때의 결과입니다. 칩으로 평균 컨텍스트 32K · 128K · 256K를 전환할 수 있습니다 — 컨텍스트가 길어지면 KV 캐시가 먼저 바닥나 수용량이 급락합니다.

모델노드대수GPUHBM 배분 (GB)KV 캐시32K 컨텍스트 기준비용
가용가중치KV 풀KB/토큰GB/세션동시 스트림병목처리량 tok/s수용 사용자CAPEX3년 TCO

병목 열이 KV면 메모리가, 처리량이면 연산이 먼저 한계에 닿습니다 — 전자는 HBM을 늘려야 하고 후자는 노드를 늘려야 합니다. 는 모델의 최대 컨텍스트를 초과해 해당 길이를 운영할 수 없다는 뜻입니다. 가중치는 B300=NVFP4, H200/H100=FP8 기준입니다(gpt-oss-120b는 원본이 MXFP4라 모든 노드에서 0.5바이트). 수용 사용자는 아래 §05의 SLA·피크 동시율 설정을 그대로 따릅니다.

05실제로 몇 명을 받을 수 있나

최소 구성 1세트가 감당하는 실사용자 수입니다. 아래 두 값을 구분해서 보십시오 — 이 구분을 놓치면 필요 대수를 열 배 이상 잘못 잡습니다.

동시 스트림
지금 이 순간 토큰을 생성 중인 세션 수
하드웨어가 물리적으로 감당하는 값. KV 캐시 용량과 처리량 중 낮은 쪽이 상한을 정합니다.
수용 사용자
계정을 주고 쓰게 할 수 있는 인원
사람은 읽고 생각하는 시간이 대부분이라 항상 생성 중이지 않습니다. 동시 스트림 ÷ 피크 동시율로 환산합니다.

SLA를 올리면 1인이 더 많은 연산을 점유해 수용 인원이 줄고, 피크 동시율을 올리면 같은 하드웨어로 받을 수 있는 등록 인원이 줄어듭니다. 기본값 25 tok/s · 8%는 사내 업무형 챗봇 기준이며, 코드 자동완성처럼 지연에 민감하면 SLA를 60 이상으로 올려야 합니다. 이 설정은 §04 매트릭스와 §07 계산기에도 함께 반영됩니다.

B300 8-GPU H200 8-GPU H100 8-GPU
모델노드구성KV 한계처리량 한계동시 스트림병목수용 사용자1인당 CAPEX

KV 한계와 처리량 한계 중 작은 값이 동시 스트림이 됩니다. 1인당 CAPEX = 장비 구입비 ÷ 수용 사용자로, 같은 예산이 몇 명을 커버하는지 비교하는 값입니다.

06KV 캐시와 컨텍스트 운영 한계

KV 캐시는 토큰 1개당 고정 바이트 × 컨텍스트 길이 × 동시 세션 수로 선형 증가합니다. 같은 HBM이라도 어텐션 구조에 따라 수용량이 5배 이상 갈립니다 — MLA(압축 잠재 어텐션)를 쓰는 DeepSeek·Kimi 계열이 압도적으로 유리합니다. 아래 표의 4K~1M 칸은 사람 수가 아니라 “메모리에 동시에 얹을 수 있는 대화 개수”입니다. 사람 수로 환산한 값은 §05에 있습니다.

모델어텐션 구조층 수토큰당 KV
KB / 토큰
KV 풀
GB
컨텍스트 길이별 동시 세션 수 (개)
KV 캐시 용량만 본 값 · 처리량 상한 미적용 · 사람 수가 아님
가정
4K32K128K256K1M
이 표의 숫자는 “사람 수”가 아니라 “세션 수”입니다. 4K~1M 열은 해당 길이의 대화를 KV 캐시에 동시에 얹어 둘 수 있는 개수이고, 연산 처리량은 고려하지 않은 메모리 상한만의 값입니다. 실제 수용 인원은 여기서 두 단계를 더 거칩니다.
  • ① 처리량 상한과 비교 — 위 세션 수와 처리량 ÷ SLA작은 쪽이 실제 동시 스트림입니다. 짧은 컨텍스트에서는 메모리가 남아돌아 처리량이 먼저 막히므로, 이 표의 숫자보다 훨씬 적게 잡힙니다.
  • ② 피크 동시율로 환산 — 사람은 대부분의 시간을 읽고 생각하며 보내므로, 동시 스트림을 ÷ 피크 동시율 해야 등록 사용자 수가 됩니다.
  • 예시 (B300 1대 · Kimi K2.7 · 32K) — 이 표에서는 1,844세션이지만, 처리량 상한 1,366이 더 낮아 실제 동시 스트림은 1,366, 피크 8%를 적용한 수용 인원은 약 17,000명입니다. 두 단계를 모두 적용한 값은 §05에 있습니다.

모델의 최대 컨텍스트를 넘는 칸은 입니다. 숫자 색: 20 미만은 사실상 운영 불가, 100 미만은 소수 인원 전용입니다.

이 표의 KB/토큰 값은 추정입니다. 2026년 신규 모델의 층수·KV 헤드 수·head_dim은 공개 스펙이 확정되지 않아, 같은 계보 이전 세대(DeepSeek V3 61층 MLA, GLM-4.5 GQA 8헤드, Gemma 3의 5:1 슬라이딩 윈도우)에서 외삽했습니다. 실제 배포 전에는 config.jsonnum_hidden_layers · num_key_value_heads · head_dim을 읽어 위 ③식으로 다시 계산하십시오. 이 값이 2배 틀리면 동시 세션 수도 정확히 2배 틀립니다.

07도입 규모 계산기

사내 사용자 수를 넣으면 모델별로 필요한 노드 대수와 투자비가 나옵니다. 최소 구성을 통째로 복제하는 방식으로 확장했습니다. 피크 동시율과 평균 컨텍스트는 여기서 바로 조정할 수 있고, §05의 같은 항목과 값이 연동됩니다. 체감 속도 SLA만 §05에서 설정합니다.

모델필요 동시 스트림1세트 수용복제 세트총 노드 대수총 GPU소비 전력CAPEX (₩)3년 TCO (₩)사용자 1인당 3년 (₩)

08자체 구동 vs API — 손익분기 가동률

“장비를 몇 % 채워 써야 API보다 싸지는가”입니다. 낮을수록 자체 구동이 유리합니다. 100%는 아무리 채워 써도 API를 못 이긴다는 뜻입니다. 단위는 입력 100만 + 출력 20만 토큰.

B300 H200 H100 20% 미만 = 도입 근거 명확
모델API 단가 (₩/단위)B300 자체 단가손익분기H200 자체 단가손익분기H100 자체 단가손익분기판단

09가정과 한계

이 문서의 숫자는 조달 견적서가 아니라 설계 착수용 1차 추정입니다. 다음 항목이 실측과 다를 수 있습니다.
  • 모델 아키텍처 스펙 미확정 — 층수·KV 헤드 수는 이전 세대 외삽입니다(§06 참조). 가장 큰 오차 요인입니다.
  • Kimi K3의 활성 파라미터 미공개 — 50B로 가정했습니다. 실제가 100B면 처리량이 절반이 됩니다.
  • 처리량은 엔진·설정에 크게 좌우됩니다 — 같은 하드웨어에서 vLLM과 SGLang이 2~3배 차이 납니다(SGLang이 MLA 최적화로 DeepSeek 계열에서 유리). 청크 프리필·Wide-EP·분리 서빙 적용 여부로 다시 갈립니다.
  • 25 tok/s SLA와 8% 피크 동시율은 가정입니다 — 코드 자동완성처럼 지연에 민감한 워크로드라면 SLA를 60 tok/s로 올려야 하고, 그러면 수용 인원이 절반 이하로 떨어집니다.
  • 네트워크·스토리지·랙 인프라 비용 제외 — 다중 노드 구성에는 InfiniBand/Spectrum-X 스위치와 케이블링이 추가됩니다. 8노드 이상이면 노드 가격의 10~15%를 별도로 잡으십시오.
  • 냉각과 상면이 실제 제약일 수 있습니다 — B300 1대가 14.5kW입니다. 국내 일반 IDC 랙 공급 전력(4~8kW)으로는 랙당 1대도 어렵고, 고밀도 랙 또는 수랭 도입이 전제됩니다.
  • 인건비·MLOps 운영비 미반영 — CAPEX의 5%/년으로 뭉뚱그렸습니다. 실제 전담 인력 2~3명 인건비는 여기에 포함되지 않습니다.
  • API 단가는 프로모션가가 섞여 있습니다 — 1번 문서 §06의 경고가 그대로 적용됩니다. API 정가가 오르면 손익분기 가동률은 더 낮아집니다(자체 구동에 유리).

10출처

· NVIDIA B300 (Blackwell Ultra) Specs & Pricing 2026 · B300 288GB HBM3e 스펙 · DGX B300 시스템 구성
· H200 8-GPU HGX 시스템 가격 (2026) · H100 8-GPU HGX 시스템 가격 (2026) · NVIDIA AI GPU 가격 가이드
· vLLM Large Scale Serving — DeepSeek Wide-EP · DeepSeek-V3.2 on 8×H200 처리량 실측 · SGLang vs vLLM (2026)
· HGX 데이터센터 물리 요구사항 (전력·냉각)
· HBM3e 2026년 약 20% 인상 (2025-12-24) · 2026 GPU 가격·수급 분석 · B300 vs H200 사양·가격 대조 — §02 가격 역전 분해의 근거
· 전기요금: 2026년 국내 산업용 약 173원/kWh · 환율: 2026년 7월 중순 USD/KRW 1,475~1,480원
· 모델 스펙·API 단가: 문서 1 및 그 출처 목록

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다