LLM 자체 구동 서버 자원 산출
B300 · H200 · H100 8-GPU 노드를 기준점으로, 오픈웨이트 모델 8종을 사내에서 직접 서빙할 때 몇 대가 필요하고, KV 캐시로 컨텍스트를 얼마나 운영할 수 있으며, 동시에 몇 명을 받을 수 있는지 산출합니다. 모델 목록과 API 단가는 1번 문서를 따릅니다.
01결론부터
- 대형 MoE는 B300 아니면 답이 없습니다. FP4 네이티브 지원으로 가중치가 절반이 되고, 남은 HBM이 전부 KV 캐시가 됩니다. 같은 모델을 H200에 올리면 노드가 2~4배 필요합니다.
- “몇 명 수용”은 KV 캐시와 처리량 중 더 낮은 쪽이 정합니다. 짧은 컨텍스트에서는 처리량이, 128K 이상에서는 KV 캐시가 먼저 바닥납니다.
- 자체 구동의 승부처는 가동률입니다. 손익분기 가동률이 20% 아래면 도입 근거가 분명하고, 60%를 넘으면 API가 낫습니다.
02기준 서버 하드웨어
시장에서 가장 많이 팔리는 8-GPU SXM 베이스보드 노드 형태를 기준점으로 잡았습니다. 세 구성 모두 CPU 2소켓 · DDR5 2TB · NVMe 8본 · 400G 이상 NIC 8장이라는 같은 골격을 쓰고, GPU와 전력만 달라집니다.
- GPU
- 8 × B300 SXM 288GB HBM3e
- 노드 HBM
- 2,304 GB @ 8.0 TB/s
- 연산
- 144 PFLOPS (FP4 sparse)
- CPU
- 2 × Xeon 6776P (64C · 3.6GHz)
- 시스템 메모리
- 2 TB DDR5 (최대 4 TB)
- 네트워크
- 8 × ConnectX-8 (800G)
- 스토리지
- 8 × 3.84TB NVMe Gen5
- 소비 전력
- 14.5 kW
- 정밀도
- NVFP4 / FP8 네이티브
기준일 2026 Q1 최초 · 2026-07 시점 유지 확인
참고 GPU 단품 $53,000/장 (2026-07) → 8장 $424,000
- GPU
- 8 × H200 SXM5 141GB HBM3e
- 노드 HBM
- 1,128 GB @ 4.8 TB/s
- 연산
- ~32 PFLOPS (FP8 sparse)
- CPU
- 2 × Xeon 8480C (56C) 또는 EPYC 9004
- 시스템 메모리
- 2 TB DDR5
- 네트워크
- 8 × ConnectX-7 (400G)
- 스토리지
- 8 × 3.84TB NVMe
- 소비 전력
- 10.2 kW
- 정밀도
- FP8 네이티브 (FP4 미지원)
기준일 2026년 상반기 견적 · 2026-07 조사
참고 H200 SXM5/NVL 단품 $31,000~$40,000 · 2025-10→2026-03 계약가 약 +40%
- GPU
- 8 × H100 SXM5 80GB HBM3
- 노드 HBM
- 640 GB @ 3.35 TB/s
- 연산
- ~32 PFLOPS (FP8 sparse)
- CPU
- 2 × Xeon 8480C (56C) 또는 EPYC 9004
- 시스템 메모리
- 2 TB DDR5
- 네트워크
- 8 × ConnectX-7 (400G)
- 스토리지
- 8 × 3.84TB NVMe
- 소비 전력
- 10.2 kW
- 정밀도
- FP8 네이티브 (FP4 미지원)
기준일 2026년 상반기 견적 · 2026-07 조사
참고 공급 완화 시 단품 $20,000선 전망도 병존 — 출처 간 편차 큼
왜 신형 B300이 구형 H200보다 싸게 나오나
표를 그대로 읽으면 B300 8-GPU($350K) < H200 8-GPU($370K)가 됩니다. 신형이 구형보다 싸다는 뜻이 아니라, 두 숫자가 애초에 다른 종류의 가격이기 때문입니다. 이 절은 그 차이를 분해합니다 — 조달 협상에 그대로 쓰는 근거가 됩니다.
| 구분 | B300 8-GPU | H200 8-GPU | 의미 |
|---|---|---|---|
| 가격의 성격 | DGX 리스트 앵커가 | OEM 통합 견적가 | 앞은 공급사가 제시한 값, 뒤는 수요·할당이 반영된 값. 후자가 시장 현실에 가깝습니다. |
| 기준 시점 | 2026 Q1 설정 → 2026-07 유지 | 2026 상반기 견적 | 앵커가는 반년 넘게 고정된 값이라 최근 수급을 반영하지 못합니다. |
| 수급 상태 | 하이퍼스케일러 선구매가 Q3 2026까지 물량 흡수 | Hopper 물량 Q3 2026까지 소진 | 둘 다 품귀입니다. 리스트가에 살 수 있다는 보장이 없습니다. |
| 메모리 원가 | 288GB HBM3e | 141GB HBM3e | 2026년 HBM3e 계약가가 약 20% 인상(2025-12 발표)되어 양쪽 모두 원가가 올랐습니다. |
| 최근 가격 추세 | 앵커가 변동 없음 | 2025-10 → 2026-03 약 +40% | H200 가격은 실제로 올랐고, B300 표기가는 안 움직였습니다. 역전은 여기서 생깁니다. |
| 단품가 정합성 | $53,000 × 8 = $424,000 | $31,000~$40,000 × 8 | B300은 단품 합이 시스템 앵커가를 초과합니다. 앵커가가 현재 조달 현실과 어긋난다는 직접 증거입니다. |
- 이 문서의 CAPEX·TCO·손익분기 숫자는 위 기준값을 그대로 쓴 결과입니다. B300 실구매가가 $450K라면 B300 열의 CAPEX·TCO는 약 1.3배, 손익분기 가동률도 그만큼 올라갑니다.
- 실제 구매 판단은 반드시 OEM 실견적으로 하십시오. 동일 사양에서도 OEM 간 스프레드가 최대 25%입니다(Supermicro 최저, Dell·HPE는 지원 등급에 따른 프리미엄).
- 견적을 받을 때는 가격의 종류를 명시해 요청하십시오 — 리스트가인지, 할당 포함 실납품가인지, 리드타임이 몇 주인지. 품귀 국면에서는 가격보다 납기가 실질 제약인 경우가 많습니다.
- H100은 공급 완화 시 단품 $20,000선 전망도 병존해 출처 간 편차가 가장 큽니다. 중고·기존 자산 활용 시나리오는 별도 실사가 필요합니다.
- B300 8-GPU $350,000 — DGX 앵커가 상단 · 2026 Q1 설정, 2026-07 유지 확인
- H200 8-GPU $370,000 — OEM 통합 견적 통상값($320K~$420K) · 2026 상반기
- H100 8-GPU $285,000 — OEM 통합 견적 통상값($250K~$320K) · 2026 상반기
- 환율 1 USD = 1,480원 — 2026-07 중순 USD/KRW 1,475~1,480원대
- 산업용 전기 173원/kWh — 2026년 국내 산업용 기준
- 처리량 계수 — vLLM·SGLang의 8×H200 DeepSeek 계열 실측(2,700~6,300 tok/s) · 2025-12~2026 공개분
- 모델 스펙·API 단가 — 2026-07-21 조사분 (문서 1 기준)
- 문서 작성 기준일 — 2026-07-22
03산출 방법론
아래 다섯 개 식이 이 문서의 모든 숫자를 만듭니다. 가정값을 바꾸고 싶으면 이 식을 그대로 다시 계산하면 됩니다.
04모델 × 노드 배치 매트릭스
오픈웨이트 8종 각각에 대해, 세 가지 노드로 최소 구성을 잡았을 때의 결과입니다. 칩으로 평균 컨텍스트 32K · 128K · 256K를 전환할 수 있습니다 — 컨텍스트가 길어지면 KV 캐시가 먼저 바닥나 수용량이 급락합니다.
| 모델 | 노드 | 대수 | GPU | HBM 배분 (GB) | KV 캐시 | 32K 컨텍스트 기준 | 비용 | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 가용 | 가중치 | KV 풀 | KB/토큰 | GB/세션 | 동시 스트림 | 병목 | 처리량 tok/s | 수용 사용자 | CAPEX | 3년 TCO | ||||
병목 열이 KV면 메모리가, 처리량이면 연산이 먼저 한계에 닿습니다 — 전자는 HBM을 늘려야 하고 후자는 노드를 늘려야 합니다. — 는 모델의 최대 컨텍스트를 초과해 해당 길이를 운영할 수 없다는 뜻입니다. 가중치는 B300=NVFP4, H200/H100=FP8 기준입니다(gpt-oss-120b는 원본이 MXFP4라 모든 노드에서 0.5바이트). 수용 사용자는 아래 §05의 SLA·피크 동시율 설정을 그대로 따릅니다.
05실제로 몇 명을 받을 수 있나
최소 구성 1세트가 감당하는 실사용자 수입니다. 아래 두 값을 구분해서 보십시오 — 이 구분을 놓치면 필요 대수를 열 배 이상 잘못 잡습니다.
SLA를 올리면 1인이 더 많은 연산을 점유해 수용 인원이 줄고, 피크 동시율을 올리면 같은 하드웨어로 받을 수 있는 등록 인원이 줄어듭니다. 기본값 25 tok/s · 8%는 사내 업무형 챗봇 기준이며, 코드 자동완성처럼 지연에 민감하면 SLA를 60 이상으로 올려야 합니다. 이 설정은 §04 매트릭스와 §07 계산기에도 함께 반영됩니다.
| 모델 | 노드 | 구성 | KV 한계 | 처리량 한계 | 동시 스트림 | 병목 | 수용 사용자 | 1인당 CAPEX |
|---|
KV 한계와 처리량 한계 중 작은 값이 동시 스트림이 됩니다. 1인당 CAPEX = 장비 구입비 ÷ 수용 사용자로, 같은 예산이 몇 명을 커버하는지 비교하는 값입니다.
06KV 캐시와 컨텍스트 운영 한계
KV 캐시는 토큰 1개당 고정 바이트 × 컨텍스트 길이 × 동시 세션 수로 선형 증가합니다. 같은 HBM이라도 어텐션 구조에 따라 수용량이 5배 이상 갈립니다 — MLA(압축 잠재 어텐션)를 쓰는 DeepSeek·Kimi 계열이 압도적으로 유리합니다. 아래 표의 4K~1M 칸은 사람 수가 아니라 “메모리에 동시에 얹을 수 있는 대화 개수”입니다. 사람 수로 환산한 값은 §05에 있습니다.
| 모델 | 어텐션 구조 | 층 수 | 토큰당 KV KB / 토큰 | KV 풀 GB |
컨텍스트 길이별 동시 세션 수 (개)
KV 캐시 용량만 본 값 · 처리량 상한 미적용 · 사람 수가 아님 | 가정 | ||||
|---|---|---|---|---|---|---|---|---|---|---|
| 4K | 32K | 128K | 256K | 1M | ||||||
- ① 처리량 상한과 비교 — 위 세션 수와 처리량 ÷ SLA 중 작은 쪽이 실제 동시 스트림입니다. 짧은 컨텍스트에서는 메모리가 남아돌아 처리량이 먼저 막히므로, 이 표의 숫자보다 훨씬 적게 잡힙니다.
- ② 피크 동시율로 환산 — 사람은 대부분의 시간을 읽고 생각하며 보내므로, 동시 스트림을 ÷ 피크 동시율 해야 등록 사용자 수가 됩니다.
- 예시 (B300 1대 · Kimi K2.7 · 32K) — 이 표에서는 1,844세션이지만, 처리량 상한 1,366이 더 낮아 실제 동시 스트림은 1,366, 피크 8%를 적용한 수용 인원은 약 17,000명입니다. 두 단계를 모두 적용한 값은 §05에 있습니다.
모델의 최대 컨텍스트를 넘는 칸은 — 입니다. 숫자 색: 20 미만은 사실상 운영 불가, 100 미만은 소수 인원 전용입니다.
07도입 규모 계산기
사내 사용자 수를 넣으면 모델별로 필요한 노드 대수와 투자비가 나옵니다. 최소 구성을 통째로 복제하는 방식으로 확장했습니다. 피크 동시율과 평균 컨텍스트는 여기서 바로 조정할 수 있고, §05의 같은 항목과 값이 연동됩니다. 체감 속도 SLA만 §05에서 설정합니다.
| 모델 | 필요 동시 스트림 | 1세트 수용 | 복제 세트 | 총 노드 대수 | 총 GPU | 소비 전력 | CAPEX (₩) | 3년 TCO (₩) | 사용자 1인당 3년 (₩) |
|---|
08자체 구동 vs API — 손익분기 가동률
“장비를 몇 % 채워 써야 API보다 싸지는가”입니다. 낮을수록 자체 구동이 유리합니다. 100%는 아무리 채워 써도 API를 못 이긴다는 뜻입니다. 단위는 입력 100만 + 출력 20만 토큰.
| 모델 | API 단가 (₩/단위) | B300 자체 단가 | 손익분기 | H200 자체 단가 | 손익분기 | H100 자체 단가 | 손익분기 | 판단 |
|---|
09가정과 한계
- 모델 아키텍처 스펙 미확정 — 층수·KV 헤드 수는 이전 세대 외삽입니다(§06 참조). 가장 큰 오차 요인입니다.
- Kimi K3의 활성 파라미터 미공개 — 50B로 가정했습니다. 실제가 100B면 처리량이 절반이 됩니다.
- 처리량은 엔진·설정에 크게 좌우됩니다 — 같은 하드웨어에서 vLLM과 SGLang이 2~3배 차이 납니다(SGLang이 MLA 최적화로 DeepSeek 계열에서 유리). 청크 프리필·Wide-EP·분리 서빙 적용 여부로 다시 갈립니다.
- 25 tok/s SLA와 8% 피크 동시율은 가정입니다 — 코드 자동완성처럼 지연에 민감한 워크로드라면 SLA를 60 tok/s로 올려야 하고, 그러면 수용 인원이 절반 이하로 떨어집니다.
- 네트워크·스토리지·랙 인프라 비용 제외 — 다중 노드 구성에는 InfiniBand/Spectrum-X 스위치와 케이블링이 추가됩니다. 8노드 이상이면 노드 가격의 10~15%를 별도로 잡으십시오.
- 냉각과 상면이 실제 제약일 수 있습니다 — B300 1대가 14.5kW입니다. 국내 일반 IDC 랙 공급 전력(4~8kW)으로는 랙당 1대도 어렵고, 고밀도 랙 또는 수랭 도입이 전제됩니다.
- 인건비·MLOps 운영비 미반영 — CAPEX의 5%/년으로 뭉뚱그렸습니다. 실제 전담 인력 2~3명 인건비는 여기에 포함되지 않습니다.
- API 단가는 프로모션가가 섞여 있습니다 — 1번 문서 §06의 경고가 그대로 적용됩니다. API 정가가 오르면 손익분기 가동률은 더 낮아집니다(자체 구동에 유리).
10출처
· NVIDIA B300 (Blackwell Ultra) Specs & Pricing 2026 · B300 288GB HBM3e 스펙 · DGX B300 시스템 구성
· H200 8-GPU HGX 시스템 가격 (2026) · H100 8-GPU HGX 시스템 가격 (2026) · NVIDIA AI GPU 가격 가이드
· vLLM Large Scale Serving — DeepSeek Wide-EP · DeepSeek-V3.2 on 8×H200 처리량 실측 · SGLang vs vLLM (2026)
· HGX 데이터센터 물리 요구사항 (전력·냉각)
· HBM3e 2026년 약 20% 인상 (2025-12-24) · 2026 GPU 가격·수급 분석 · B300 vs H200 사양·가격 대조 — §02 가격 역전 분해의 근거
· 전기요금: 2026년 국내 산업용 약 173원/kWh · 환율: 2026년 7월 중순 USD/KRW 1,475~1,480원
· 모델 스펙·API 단가: 문서 1 및 그 출처 목록

답글 남기기