LLM 모델 카탈로그 & API 단가 비교
2026년 7월 기준으로 상용 API와 오픈웨이트를 한 표에 놓고, 지능지수 대비 실제 지불 금액으로 비교합니다. 오픈웨이트 모델의 자체 구동 서버 자원 산출은 2번 문서에서 다룹니다.
01한눈에 보기
혼합 비용은 입력 100만 토큰 + 출력 20만 토큰을 1단위로 계산했습니다. 에이전트형 워크로드의 전형적인 입출력 비율입니다.
02지능지수 대비 비용 (가성비 프론티어)
가로축은 로그 스케일 혼합 실비용, 세로축은 지능지수입니다. 왼쪽 위로 갈수록 유리합니다. 채워진 점 10종이 파레토 프론티어 — 그보다 싸면서 더 똑똑한 대안이 존재하지 않는 모델입니다. 빈 원은 지배된(dominated) 모델로, 더 싸고 더 똑똑한 대안이 표 안에 이미 있습니다.
지능지수가 공개되지 않은 모델(Gemini 3.1 Pro, Gemini 3.5 Flash, Grok 4.5, Mistral Large 3, GPT-5.5 Pro, Qwen3.8-Max 등)은 좌표를 만들 수 없어 이 차트에서 제외했고, 아래 표에는 모두 포함했습니다. GLM-5.2의 저가 플랫폼 변형도 중복이라 차트에서만 제외했습니다.
03전체 비교표
열 제목을 클릭하면 정렬됩니다. 칩으로 벤더를 걸러낼 수 있습니다.
| 벤더 | 모델 | 지능지수 | 컨텍스트 | 입력 $/1M | 출력 $/1M | 캐시 $/1M | 혼합 비용 $ | 혼합 비용 ₩ | 가성비 | 비고 |
|---|
가성비 = 지능지수 ÷ 혼합 비용($). 값이 클수록 1달러당 얻는 지능이 큽니다. 컨텍스트 1M = 100만 토큰.
04모델별 특이사항 — 표에 안 담기는 조건들
단가표만 보고 고르면 반드시 틀어지는 항목들입니다. 지금 단가가 유지되지 않거나, 끌 수 없는 동작이 있거나, 라이선스·데이터 정책이 사내 규정과 충돌하거나, 조달 자체가 흔들릴 수 있는 조건을 네 갈래로 정리했습니다.
- Qwen3.8-Max 프리뷰 10% 가격입니다. 정가 전환 시 최대 10배 인상이 예상되므로 이 단가($0.17/$0.51)로 예산을 잡으면 안 됩니다.
- Claude Sonnet 5 인트로 $2/$10은 2026-08-31 종료. 이후 $3/$15로 입력·출력 각 50% 인상됩니다.
- Qwen3.7-Max 현재가는 50% 프로모션가입니다. 정가는 표의 2배로 보아야 합니다.
- Gemini 3.1 Pro 프롬프트가 200K 토큰을 넘으면 입력 2배·출력 1.5배($4/$18)로 점프합니다. 장문 컨텍스트가 주 용도라면 표의 $2/$12는 의미가 없습니다.
- Qwen3.7-Plus · 3.6-Plus 컨텍스트 구간별 누진 단가입니다. 표의 값은 최저 구간이며(~ 표기), 긴 컨텍스트에서는 더 비쌉니다.
- Qwen3.5-Plus 사고 모드에서 출력 $4.00(비사고 $2.40)으로 67% 비싸집니다. 같은 모델인데 모드로 단가가 갈립니다.
- GLM-5.2 같은 모델인데 경로에 따라 입력 $1.00~$1.40입니다. 어느 플랫폼을 쓰느냐가 40% 차이를 만듭니다.
- gpt-oss-120b 오픈웨이트라 정가가 없습니다. 호스팅 사업자별로 단가가 7.8배까지 벌어집니다.
- Claude Fable 5 사고(thinking)가 항상 활성이라 끌 수 없습니다. 한 줄 분류·추출처럼 추론이 필요 없는 작업에도 사고 토큰이 생성되어 출력 토큰으로 과금되므로, 단순 작업일수록 표 단가 대비 실비용 배수가 커집니다.
- Kimi K3 추론을 끌 수 없고, 기본값이 최대 강도(max)입니다. 자세한 계층은 아래 추론 제어 표를 보십시오 — 출시 시점에는 reasoning_effort가 max 한 값으로 고정이었고, 이틀 뒤 low/high가 열렸지만 끄기는 여전히 불가하며 OpenPlatform 기본값은 그대로 max입니다.
- gpt-oss-120b 사고연쇄를 쓰지 않습니다. 단가가 압도적으로 싼 이유가 여기 있습니다 — 추론 토큰을 생성하지 않으니 출력이 짧고, 대신 지능지수가 24.0으로 표에서 가장 낮아 복잡한 추론·에이전트 과제에는 부적합합니다.
- Qwen3.6 27B 명시적 사고연쇄를 출력에 포함합니다. 사고 과정이 응답 본문과 같은 스트림으로 나오므로, 후처리로 걷어내지 않으면 최종 산출물에 섞이고 그 토큰도 출력 단가로 과금됩니다.
- GLM-5.2 반대로 유리한 쪽: 추론 제어가 가장 자유롭습니다 — 끄기·강도(high/max)·모드(도구 호출 사이 사고 / 이전 턴 사고 유지 / 턴 단위 on·off)를 모두 조절합니다. 단 기본값이 max이고, high가 아닌 값을 넣으면 낮아지지 않고 조용히 max로 처리되니 설정값을 반드시 확인하십시오.
- Grok 4.5 컨텍스트가 500K로, 1M급 경쟁 모델의 절반입니다.
- Kimi K2 (0711) 컨텍스트 128K · 지능지수 19.4. 신규 도입 대상이 아니라 레거시 호환용입니다.
- Gemini 3.1 Pro 반대로 유리한 쪽: 네이티브 입력 타입이 가장 넓습니다(텍스트·이미지·오디오·영상·PDF) + 컨텍스트 2M.
- Nemotron 3 Super Mamba+Attention 하이브리드라 KV 캐시 요구가 극히 작습니다 — 자체 구동 시 동시 세션 수용에 유리합니다.
- Claude Fable 5 30일 데이터 보존이 필수입니다. 무보존(zero-retention) 옵션을 쓸 수 없어, 사내 기밀 처리 규정과 충돌할 수 있습니다.
- GLM-5.2 MIT 라이선스 — 완전 오픈소스로 상업적 재배포·개조가 자유롭습니다. 표에서 라이선스 제약이 가장 느슨합니다.
- Gemma 4 31B Apache 2.0 + Google AI Studio 무료 제공. 평가·PoC 단계 비용이 0입니다.
- gpt-oss-120b Apache 2.0. 사내 재배포에 제약이 없습니다.
- Nemotron 3 Super 가중치뿐 아니라 학습 자료까지 공개되어, 재현성·감사 대응이 필요한 조직에 유리합니다.
- Kimi K3 · DeepSeek V4 · Qwen3.6 27B 가중치는 공개되었으나 라이선스 조건은 벤더마다 다릅니다. 사내 배포 전 개별 확인이 필요하며, “오픈웨이트 = 자유 사용”이 아닙니다.
- Claude Fable 5 2026년 미국 수출통제 명령으로 18일간 중단됐다가 7월 1일 복귀했습니다. 규제로 껐다 켜진 최초의 프론티어 모델로, 단일 의존 시 사업 연속성 리스크가 실재합니다.
- DeepSeek V4 Pro 캐시 히트 단가가 $0.0036 — 입력 정가의 1/120입니다. 시스템 프롬프트·사내 문서를 반복 주입하는 워크로드라면 실비용이 표보다 훨씬 낮아집니다.
- GPT-5.6 계열 Sol/Terra/Luna 3티어의 가격 편차가 5배입니다. 난이도별 라우팅 설계 여부가 총비용을 좌우합니다.
- Gemini 캐시 저장 과금이 시간당입니다(Pro $4.50 · Flash $1.00 / 1M·시간). 캐시를 오래 물고 있으면 누적 비용이 커집니다.
- 배치 API 대부분 벤더가 입출력 50% 할인을 제공합니다. 실시간이 아닌 작업(문서 일괄 처리, 야간 배치)은 절반 가격입니다.
- 지능지수 Artificial Analysis Index는 여러 벤치마크의 합성 단일값입니다. 한국어·사내 문서·도구 호출 같은 실제 업무에서는 순위가 뒤집힐 수 있으므로, 자체 평가셋 재검증이 전제입니다.
추론(reasoning) 제어 옵션 — 모델별 상세
추론 강도는 단가표에 안 나타나는 가장 큰 비용 변수입니다. 같은 $/1M이라도 추론을 끌 수 있느냐, 강도를 낮출 수 있느냐, 기본값이 무엇이냐에 따라 실제 청구액이 몇 배로 갈립니다. 사고 토큰은 대부분 출력 토큰 단가로 과금되기 때문입니다.
| 모델 | 추론 끄기 | 강도 조절 | 기본값 | 추가 제어·제약 | 비용·운영 영향 |
|---|---|---|---|---|---|
| Claude Fable 5 | 불가 항상 활성 | 미공개 | — | — | 추론이 필요 없는 단순 작업에도 사고 토큰이 붙습니다. 짧은 작업일수록 단가표 대비 실비용 배수가 커집니다. |
| Kimi K3 | 불가 항상 추론 | 가능 low / high / max 2026-07-18 업데이트로 추가 — 출시 시점(07-16)에는 max 단일 고정 | OpenPlatform: max Kimi Code: high | temperature · top_p · n 고정값이라 요청에서 생략해야 합니다 | 명시적으로 낮추지 않으면 최대 강도로 과금됩니다. 기본값이 플랫폼마다 다르므로(max ↔ high) 같은 코드가 경로에 따라 다른 비용을 냅니다. K2.x의 thinking 파라미터는 K3에서 사용 금지라 마이그레이션 시 호출부 수정이 필요합니다. |
| Kimi K2.6 / K2.7 | 가능 thinking 파라미터 | 모드 단위 | — | — | K3와 제어 인터페이스가 다릅니다. 두 세대를 함께 운용하면 분기 처리가 필요합니다. |
| gpt-oss-120b | 해당 없음 사고연쇄 미사용 | — | — | — | 추론 토큰을 아예 만들지 않아 출력이 짧고 단가가 최저입니다. 대신 지능지수 24.0으로 복잡한 추론·에이전트 과제에는 부적합합니다 — 싼 이유가 곧 한계입니다. |
| GLM-5.2 | 가능 reasoning={“enabled”:false} 사고연쇄를 끄고 최종 답변만 받습니다 | 가능 high / max 2단계만 존재 — low·medium 같은 단계는 없습니다 | max 미지정 시 max | 사고 모드 3종 interleaved(기본, 도구 호출 사이에 사고) · preserved(이전 턴 사고 유지) · turn-level(같은 세션에서 턴마다 on/off) | 표에서 추론 제어가 가장 풍부합니다 — 끄기·강도·모드를 모두 조절할 수 있고, 어려운 턴만 켜고 쉬운 턴은 끄는 턴 단위 제어까지 됩니다. 단 함정이 하나 있습니다: reasoning_effort를 미지정하거나 high가 아닌 아무 값(예: OpenAI 관례대로 low·medium)을 넣으면 낮아지는 게 아니라 조용히 max로 처리됩니다. 비용을 아끼려던 설정이 정반대로 작동합니다. |
| Qwen3.5-Plus | 가능 모드 선택 | 사고 / 비사고 | — | — | 사고 모드 출력 $4.00 vs 비사고 $2.40 — 같은 모델인데 모드만으로 출력 단가 +67%입니다. |
| Qwen3.6 27B | 명시적 사고연쇄 | — | — | — | 사고 과정이 응답 본문과 같은 스트림으로 나옵니다. 후처리로 걷어내지 않으면 산출물에 섞이고, 그 토큰도 출력 단가로 과금됩니다. |
- Kimi K3와 GLM-5.2 모두 reasoning_effort 기본값이 max입니다. 아무것도 지정하지 않고 호출하면 최대 강도로 사고하고 그만큼 출력 토큰이 청구됩니다.
- GLM-5.2는 한 걸음 더 위험합니다 — 단계가 high·max 둘뿐이라, 다른 모델 관례대로 low나 medium을 넣으면 에러가 나는 게 아니라 max로 처리됩니다. 비용을 줄이려던 코드가 오히려 최대 비용을 냅니다.
- 반대로 끄는 것은 GLM-5.2만 됩니다(reasoning={“enabled”:false}). Claude Fable 5와 Kimi K3는 어떤 설정으로도 추론을 끌 수 없습니다.
- 2026-07-16 출시 — reasoning_effort가 max 하나로 고정. 강도 선택 불가.
- 2026-07-18 — 문서가 갱신되며 low / high / max 3단계로 확장. 다만 추론을 끄는 옵션은 끝까지 없습니다.
- 2026-07-21 — 본 문서가 기준으로 삼은 24종 비교표는 이 시점 자료인데, 여기에는 여전히 “reasoning_effort 고정”으로 적혀 있습니다. 3일 전에 이미 바뀐 내용입니다.
05월 비용 계산기
우리 조직의 월간 토큰 사용량을 넣으면 모델별 월 청구액이 나옵니다. 캐시 할인·배치 할인은 반영하지 않은 정가 기준입니다.
| # | 모델 | 지능지수 | 월 비용 $ | 월 비용 ₩ | 연 비용 ₩ | 최저가 대비 |
|---|
06오픈웨이트 모델 — 자체 구동 후보
아래 9종은 가중치가 공개되어 사내 인프라에서 직접 서빙할 수 있습니다. 파라미터 규모가 곧 필요 HBM 용량이므로, 이 숫자가 2번 문서의 서버 산출 입력값이 됩니다. (2번 문서는 아키텍처가 같은 Kimi K2.6을 K2.7로 대표시켜 8종을 다룹니다.)
| 모델 | 지능지수 | 총 파라미터 | 활성 파라미터 | FP8 가중치 | FP4 가중치 | 컨텍스트 | 라이선스 |
|---|
07데이터 신뢰도에 대한 경고
- 1차 출처는 일부뿐 — Anthropic 3종만 벤더 공식 페이지 기준이고, 나머지는 2차 출처를 경유했습니다.
- 프로모션 가격이 섞여 있습니다 — Claude Sonnet 5는 8/31까지 인트로 요금($2/$10), Qwen3.7-Max는 50% 프로모션가, Qwen3.8-Max는 프리뷰 10% 가격으로 정가는 최대 10배까지 오를 수 있습니다.
- 같은 모델도 플랫폼마다 다릅니다 — GLM-5.2 입력가는 경로에 따라 $1.00~$1.40으로 갈립니다.
- 누진 단가 구간 — Qwen Plus 계열은 컨텍스트 길이 구간별 누진제라 표의 값은 최저 구간입니다(표에 ~ 표기).
- 오픈웨이트에는 정가가 없습니다 — 호스팅 사업자별로 gpt-oss-120b 단가가 7.8배까지 벌어집니다. 자체 구동 시 실제 비용은 2번 문서의 TCO 계산을 보십시오.
- 지능지수는 단일 지표입니다 — Artificial Analysis Index는 여러 벤치마크의 합성값이라, 특정 업무(한국어, 사내 문서, 도구 호출)의 실제 성능과 순위가 다를 수 있습니다. 반드시 자체 평가셋으로 재검증하십시오.
08출처
· LLM API 비용·스펙 비교 (2026-07-21) — 본 문서 24종 표의 기준 자료
· Gemini API Pricing (July 2026) · Google AI Pricing — Gemini 3.1 Pro / 3.5 Flash
· Grok API Pricing (Jul 2026) · Grok 4.5 vs Self-Hosted
· Best Open-Weight AI Models in 2026 · Open-Source LLM Leaderboard (2026-07)
· LLM Updates (July 2026) — 출시일 확인
· Kimi API Platform — Thinking Effort · Kimi K3, 2026-07-18 추론 3단계 확장 · Kimi K3 출시(2026-07-16) · GLM-5.2 OpenAI 호환 API — reasoning_effort 가이드 · GLM-5.2 Quickstart (thinking 기본 활성·비활성화 방법) — 추론 제어 표 근거
· 환율: 2026년 7월 중순 USD/KRW 1,475~1,480원대, 계산에는 1,480원 적용

답글 남기기