LLM API 가격 비교 2026년 7월

LLM Landscape · Document 1 of 2

LLM 모델 카탈로그 & API 단가 비교

2026년 7월 기준으로 상용 API와 오픈웨이트를 한 표에 놓고, 지능지수 대비 실제 지불 금액으로 비교합니다. 오픈웨이트 모델의 자체 구동 서버 자원 산출은 2번 문서에서 다룹니다.

기준일 2026-07-22 수록 모델 29종 (+단가 변형 1건) 벤더 10개사 환율 1 USD = 1,480원 지능지수 Artificial Analysis (2026-07-20)

01한눈에 보기

혼합 비용은 입력 100만 토큰 + 출력 20만 토큰을 1단위로 계산했습니다. 에이전트형 워크로드의 전형적인 입출력 비율입니다.

최고 성능
Claude Fable 5
지능지수 59.9 · SWE-bench 95% · 단위당 $20.00
성능·가격 균형
GPT-5.6 Terra
지능지수 55.0 · 단위당 $5.50 · Fable 5의 27% 비용으로 92% 성능
오픈웨이트 최강
Kimi K3
지능지수 57.1 · 2.8T MoE · 자체 구동 시 가중치 1.4TB(FP4)
최저 단가
gpt-oss-120b
입력 $0.03/1M · 단위당 $0.066 · 단 지능지수 24.0

02지능지수 대비 비용 (가성비 프론티어)

가로축은 로그 스케일 혼합 실비용, 세로축은 지능지수입니다. 왼쪽 위로 갈수록 유리합니다. 채워진 점 10종이 파레토 프론티어 — 그보다 싸면서 더 똑똑한 대안이 존재하지 않는 모델입니다. 빈 원은 지배된(dominated) 모델로, 더 싸고 더 똑똑한 대안이 표 안에 이미 있습니다.

가성비 프론티어 (10종) 지배됨 — 더 싸고 더 똑똑한 대안 있음 프론티어 연결선

지능지수가 공개되지 않은 모델(Gemini 3.1 Pro, Gemini 3.5 Flash, Grok 4.5, Mistral Large 3, GPT-5.5 Pro, Qwen3.8-Max 등)은 좌표를 만들 수 없어 이 차트에서 제외했고, 아래 표에는 모두 포함했습니다. GLM-5.2의 저가 플랫폼 변형도 중복이라 차트에서만 제외했습니다.

03전체 비교표

열 제목을 클릭하면 정렬됩니다. 칩으로 벤더를 걸러낼 수 있습니다.

벤더모델지능지수컨텍스트입력 $/1M출력 $/1M캐시 $/1M혼합 비용 $혼합 비용 ₩가성비비고

가성비 = 지능지수 ÷ 혼합 비용($). 값이 클수록 1달러당 얻는 지능이 큽니다. 컨텍스트 1M = 100만 토큰.

04모델별 특이사항 — 표에 안 담기는 조건들

단가표만 보고 고르면 반드시 틀어지는 항목들입니다. 지금 단가가 유지되지 않거나, 끌 수 없는 동작이 있거나, 라이선스·데이터 정책이 사내 규정과 충돌하거나, 조달 자체가 흔들릴 수 있는 조건을 네 갈래로 정리했습니다.

가격이 바뀌는 조건
표의 단가가 그대로 유지되지 않는 항목
  • Qwen3.8-Max 프리뷰 10% 가격입니다. 정가 전환 시 최대 10배 인상이 예상되므로 이 단가($0.17/$0.51)로 예산을 잡으면 안 됩니다.
  • Claude Sonnet 5 인트로 $2/$10은 2026-08-31 종료. 이후 $3/$15로 입력·출력 각 50% 인상됩니다.
  • Qwen3.7-Max 현재가는 50% 프로모션가입니다. 정가는 표의 2배로 보아야 합니다.
  • Gemini 3.1 Pro 프롬프트가 200K 토큰을 넘으면 입력 2배·출력 1.5배($4/$18)로 점프합니다. 장문 컨텍스트가 주 용도라면 표의 $2/$12는 의미가 없습니다.
  • Qwen3.7-Plus · 3.6-Plus 컨텍스트 구간별 누진 단가입니다. 표의 값은 최저 구간이며(~ 표기), 긴 컨텍스트에서는 더 비쌉니다.
  • Qwen3.5-Plus 사고 모드에서 출력 $4.00(비사고 $2.40)으로 67% 비싸집니다. 같은 모델인데 모드로 단가가 갈립니다.
  • GLM-5.2 같은 모델인데 경로에 따라 입력 $1.00~$1.40입니다. 어느 플랫폼을 쓰느냐가 40% 차이를 만듭니다.
  • gpt-oss-120b 오픈웨이트라 정가가 없습니다. 호스팅 사업자별로 단가가 7.8배까지 벌어집니다.
기능·동작 제약
끌 수 없거나, 조절할 수 없거나, 못 하는 것
  • Claude Fable 5 사고(thinking)가 항상 활성이라 끌 수 없습니다. 한 줄 분류·추출처럼 추론이 필요 없는 작업에도 사고 토큰이 생성되어 출력 토큰으로 과금되므로, 단순 작업일수록 표 단가 대비 실비용 배수가 커집니다.
  • Kimi K3 추론을 끌 수 없고, 기본값이 최대 강도(max)입니다. 자세한 계층은 아래 추론 제어 표를 보십시오 — 출시 시점에는 reasoning_effort가 max 한 값으로 고정이었고, 이틀 뒤 low/high가 열렸지만 끄기는 여전히 불가하며 OpenPlatform 기본값은 그대로 max입니다.
  • gpt-oss-120b 사고연쇄를 쓰지 않습니다. 단가가 압도적으로 싼 이유가 여기 있습니다 — 추론 토큰을 생성하지 않으니 출력이 짧고, 대신 지능지수가 24.0으로 표에서 가장 낮아 복잡한 추론·에이전트 과제에는 부적합합니다.
  • Qwen3.6 27B 명시적 사고연쇄를 출력에 포함합니다. 사고 과정이 응답 본문과 같은 스트림으로 나오므로, 후처리로 걷어내지 않으면 최종 산출물에 섞이고 그 토큰도 출력 단가로 과금됩니다.
  • GLM-5.2 반대로 유리한 쪽: 추론 제어가 가장 자유롭습니다 — 끄기·강도(high/max)·모드(도구 호출 사이 사고 / 이전 턴 사고 유지 / 턴 단위 on·off)를 모두 조절합니다. 단 기본값이 max이고, high가 아닌 값을 넣으면 낮아지지 않고 조용히 max로 처리되니 설정값을 반드시 확인하십시오.
  • Grok 4.5 컨텍스트가 500K로, 1M급 경쟁 모델의 절반입니다.
  • Kimi K2 (0711) 컨텍스트 128K · 지능지수 19.4. 신규 도입 대상이 아니라 레거시 호환용입니다.
  • Gemini 3.1 Pro 반대로 유리한 쪽: 네이티브 입력 타입이 가장 넓습니다(텍스트·이미지·오디오·영상·PDF) + 컨텍스트 2M.
  • Nemotron 3 Super Mamba+Attention 하이브리드라 KV 캐시 요구가 극히 작습니다 — 자체 구동 시 동시 세션 수용에 유리합니다.
§
라이선스·데이터 정책
사내 보안·법무 검토에서 걸리는 항목
  • Claude Fable 5 30일 데이터 보존이 필수입니다. 무보존(zero-retention) 옵션을 쓸 수 없어, 사내 기밀 처리 규정과 충돌할 수 있습니다.
  • GLM-5.2 MIT 라이선스 — 완전 오픈소스로 상업적 재배포·개조가 자유롭습니다. 표에서 라이선스 제약이 가장 느슨합니다.
  • Gemma 4 31B Apache 2.0 + Google AI Studio 무료 제공. 평가·PoC 단계 비용이 0입니다.
  • gpt-oss-120b Apache 2.0. 사내 재배포에 제약이 없습니다.
  • Nemotron 3 Super 가중치뿐 아니라 학습 자료까지 공개되어, 재현성·감사 대응이 필요한 조직에 유리합니다.
  • Kimi K3 · DeepSeek V4 · Qwen3.6 27B 가중치는 공개되었으나 라이선스 조건은 벤더마다 다릅니다. 사내 배포 전 개별 확인이 필요하며, “오픈웨이트 = 자유 사용”이 아닙니다.
!
운영 리스크와 숨은 비용 레버
실비용과 가용성을 크게 흔드는 변수
  • Claude Fable 5 2026년 미국 수출통제 명령으로 18일간 중단됐다가 7월 1일 복귀했습니다. 규제로 껐다 켜진 최초의 프론티어 모델로, 단일 의존 시 사업 연속성 리스크가 실재합니다.
  • DeepSeek V4 Pro 캐시 히트 단가가 $0.0036 — 입력 정가의 1/120입니다. 시스템 프롬프트·사내 문서를 반복 주입하는 워크로드라면 실비용이 표보다 훨씬 낮아집니다.
  • GPT-5.6 계열 Sol/Terra/Luna 3티어의 가격 편차가 5배입니다. 난이도별 라우팅 설계 여부가 총비용을 좌우합니다.
  • Gemini 캐시 저장 과금이 시간당입니다(Pro $4.50 · Flash $1.00 / 1M·시간). 캐시를 오래 물고 있으면 누적 비용이 커집니다.
  • 배치 API 대부분 벤더가 입출력 50% 할인을 제공합니다. 실시간이 아닌 작업(문서 일괄 처리, 야간 배치)은 절반 가격입니다.
  • 지능지수 Artificial Analysis Index는 여러 벤치마크의 합성 단일값입니다. 한국어·사내 문서·도구 호출 같은 실제 업무에서는 순위가 뒤집힐 수 있으므로, 자체 평가셋 재검증이 전제입니다.

추론(reasoning) 제어 옵션 — 모델별 상세

추론 강도는 단가표에 안 나타나는 가장 큰 비용 변수입니다. 같은 $/1M이라도 추론을 끌 수 있느냐, 강도를 낮출 수 있느냐, 기본값이 무엇이냐에 따라 실제 청구액이 몇 배로 갈립니다. 사고 토큰은 대부분 출력 토큰 단가로 과금되기 때문입니다.

모델추론 끄기강도 조절기본값추가 제어·제약비용·운영 영향
Claude Fable 5불가 항상 활성미공개추론이 필요 없는 단순 작업에도 사고 토큰이 붙습니다. 짧은 작업일수록 단가표 대비 실비용 배수가 커집니다.
Kimi K3불가 항상 추론가능 low / high / max
2026-07-18 업데이트로 추가 — 출시 시점(07-16)에는 max 단일 고정
OpenPlatform: max
Kimi Code: high
temperature · top_p · n
고정값이라 요청에서 생략해야 합니다
명시적으로 낮추지 않으면 최대 강도로 과금됩니다. 기본값이 플랫폼마다 다르므로(max ↔ high) 같은 코드가 경로에 따라 다른 비용을 냅니다. K2.x의 thinking 파라미터는 K3에서 사용 금지라 마이그레이션 시 호출부 수정이 필요합니다.
Kimi K2.6 / K2.7가능 thinking 파라미터모드 단위K3와 제어 인터페이스가 다릅니다. 두 세대를 함께 운용하면 분기 처리가 필요합니다.
gpt-oss-120b해당 없음 사고연쇄 미사용추론 토큰을 아예 만들지 않아 출력이 짧고 단가가 최저입니다. 대신 지능지수 24.0으로 복잡한 추론·에이전트 과제에는 부적합합니다 — 싼 이유가 곧 한계입니다.
GLM-5.2가능 reasoning={“enabled”:false}
사고연쇄를 끄고 최종 답변만 받습니다
가능 high / max
2단계만 존재 — low·medium 같은 단계는 없습니다
max
미지정 시 max
사고 모드 3종
interleaved(기본, 도구 호출 사이에 사고) · preserved(이전 턴 사고 유지) · turn-level(같은 세션에서 턴마다 on/off)
표에서 추론 제어가 가장 풍부합니다 — 끄기·강도·모드를 모두 조절할 수 있고, 어려운 턴만 켜고 쉬운 턴은 끄는 턴 단위 제어까지 됩니다. 단 함정이 하나 있습니다: reasoning_effort를 미지정하거나 high가 아닌 아무 값(예: OpenAI 관례대로 low·medium)을 넣으면 낮아지는 게 아니라 조용히 max로 처리됩니다. 비용을 아끼려던 설정이 정반대로 작동합니다.
Qwen3.5-Plus가능 모드 선택사고 / 비사고사고 모드 출력 $4.00 vs 비사고 $2.40 — 같은 모델인데 모드만으로 출력 단가 +67%입니다.
Qwen3.6 27B명시적 사고연쇄사고 과정이 응답 본문과 같은 스트림으로 나옵니다. 후처리로 걷어내지 않으면 산출물에 섞이고, 그 토큰도 출력 단가로 과금됩니다.
이 표에서 실무적으로 가장 중요한 한 줄: 기본값이 최대 강도인 모델이 둘입니다.
  • Kimi K3GLM-5.2 모두 reasoning_effort 기본값이 max입니다. 아무것도 지정하지 않고 호출하면 최대 강도로 사고하고 그만큼 출력 토큰이 청구됩니다.
  • GLM-5.2는 한 걸음 더 위험합니다 — 단계가 high·max 둘뿐이라, 다른 모델 관례대로 lowmedium을 넣으면 에러가 나는 게 아니라 max로 처리됩니다. 비용을 줄이려던 코드가 오히려 최대 비용을 냅니다.
  • 반대로 끄는 것은 GLM-5.2만 됩니다(reasoning={“enabled”:false}). Claude Fable 5와 Kimi K3는 어떤 설정으로도 추론을 끌 수 없습니다.
Kimi K3의 추론 설정은 3일 만에 바뀌었습니다 — 이 표의 수명이 얼마나 짧은지 보여주는 사례입니다.
  • 2026-07-16 출시reasoning_effortmax 하나로 고정. 강도 선택 불가.
  • 2026-07-18 — 문서가 갱신되며 low / high / max 3단계로 확장. 다만 추론을 끄는 옵션은 끝까지 없습니다.
  • 2026-07-21 — 본 문서가 기준으로 삼은 24종 비교표는 이 시점 자료인데, 여기에는 여전히 “reasoning_effort 고정”으로 적혀 있습니다. 3일 전에 이미 바뀐 내용입니다.
교훈: 모델 파라미터·기본값은 주 단위로 바뀝니다. 도입 검토 시점에 벤더 공식 API 문서를 직접 확인하고, 특히 기본값(default)이 무엇인지 반드시 보십시오 — 명시하지 않은 요청이 어떤 강도로 처리되는지가 청구서를 결정합니다.

05월 비용 계산기

우리 조직의 월간 토큰 사용량을 넣으면 모델별 월 청구액이 나옵니다. 캐시 할인·배치 할인은 반영하지 않은 정가 기준입니다.

#모델지능지수월 비용 $월 비용 ₩연 비용 ₩최저가 대비

06오픈웨이트 모델 — 자체 구동 후보

아래 9종은 가중치가 공개되어 사내 인프라에서 직접 서빙할 수 있습니다. 파라미터 규모가 곧 필요 HBM 용량이므로, 이 숫자가 2번 문서의 서버 산출 입력값이 됩니다. (2번 문서는 아키텍처가 같은 Kimi K2.6을 K2.7로 대표시켜 8종을 다룹니다.)

모델지능지수총 파라미터활성 파라미터FP8 가중치FP4 가중치컨텍스트라이선스

07데이터 신뢰도에 대한 경고

이 표의 숫자를 계약서에 그대로 옮기지 마십시오. 수집 과정에서 확인된 한계는 다음과 같습니다.
  • 1차 출처는 일부뿐 — Anthropic 3종만 벤더 공식 페이지 기준이고, 나머지는 2차 출처를 경유했습니다.
  • 프로모션 가격이 섞여 있습니다 — Claude Sonnet 5는 8/31까지 인트로 요금($2/$10), Qwen3.7-Max는 50% 프로모션가, Qwen3.8-Max는 프리뷰 10% 가격으로 정가는 최대 10배까지 오를 수 있습니다.
  • 같은 모델도 플랫폼마다 다릅니다 — GLM-5.2 입력가는 경로에 따라 $1.00~$1.40으로 갈립니다.
  • 누진 단가 구간 — Qwen Plus 계열은 컨텍스트 길이 구간별 누진제라 표의 값은 최저 구간입니다(표에 ~ 표기).
  • 오픈웨이트에는 정가가 없습니다 — 호스팅 사업자별로 gpt-oss-120b 단가가 7.8배까지 벌어집니다. 자체 구동 시 실제 비용은 2번 문서의 TCO 계산을 보십시오.
  • 지능지수는 단일 지표입니다 — Artificial Analysis Index는 여러 벤치마크의 합성값이라, 특정 업무(한국어, 사내 문서, 도구 호출)의 실제 성능과 순위가 다를 수 있습니다. 반드시 자체 평가셋으로 재검증하십시오.
미수록 항목. Meta Llama 계열은 2026년 7월 시점의 신뢰할 만한 단가·스펙을 확보하지 못해 제외했습니다. Gemini 3.1 Pro / Grok 4.5 / Mistral Large 3 / Nemotron 3는 원 비교표(24종)에 없어 별도 출처로 보강했으며, 지능지수는 미상입니다.

08출처

· LLM API 비용·스펙 비교 (2026-07-21) — 본 문서 24종 표의 기준 자료
· Gemini API Pricing (July 2026) · Google AI Pricing — Gemini 3.1 Pro / 3.5 Flash
· Grok API Pricing (Jul 2026) · Grok 4.5 vs Self-Hosted
· Best Open-Weight AI Models in 2026 · Open-Source LLM Leaderboard (2026-07)
· LLM Updates (July 2026) — 출시일 확인
· Kimi API Platform — Thinking Effort · Kimi K3, 2026-07-18 추론 3단계 확장 · Kimi K3 출시(2026-07-16) · GLM-5.2 OpenAI 호환 API — reasoning_effort 가이드 · GLM-5.2 Quickstart (thinking 기본 활성·비활성화 방법) — 추론 제어 표 근거
· 환율: 2026년 7월 중순 USD/KRW 1,475~1,480원대, 계산에는 1,480원 적용

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다