guides

Kimi K3 API 가격: 토큰 비용, 캐시 절감 및 예시

Poyo.ai Team
7 min read
Share:

Kimi K3 API 가격 및 컨텍스트 비용

Kimi K3 API 가격은 캐시된 입력, 캐시되지 않은 입력, 출력의 세 가지 요금으로 구성됩니다. 캐시 적중과 캐시 미스의 차이는 10배이므로, 동일한 500K 토큰 저장소를 처리하는 두 개의 에이전트라도 세션 설계 방식에 따라 비용이 크게 달라질 수 있습니다.

Moonshot은 K3의 100만 토큰 컨텍스트 윈도우에 대해 더 높은 토큰당 요금제를 추가하지 않습니다. 긴 컨텍스트도 무료는 아닙니다. 캐시되지 않은 1M 토큰 프롬프트는 모델이 답변을 생성하기 전에 $3의 비용이 발생합니다.

2026년 7월 22일 제공 상태 및 가격 업데이트. Kimi K3는 Poyo.ai에서 kimi-k3 모델 ID와 OpenAI 호환 Chat Completions API로 사용할 수 있습니다. 가격은 입력 100만 토큰당 $2.28, 출력 100만 토큰당 $11.40으로 공식 가격보다 24% 저렴합니다.

공식 Kimi K3 API 가격

사용량1M 토큰당 가격
캐시 적중 입력$0.30
캐시 미스 입력$3.00
출력$15.00

K3는 고정 종량제 가격을 사용합니다. Moonshot 문서에는 별도의 장기 컨텍스트 추가 요금이 안내되어 있지 않습니다. API는 자동으로 컨텍스트 캐싱을 시도하며, 일반 요청에서는 애플리케이션이 캐시 ID를 생성하거나 TTL을 설정할 필요가 없습니다.

Kimi K3 비용 계산 공식

하나의 요청 또는 누적 워크로드에는 다음 공식을 사용하세요.

cost =
  cached_input_tokens / 1,000,000 × $0.30
  + uncached_input_tokens / 1,000,000 × $3.00
  + output_tokens / 1,000,000 × $15.00

API 사용량 응답과 결제 대시보드가 최종 기준이 되어야 합니다. 토큰화 방식, 재시도, 도구 호출 횟수, 캐싱 동작이 변경되면 예상치와 실제 비용이 달라질 수 있습니다.

실제 Kimi K3 비용 예시

짧은 분석 요청

캐시되지 않은 입력 토큰 10,000개와 출력 토큰 2,000개를 가정합니다.

구성 요소계산비용
입력10K / 1M × $3$0.03
출력2K / 1M × $15$0.03
합계$0.06

입력이 출력보다 6배 많더라도 두 비용은 동일합니다. 출력 토큰이 입력 토큰보다 5배 비싸기 때문입니다.

100K 토큰 저장소 검토

캐시되지 않은 입력 토큰 100,000개와 출력 토큰 10,000개를 가정합니다.

구성 요소비용
입력$0.30
출력$0.15
합계$0.45

동일한 안정적인 저장소 프리픽스가 다음 요청에서 캐시 적중되면 입력 비용은 $0.30에서 $0.03으로 감소합니다.

500K 토큰 리서치 코퍼스

입력 토큰 500,000개와 출력 토큰 20,000개를 가정합니다.

캐시 상태입력 비용출력 비용합계
캐시 미스$1.50$0.30$1.80
캐시 적중$0.15$0.30$0.45

반복적인 지식 작업 세션에서 안정적인 프리픽스가 중요한 이유입니다. 출력 비용이 가장 큰 비중을 차지하게 되면 모델에게 간결하게 답하도록 요청하는 것이 캐싱만큼 중요할 수 있습니다.

50K 출력이 포함된 전체 1M 컨텍스트

캐시 상태입력 비용출력 비용합계
캐시 미스$3.00$0.75$3.75
캐시 적중$0.30$0.75$1.05

1M 윈도우는 모든 요청의 목표가 아니라 최대 성능 범위입니다. 검색 기반 처리와 단계별 분석이 더 저렴하고 검증하기 쉬운 경우가 있습니다.

멀티턴 코딩 에이전트 비용

200K 토큰의 안정적인 저장소 프리픽스, 턴마다 20K 토큰의 새로운 입력, 턴마다 8K 토큰의 출력을 사용하는 5턴 코딩 세션을 가정합니다.

첫 번째 턴은 캐시 미스이고 이후 안정적인 프리픽스는 캐시 적중된다고 가정합니다.

사용량예상 비용
초기 200K 캐시되지 않은 프리픽스$0.60
4회 × 200K 캐시된 프리픽스 읽기$0.24
5회 × 20K 새로운 캐시되지 않은 입력$0.30
5회 × 8K 출력$0.60
합계$1.74

애플리케이션이 매 턴 컨텍스트 시작 부분을 변경해 재사용을 방해하면, 200K 프리픽스의 캐시되지 않은 읽기 5회만으로도 $3.00의 비용이 발생합니다. 세션 구성 방식은 작은 프롬프트 수정 이상으로 큰 비용 차이를 만듭니다.

자동 컨텍스트 캐싱 작동 방식

Moonshot은 일반 K3 요청에서 캐싱이 자동으로 수행된다고 설명합니다. 서비스가 프리픽스를 최대한 재사용할 수 있도록 하려면 다음을 지키세요.

  • 대화의 긴 시작 부분을 변경하지 않고 유지합니다.
  • 기존 메시지를 다시 작성하지 말고 새 질문과 도구 결과를 추가합니다.
  • 시작 부분 근처에 동적 타임스탬프와 요청 ID를 넣지 않습니다.
  • 시스템 지침을 안정적으로 유지합니다.
  • K3에 필요한 전체 assistant 메시지를 보존합니다.
  • 관련 없는 데이터가 애플리케이션 상태를 공유하지 않도록 사용자와 문서를 올바르게 그룹화합니다.

캐시 적중은 최적화 기능이지 보장 사항이 아닙니다. 서비스가 반환하는 실제 캐시 및 비캐시 토큰 수를 모니터링하세요.

출력 토큰이 비용을 지배할 수 있습니다

K3의 출력 가격은 1M 토큰당 $15로, 캐시되지 않은 입력 요금의 5배, 캐시 입력 요금의 50배입니다. 긴 추론과 상세한 에이전트 보고서는 입력 캐시 절감 효과를 상쇄할 수 있습니다.

출력 비용을 관리하는 방법:

  • 현실적인 max_completion_tokens 값을 설정합니다.
  • 간결한 최종 결과물을 요청합니다.
  • 필요한 필드만 포함하는 구조화된 출력을 사용합니다.
  • 대규모 계획을 반복적으로 다시 설명하지 않습니다.
  • 낮은 추론 수준으로도 작업을 안정적으로 해결할 수 있는지 측정합니다.
  • 검증 또는 정의된 실패 임계값 이후에는 도구 루프를 종료합니다.

단순히 토큰을 절약하기 위해 이후 턴에서 필요한 사고 기록을 제거하지 마세요. Moonshot은 불완전한 상태가 K3를 불안정하게 만들 수 있으며, 이로 인해 더 많은 재시도와 높은 총비용이 발생할 수 있다고 경고합니다.

Kimi K3와 셀프 호스팅 비용 비교

오픈 가중치라고 해서 추론 비용이 무료가 되는 것은 아닙니다. K3는 총 2.8T 파라미터를 가지고 있으며, 극단적인 전문가 병렬화를 사용하고 64개 이상의 가속기를 갖춘 슈퍼노드 사용을 권장합니다. 셀프 호스팅에는 하드웨어, 네트워크, 엔지니어링, 활용률, 모니터링, 가용성 비용이 추가됩니다.

API 사용은 변동 트래픽이나 중간 규모 트래픽에서 일반적으로 현실적인 선택입니다. 셀프 호스팅은 지속적인 사용량, 인프라 전문성, 데이터 제어 요구사항, 적합한 클러스터 접근 권한을 가진 조직에서 전략적으로 검토할 수 있습니다. 실제 가중치 라이선스와 지원되는 추론 스택을 확인한 후 예산을 수립하세요.

Kimi K3 API 비용 줄이는 방법

  1. 분류, 라우팅, 간단한 추출 작업에는 더 작은 모델을 사용합니다.
  2. 장기 추론이나 멀티모달 컨텍스트가 필요한 작업에만 K3를 사용합니다.
  3. 재사용 가능한 프리픽스를 안정적으로 유지합니다.
  4. 전체 컨텍스트 추론이 필요하지 않다면 관련 부분만 검색합니다.
  5. 출력 및 도구 루프 제한을 설정합니다.
  6. 실제 평가 세트에서 low, high, max 추론 수준을 비교합니다.
  7. 재시도를 포함해 검증된 성공 단위의 비용을 기록합니다.
  8. 심각한 실패와 사람의 수정 시간을 추적합니다.

Kimi K3는 비싼가요?

K3는 캐시된 긴 프리픽스가 고가치 작업을 지원하고 출력이 집중되어 있을 때 저렴합니다. 반대로 모든 턴에서 캐시 미스가 발생하고 긴 결과를 생성하며 여러 번 재시도하면 비용이 높아질 수 있습니다.

유용한 비교 기준은 단순한 1M 토큰당 가격이 아닙니다.

effective task cost =
  API cost per attempt × attempts per verified success
  + human correction cost

성능과 벤치마크 맥락은 Kimi K3 reviewKimi K3 benchmark analysis에서 확인하세요.

자주 묻는 질문

Kimi K3는 1M 토큰당 얼마인가요?

공식 Moonshot 요금은 캐시 적중 입력 $0.30, 캐시 미스 입력 $3, 출력 $15입니다.

1M 컨텍스트 윈도우는 더 높은 토큰 가격이 적용되나요?

Moonshot은 별도의 장기 컨텍스트 요금제가 아닌 고정 요금을 제공합니다. 더 큰 프롬프트는 더 많은 토큰을 포함하기 때문에 비용이 증가합니다.

무료 Kimi K3 API가 있나요?

프로모션 크레딧이나 타사 제공 혜택은 변경될 수 있습니다. 일시적인 무료 이용을 기준으로 프로덕션 비용 모델을 설계하지 말고, 공식 콘솔과 제공업체 약관을 확인하세요.

추론 토큰도 과금되나요?

각 요청의 최종 비용 계산은 공식 사용량 응답과 결제 문서를 기준으로 확인하세요. K3는 추론을 최종 콘텐츠와 별도로 스트리밍하며, 긴 추론은 생성 토큰 사용량을 증가시킬 수 있습니다.

Kimi K3는 Poyo.ai에서 사용할 수 있나요?

사용할 수 있습니다. Kimi K3 모델 페이지에서 Playground, 모델 ID kimi-k3, API 연결 방법과 입력 $2.28·출력 $11.40/100만 토큰의 Poyo 가격(공식보다 24% 저렴)을 확인할 수 있습니다.

출처

Share: