
Kimi K3는 Moonshot AI의 2.8조 파라미터 규모 플래그십 모델로, 장기 코딩 작업, 지식 업무, 시각적 추론, 도구를 사용하는 에이전트를 위해 설계되었습니다. 100만 토큰 컨텍스트 윈도우와 네이티브 이미지 및 비디오 이해, 항상 활성화된 추론, 구조화된 출력, 그리고 매우 희소한 Mixture-of-Experts 아키텍처를 결합합니다.
눈에 띄는 수치들은 인상적이지만, 실제 활용에 관한 핵심 질문에는 답하지 못합니다. Kimi K3는 가장 강력한 폐쇄형 모델보다 뛰어날까요? 100만 컨텍스트는 실제로 유용할까요, 아니면 단순히 비용만 높은 기능일까요? 개발자가 2.8T 모델을 직접 호스팅할 수 있을까요? 그리고 K3가 단일 프롬프트 응답이 아니라 몇 시간 동안 도구를 제어할 때 어떤 한계가 중요할까요?
이 리뷰는 확인된 기능과 출시 발표 내용을 구분하고, Kimi K3가 실제 운영 환경의 모델 스택에서 어떤 위치를 차지하는지 설명합니다.
2026년 7월 21일 기준 확인 정보. Kimi K3는 Moonshot AI의 제품과 공식 API를 통해 이용 가능합니다. Poyo.ai 접근은 아직 출시 예정으로 표시되어 있습니다. Moonshot은 전체 모델 웨이트가 2026년 7월 27일까지 공개될 예정이라고 밝혔으며, 웨이트와 라이선스가 공개되면 이 글을 업데이트할 예정입니다.
Kimi K3 한눈에 보기
| 사양 | Kimi K3 |
|---|---|
| 제공사 | Moonshot AI |
| 모델 ID | 공식 Moonshot API의 kimi-k3 |
| 총 파라미터 | 2.8조 |
| 아키텍처 | KDA, Attention Residuals, Stable LatentMoE |
| 전문가 수 | 총 896개, 활성화 16개 |
| 컨텍스트 윈도우 | 100만 토큰 |
| 최대 완료 길이 | 기본 131,072 토큰; 최대 1,048,576까지 설정 가능 |
| 입력 | 텍스트, 이미지, 업로드된 비디오 |
| 출력 | 텍스트 |
| 추론 | 항상 활성화; low, high, max 노력 수준 |
| 에이전트 기능 | 도구 호출, 필수 도구 선택, 동적 도구 로딩 |
| 구조화된 출력 | Strict JSON Schema |
| 컨텍스트 캐싱 | 자동 |
| 공식 API 상태 | 이용 가능 |
| Poyo.ai 상태 | 출시 예정 |
| 전체 웨이트 | 2026년 7월 27일까지 출시 예정 발표 |
Kimi K3는 밀집형 2.8T 모델과는 다른 방식으로 극한의 규모를 활용합니다. Stable LatentMoE는 각 토큰을 896개 전문가 중 16개를 통해 처리하므로, 전체 파라미터 수가 모든 토큰에서 동일한 활성 연산량을 의미하지는 않습니다. 이 차이는 아키텍처, 지능 수준, 배포 비용을 비교할 때 중요합니다.
Kimi K3가 설계된 목적
Moonshot은 K3를 두 가지 주요 작업 영역에 맞춰 설계했습니다. 장기 소프트웨어 엔지니어링과 엔드투엔드 지식 업무입니다.
장기 코딩
K3는 긴 엔지니어링 세션 동안 생산성을 유지하도록 설계되었습니다. 공식 사례에서는 대규모 리포지토리 탐색, 터미널 오케스트레이션, GPU 커널 최적화, 컴파일러 개발, 프론트엔드 엔지니어링, 게임 개발, CAD, 과학 계산 코딩 등을 강조합니다.
이는 자동 완성 기능과는 다른 목표입니다. 장기 코딩 모델은 반복적으로 상태를 확인하고, 도구를 선택하고, 결과를 해석하고, 계획을 수정하고, 최종 결과물을 검증해야 합니다. 첫 번째 코드 샘플의 품질보다 지속성과 복구 능력이 더 중요할 수 있습니다.
코딩 루프에서의 비전 기능
K3는 네이티브 시각 이해 기능을 제공합니다. 코드를 변경하면서 스크린샷과 렌더링 결과를 피드백으로 활용할 수 있습니다. 이는 프론트엔드 반복 작업, 시각적 QA, 게임, 3D 장면, 다이어그램 등 단순히 유닛 테스트를 통과하는 것만으로 충분하지 않은 작업을 지원합니다.
공식 API는 이미지 데이터와 업로드된 비디오를 허용합니다. 공개 이미지 URL은 비전 메시지에서 직접 사용할 수 없습니다. 이미지는 base64 또는 지원되는 파일 처리를 통해 제공해야 하며, 비디오는 Moonshot 파일 ID를 통해 참조됩니다.
지식 업무
K3는 연구, 보고서, 스프레드시트, 슬라이드, 대시보드, 다단계 분석 작업도 대상으로 합니다. 100만 토큰 컨텍스트는 대규모 증거 자료를 담을 수 있지만, 유용한 지식 업무에는 여전히 소스 관리, 인용 검증, 사실 확인이 필요합니다. 대규모 윈도우는 컨텍스트를 버려야 하는 상황을 줄여주지만, 모든 정보를 정확히 기억하거나 올바르게 가중치를 적용한다는 보장은 아닙니다.
Kimi K3 벤치마크 성능은 어느 정도일까?
Kimi의 출시 보고서는 리포지토리 수정, 터미널 작업, 전체 프로그램 구축, 지식 업무, 자동화, 브라우징, 멀티모달 평가를 다룹니다. 단일 점수보다 중요한 것은 전체적인 패턴입니다. K3는 장기 에이전트 워크플로에서 가장 강점을 보이며, 공식 평가군에서는 선도적인 폐쇄형 모델들과 경쟁력을 유지합니다.
다만 주의할 점이 있습니다.
- Kimi K3 결과는 일반적으로 최대 추론 노력을 사용합니다.
- 모델들이 항상 동일한 에이전트 하네스로 평가된 것은 아닙니다.
- 일부 작업은 벤치마크 표준 하드웨어가 아닌 H20 기준 환경에서 실행되었습니다.
- 공식 보고서는 최소 하나의 경쟁 모델에 대한 대체 동작을 언급합니다.
- 독립적인 종합 지능 순위에서는 K3가 전체 1위에 오르지 않습니다.
현재 독립 분석에서는 K3를 최전선 수준에 가까운 모델로 평가하지만, 명확하게 최고라고 보지는 않습니다. 이는 K3가 전체적으로 가장 강력한 독점 모델보다 여전히 뒤처진다는 Moonshot 자체의 설명과도 일치합니다.
점수 표, 하네스 관련 참고 사항, 공식 평가와 독립 평가의 차이는 Kimi K3 Benchmarks Explained에서 확인할 수 있습니다.
Kimi K3 API 가격
Moonshot은 캐시 사용 여부에 따라 구분된 입력 가격과 단일 종량제 요금을 제공합니다.
| 토큰 유형 | 100만 토큰당 공식 가격 |
|---|---|
| 캐시 적중 입력 | $0.30 |
| 캐시 미적중 입력 | $3.00 |
| 출력 | $15.00 |
긴 컨텍스트를 사용한다고 해서 별도의 높은 가격 등급이 적용되지는 않습니다. 하지만 전체 비용은 여전히 커질 수 있습니다. 캐시되지 않은 입력 100만 토큰은 출력 전 $3이며, 출력 50,000 토큰은 $0.75를 추가합니다.
자동 캐싱은 반복적인 리포지토리 및 연구 워크플로의 비용 구조를 바꿀 수 있습니다. 안정적인 500K 토큰 접두사는 캐시 미적중 시 $1.50이지만 캐시 적중 시 $0.15입니다. 애플리케이션은 모든 반복 요청이 낮은 요금을 적용받는다고 가정하지 말고 캐시 동작을 기록해야 합니다.
전체 워크로드 예시와 캐싱 전략은 Kimi K3 API Pricing Explained를 참고하세요.
Kimi K3 vs GPT-5.6 Sol
K3와 GPT-5.6 Sol은 고급 코딩, 에이전트, 추론, 전문 업무 영역에서 겹치지만 서로 다른 선택지를 제공합니다.
| 비교 영역 | Kimi K3 | GPT-5.6 Sol |
|---|---|---|
| 주요 장점 | 100만 컨텍스트와 예정된 오픈 웨이트 | 더 강력한 최고 수준 폐쇄형 모델 성능 |
| 코딩 | 강력한 장기 코딩 및 시각적 코딩 | 강력한 일반 코딩 및 터미널 성능 |
| 멀티모달 입력 | 네이티브 이미지 및 비디오 이해 | 현재 API 지원 범위에 따라 달라짐 |
| 컨텍스트 | 100만 토큰 | 현재 엔드포인트 제한 확인 필요 |
| 오픈 웨이트 | 발표됨 | 없음 |
| 배포 | 공식 API 또는 향후 초대형 자체 호스팅 클러스터 | 호스팅 API |
| 운영 성숙도 | 신규 출시 | 구축된 OpenAI 플랫폼 |
모든 워크로드에서 우위를 차지하는 모델은 없습니다. K3는 긴 컨텍스트, 멀티모달 코딩, 향후 웨이트 접근성을 중시하는 팀에게 매력적입니다. GPT-5.6 Sol은 독립적인 최고 수준 품질 평가, 성숙한 플랫폼 동작, 폐쇄형 호스팅 인프라가 중요한 경우 여전히 강점을 가집니다.
전체 선택 가이드는 Kimi K3 vs GPT-5.6 Sol에서 확인하세요.
Kimi K3의 강점
실제로 큰 작업 컨텍스트
100만 토큰은 에이전트가 소스 코드, 문서, 도구 기록, 시각적 증거, 중간 산출물을 충분히 유지할 수 있도록 합니다. 특히 함께 고려해야 하는 증거 자료가 분리되는 상황에서 공격적인 검색 기반 접근보다 유용합니다.
하나의 모델에서 코딩과 비전 지원
K3는 소스 코드나 텍스트 로그에만 의존하지 않고 렌더링 결과를 확인할 수 있습니다. 따라서 UI 엔지니어링, 게임, CAD, 데이터 시각화, 미디어 워크플로에 적합합니다.
에이전트 중심 API 기능
공식 API는 사용자 정의 도구, 강제 도구 사용, 동적 도구 로딩, 스트리밍, 구조화된 출력, 긴 멀티턴 세션을 지원합니다. 이는 단순 채팅 기능이 아니라 실제 운영 환경을 위한 구성 요소입니다.
오픈 웨이트 방향성
Moonshot은 K3를 최초의 오픈 3T급 모델로 설명하며 전체 웨이트 출시를 발표했습니다. 출시와 라이선스가 광범위한 사용을 허용한다면 인프라 팀은 폐쇄형 API 전용 모델보다 더 많은 제어권을 갖게 됩니다. 실제 이용 가능 여부, 라이선스 조건, 커뮤니티 추론 지원은 출시 이후 확인해야 합니다.
Kimi K3의 한계
사고 기록 보존 필요
Moonshot은 K3가 보존된 사고 기록으로 학습되었다고 경고합니다. 클라이언트가 필요한 어시스턴트 상태를 삭제하거나 최종 텍스트만 유지하거나 세션 중간에 모델을 전환하면 품질이 불안정해질 수 있습니다. 따라서 올바른 대화 상태 관리가 필수입니다.
지나치게 적극적일 수 있음
장기 작업 학습은 모델이 계속 진행하도록 유도합니다. 모호한 상황에서는 K3가 사용자가 승인하지 않은 결정을 내릴 수 있습니다. 운영 환경의 에이전트는 명확한 제한, 범위가 지정된 도구, 승인 단계, 중단 시점에 대한 지침이 필요합니다.
가장 큰 모델은 로컬 노트북용이 아님
MXFP4 웨이트와 희소 전문가 활성화를 사용하더라도 2.8T 모델은 인프라 규모의 배포가 필요합니다. Moonshot은 64개 이상의 가속기를 사용하는 슈퍼노드 구성을 권장합니다. 오픈 웨이트가 공개되어도 K3를 일반 소비자 GPU나 보통 워크스테이션에서 실행하기는 어렵습니다.
출력 비용이 상대적으로 높음
출력 토큰 100만 개당 $15 가격에서는 장황한 에이전트 동작이 비용을 크게 증가시킬 수 있습니다. 애플리케이션은 적절한 완료 제한을 설정하고 요청당 가격이 아니라 검증된 작업당 비용을 측정해야 합니다.
일부 출시 정보는 아직 대기 중
7월 21일 기준으로 전체 웨이트, 최종 라이선스, 기술 보고서는 아직 공개되지 않았습니다. 실제 파일과 라이선스가 존재하기 전에 완전한 로컬 설치 과정을 주장하는 글은 주의해서 봐야 합니다.
누가 Kimi K3를 사용해야 할까?
K3는 다음과 같은 경우에 적합한 후보입니다.
- 리포지토리 규모 코딩 에이전트;
- 지속성이 필요한 터미널 워크플로;
- 프론트엔드, 게임, CAD, 시각적 소프트웨어 반복 작업;
- 긴 문서 연구와 전문 산출물 제작;
- 이미지 또는 업로드된 비디오를 활용한 멀티모달 분석;
- 향후 오픈 웨이트 최첨단 모델 배포를 평가하는 팀.
다음과 같은 경우에는 규모나 비용 측면에서 과할 수 있습니다.
- 분류, 추출, 단순 고객 지원;
- 지연 시간이 중요한 짧은 응답;
- 소규모 자체 호스팅 환경;
- 전체 대화 상태를 유지할 수 없는 워크플로;
- 강력한 권한 관리와 검증 절차가 없는 에이전트.
Kimi K3 평가
Kimi K3는 최첨단 규모의 아키텍처, 100만 컨텍스트 윈도우, 네이티브 시각 이해, 강력한 에이전트 API를 결합했기 때문에 2026년 가장 주목할 만한 오픈 모델 출시 중 하나입니다. 가장 설득력 있는 사용 사례는 단일 벤치마크 질문에 대한 응답이 아닙니다. 코드, 도구, 문서, 시각적 피드백을 넘나드는 지속적인 작업입니다.
이 모델이 가장 강력한 폐쇄형 시스템을 자동으로 대체하는 것은 아닙니다. 독립 평가, 출력 비용, 상태 관리 요구사항, 과도한 적극성, 극도로 높은 자체 호스팅 요구사항 모두 고려해야 합니다. 실제 운영 환경에서는 대표적인 장기 작업에서 K3를 테스트하고 검증된 결과당 비용을 비교하는 것이 중요합니다.
Poyo.ai의 이용 가능 여부, 확인된 모델 ID, 가격 정보는 Kimi K3 model page에서 확인하세요.
자주 묻는 질문
Kimi K3는 오픈 소스인가요?
Moonshot은 K3를 오픈 3T급 모델이라고 설명하며 전체 웨이트를 2026년 7월 27일까지 공개할 예정이라고 밝혔습니다. 7월 21일 기준으로 개발자는 실제 파일과 라이선스가 공개되기 전까지 배포 또는 상업적 사용 관련 주장을 신중히 해야 합니다.
Kimi K3의 컨텍스트 윈도우 크기는 얼마인가요?
Kimi K3는 100만 토큰 컨텍스트 윈도우를 지원합니다. 공식 API에서는 자동 컨텍스트 캐싱도 사용할 수 있습니다.
Kimi K3가 GPT-5.6 Sol보다 뛰어난가요?
항상 그렇지는 않습니다. K3는 긴 컨텍스트, 예정된 오픈 웨이트, 멀티모달 코딩, 에이전트 워크플로에서 특히 매력적입니다. GPT-5.6 Sol은 일부 독립 평가와 최고 수준 성능 평가에서 강점을 유지합니다. 동일한 작업으로 두 모델을 테스트하세요.
Kimi K3는 이미지와 비디오를 지원하나요?
네. 공식 API는 이미지 입력과 업로드된 비디오 입력을 지원합니다. 결과는 생성된 이미지나 비디오가 아니라 텍스트로 반환됩니다.
Kimi K3 API 비용은 얼마인가요?
Moonshot은 캐시 적중 입력 토큰 100만 개당 $0.30, 캐시 미적중 입력 토큰 100만 개당 $3, 출력 토큰 100만 개당 $15를 제공합니다.
Kimi K3를 로컬에서 실행할 수 있나요?
일반 소비자 하드웨어에서는 어렵습니다. 토큰마다 일부 전문가만 활성화되더라도 2.8T 모델은 대규모 분산 인프라를 대상으로 합니다.