guides

Kimi K3는 오픈소스인가요? 가중치, 라이선스 및 하드웨어 완전 정리

Poyo.ai Team
7 min read
Share:

Kimi K3 오픈 웨이트 및 자체 호스팅

Moonshot AI는 Kimi K3를 세계 최초의 오픈 3T급 모델이라고 소개하고 있지만, 2026년 7월 21일 기준으로 전체 가중치와 최종 라이선스는 아직 공개되지 않았습니다. Moonshot은 7월 27일까지 추가 기술 정보와 함께 가중치를 공개할 예정이라고 밝혔습니다.

따라서 현재 가장 정확한 답은 다음과 같습니다. Kimi K3는 오픈 웨이트 모델로 발표되었지만, 전체 릴리스는 아직 검증이 필요한 상태입니다. 공식 API와 Kimi 제품은 이미 사용할 수 있지만, API 제공과 다운로드 가능한 가중치 공개는 서로 다른 개념입니다.

2026년 7월 21일 기준 확인. Moonshot이 공식 저장소, 체크섬 및 라이선스를 공개하기 전까지는 비공식 "Kimi K3" 사이트에서 파일을 다운로드하거나 상업적 사용 가능 여부를 단정하지 마세요.

오픈소스, 오픈 웨이트, API 제공은 서로 다릅니다

검색 결과에서는 이 용어들이 자주 혼용됩니다.

용어의미
API 제공서비스 제공자가 모델을 운영하며 원격 API 요청을 받을 수 있음
오픈 웨이트개발자가 라이선스에 따라 학습된 파라미터 파일을 받을 수 있음
오픈소스오픈소스 정의에 따라 코드와 권한이 제공되어 코드 확인, 수정 및 재배포가 가능함
기술 보고서아키텍처, 학습 과정 및 평가 세부 내용이 문서화됨

현재 K3 API는 이미 사용할 수 있습니다. Moonshot은 전체 가중치 공개를 예고했습니다. 하지만 실제로 완전한 오픈소스라고 부를 수 있는지는 최종 라이선스, 코드 및 릴리스 구성 요소에 따라 결정됩니다.

Kimi K3 릴리스 일정

2026년 7월 16일: 모델 및 API 출시

Moonshot은 K3를 기본 시각 이해 기능, 100만 토큰 컨텍스트 윈도우, 장기 코드 생성 및 지식 작업 능력을 갖춘 2.8T 파라미터 모델로 공개했습니다. 이후 K3는 Kimi, Kimi Work, Kimi Code 및 공식 API를 통해 사용할 수 있게 되었습니다.

2026년 7월 27일까지: 가중치 공개 예정

Moonshot은 7월 27일까지 전체 모델 가중치를 공개할 예정이라고 밝혔습니다. 또한 기술 보고서를 통해 아키텍처, 학습 및 평가에 대한 추가 정보도 함께 공개할 예정입니다.

릴리스 이후에는 다음 사항을 확인하세요.

  • 공식 저장소의 소유자
  • 가중치 파일 이름 및 체크섬
  • 토크나이저 및 구성 파일
  • 추론 코드 또는 지원되는 런타임
  • 모델 라이선스
  • 상업적 사용 조건
  • 파생 모델 및 재배포 규정
  • 지원되는 양자화 형식

지금 Kimi K3를 다운로드할 수 있나요?

이 글의 검증 시점을 기준으로 공식 출시 페이지에서는 전체 공개 가중치를 제공하지 않습니다. 이미 검색 결과에는 Kimi K3 이름을 사용하는 비공식 사이트가 등장하고 있습니다. 다운로드 페이지가 잘 만들어져 있다고 해서 해당 파일이 공식이거나 안전하다는 의미는 아닙니다.

반드시 Moonshot AI, Kimi 공식 문서 또는 신뢰할 수 있는 모델 저장소의 공식 Moonshot 조직에서 공개한 링크만 이용하세요. 또한 대용량 파일의 해시값을 확인하고, 서드파티 모델 파일을 사용하기 전에 라이선스를 반드시 검토하세요.

Kimi K3를 로컬에서 실행할 수 있나요?

일반적으로 말하는 "로컬 실행"은 어렵습니다. 노트북, Mac, 워크스테이션 또는 단일 GPU만으로는 전체 2.8T 모델을 실행할 수 없습니다.

K3는 희소 Mixture-of-Experts(MoE) 구조를 사용하며, 토큰당 896개의 전문가 중 16개만 활성화됩니다. 희소 활성화는 동일한 규모의 Dense 2.8T 모델보다 실제 연산량을 줄여주지만, 필요한 모든 전문가와 공유 구성 요소는 여전히 인프라 규모의 시스템 전체에 저장되고 서비스되어야 합니다.

Moonshot은 64개 이상의 가속기를 사용하는 슈퍼노드 배포를 권장합니다. 이는 고대역폭 네트워크, Expert Parallelism, 분산 스토리지, 정적 형태 실행, 모니터링 및 전문적인 추론 엔지니어링이 필요함을 의미합니다.

대략적인 가중치 저장 규모

K3는 MXFP4 가중치를 사용하는 Quantization-Aware Training(QAT)을 적용합니다. 파라미터당 4비트를 단순 계산하면 이론적인 최소 가중치 크기는 다음과 같습니다.

2.8 trillion parameters × 4 bits ≈ 1.4 terabytes

이는 이해를 돕기 위한 이론적인 최소 추정치일 뿐이며 실제 배포 사양은 아닙니다. 실제 저장 공간과 메모리 요구 사항에는 메타데이터, 스케일 값, 비양자화 구성 요소, 라우팅 데이터, 런타임 버퍼, KV 캐시, 중복 데이터 및 프레임워크 오버헤드가 포함됩니다. 실제 용량은 공식 파일이 공개되어야 정확히 알 수 있습니다.

Kimi K3를 자체 호스팅하려면 어떤 하드웨어가 필요한가요?

소비자용 GPU

전체 모델을 실행하기에는 현실적이지 않습니다. 커뮤니티에서 만든 양자화 버전이 나오더라도 일반 데스크톱 환경에서는 전문가 저장 및 실행 요구 사항을 충족하기 어렵습니다.

멀티 GPU 워크스테이션

역시 전체 모델을 실행하기에는 현실적인 대상이 아닙니다. 워크스테이션은 K3 배포 설계에서 요구하는 가속기 수, 총 메모리 및 인터커넥트를 제공하지 못합니다.

멀티노드 클러스터

충분한 가속기 메모리, 고대역폭 네트워크, 호환되는 커널, 그리고 KDA 및 극단적인 Expert Parallelism을 지원하는 런타임이 있을 경우에만 기술적으로 가능성이 있습니다.

슈퍼노드 배포

이것이 Moonshot이 공식적으로 권장하는 방식입니다. 하나의 대규모 통신 도메인에서 64개 이상의 가속기를 사용하는 구성이 권장됩니다. 지원되는 정확한 하드웨어, 처리량 및 메모리 요구 사항은 기술 보고서와 추론 유지관리 문서를 참고해야 합니다.

Kimi Delta Attention과 추론 지원

K3의 Kimi Delta Attention(KDA)은 기존 Attention 구현과 비교해 새로운 Prefix Cache 요구 사항을 만듭니다. Moonshot은 모델 공개와 함께 vLLM 커뮤니티에 KDA Prefill Cache 구현을 제공했다고 밝혔습니다.

관련 릴리스, 버전, 커널 및 하드웨어 지원이 공식 문서로 확인되기 전까지는 일반적인 vLLM 설치만으로 K3를 효율적으로 로드하고 서비스할 수 있다고 가정해서는 안 됩니다.

API와 자체 호스팅 비교

비교 항목공식 API자체 호스팅
시작 시간계정 설정 후 즉시상당한 준비 시간이 필요할 수 있음
인프라서비스 제공자가 관리64개 이상의 가속기를 사용하는 배포 권장
확장성서비스 제공자가 관리사용자가 직접 관리
데이터 제어서비스 제공자의 약관 적용인프라를 더 직접적으로 제어 가능
모델 업데이트서비스 제공자가 관리직접 테스트 및 배포 필요
비용 구조토큰 기반 과금하드웨어, 활용률, 인력, 전력 및 운영 비용
사용자 지정API 및 프롬프트 범위 내라이선스 및 제공 도구에 따라 다름

대부분의 팀에게는 API 사용이 가장 현실적인 선택입니다. 자체 호스팅은 지속적인 대규모 트래픽, 엄격한 데이터 통제 요구 사항, 그리고 이미 대규모 AI 인프라를 보유한 조직에 적합할 수 있습니다.

어떤 라이선스 항목을 확인해야 하나요?

Moonshot이 라이선스를 공개하면 다음 사항을 확인하세요.

  • 상업적 사용이 허용되는가?
  • 가중치를 기반으로 API 서비스를 구축할 수 있는가?
  • 수정된 가중치 및 파인튜닝이 허용되는가?
  • 파생 모델을 재배포할 수 있는가?
  • 사용자 수, 매출 또는 연산량 제한이 있는가?
  • 허용 가능한 사용 정책 제한이 있는가?
  • "Kimi" 또는 "Moonshot" 표기를 유지해야 하는가?
  • 파일마다 서로 다른 라이선스가 적용되는가?

이전 Kimi 모델의 라이선스를 기준으로 K3의 라이선스를 추정해서는 안 됩니다.

Kimi K3를 안전하게 다운로드하는 방법

  1. Moonshot의 공식 출시 페이지 또는 공식 문서에서 시작하세요.
  2. 저장소가 공식 인증된 조직의 것인지 확인하세요.
  3. 수 TB의 데이터를 다운로드하기 전에 라이선스를 읽으세요.
  4. 제공되는 경우 체크섬을 비교하세요.
  5. 모델 구성 및 사용자 지정 런타임 코드를 검토하세요.
  6. 자격 증명이나 네트워크 접근 권한을 부여하기 전에 제한된 환경에서 추론 코드를 실행하세요.
  7. 선택한 런타임 버전이 K3를 명시적으로 지원하는지 확인하세요.
  8. 운영 환경에서 사용하는 정확한 모델 리비전을 기록해 두세요.

Kimi K3는 정말 오픈소스인가요?

이 질문에 대한 답은 7월 27일 이후 업데이트되어야 합니다. Moonshot이 가중치, 개방적인 코드, 명확한 라이선스 및 재현 가능한 추론 구성 요소를 함께 공개한다면 "오픈소스"라는 표현이 적절할 수 있습니다. 반대로 제한적인 라이선스와 함께 가중치만 공개된다면 "오픈 웨이트"가 더 정확한 표현입니다.

그때까지 가장 안전한 표현은 Kimi K3가 전체 가중치 공개가 예정된 오픈 3T급 모델이라는 것입니다.

KDA, Attention Residuals, MoE 및 양자화에 대해서는 Kimi K3 아키텍처 가이드를 참고하세요. 기능과 API 사용 방법은 Kimi K3 리뷰에서 확인할 수 있습니다.

자주 묻는 질문

Kimi K3는 완전한 오픈소스인가요?

최종 답은 가중치, 코드 및 라이선스 공개 내용에 따라 달라집니다. 7월 21일 기준으로 Moonshot은 7월 27일까지 전체 가중치를 공개하겠다고 발표했지만, 아직 전체 릴리스는 검증할 수 없습니다.

Kimi K3는 어디에서 다운로드할 수 있나요?

Moonshot AI 또는 Kimi의 공식 다운로드 링크가 공개될 때까지 기다리세요. 비공식 사이트와 검증되지 않은 파일은 피하는 것이 좋습니다.

Kimi K3를 Mac에서 실행할 수 있나요?

전체 2.8T 모델은 Mac에서 현실적으로 실행할 수 있는 규모가 아닙니다. 이 모델은 대규모 분산 가속기 인프라를 전제로 설계되었습니다.

Kimi K3에는 얼마나 많은 VRAM이 필요한가요?

Moonshot은 지원되는 전체 배포 환경에 필요한 단일 VRAM 수치를 공개하지 않았습니다. 공식 권장 구성은 64개 이상의 가속기를 사용하는 슈퍼노드입니다.

Kimi K3를 상업적으로 사용할 수 있나요?

가중치를 상업적으로 사용할 수 있는지는 릴리스와 함께 제공되는 라이선스에 따라 결정됩니다. API 사용은 별도로 Moonshot의 API 이용 약관이 적용됩니다.

출처

Share: