Semua artikel
panduan9 menit baca

Kimi K3 Arsitektur: KDA, AttnRes dan 896 Pakar MoE

Menjelajahi Kimi K3's 2.8T arsitektur, termasuk Kimi Delta Attention, Residu Attention, Stable LatentMoE, 896 para ahli dan inferensi MXFP4.

Kimi K3 Arsitektur: KDA, AttnRes dan 896 Pakar MoE
panduan

Kimi Arsitektur K3 dijelaskan

Kimi Skala K3 ke 2.8 triliun parameter melalui kombinasi dari Kimi Delta Attention, Residu Attention, dan sistem Stable LatentMoE yang sangat langka dengan 896 para ahli. Hanya 16 para ahli diaktifkan untuk token, memungkinkan total kapasitas model tumbuh jauh lebih cepat daripada komputasi aktif.

Moonshot mengatakan perubahan arsitektur dan pelatihan ini menghasilkan sekitar 2.5× efisiensi skala keseluruhan dari Kimi K2. Itu tidak berarti K3 murah untuk dijalankan. Model ini masih dirancang untuk inferensi skala supernode dengan 64 atau lebih banyak akselerator.

Informasi arsitektur diperiksa Juli 21, 2026. Moonshot telah menerbitkan tinjauan peluncuran, sementara laporan teknis lengkap dan bobot masih direncanakan untuk dirilis. Artikel ini memberi label pertanyaan terbuka daripada menemukan rincian implementasi yang hilang.

Arsitektur dengan sekilas

Komponen Dipublikasikan Kimi K3 Detail
Parameter Total 2.8 triliun
Perhatian Kimi Delta Attention, dengan MLA Gated dalam arsitektur
Sambungan kedalaman Perhatian residu
MoE Stabil LatentMoE
Para ahli 896 ahli yang ditugaskan
Para ahli aktif 16 per token
Keseimbangan Keseimbangan Kuantit
Teknik Optimasi Muon Per Kepala
Komponen aktivasi Unit Tanh Sigmoid
Format berat MXFP4 melalui pelatihan quantisation-aware
Format aktivasi MXFP8
Konteks 1 juta token
Panduan penyebaran Supernode dengan 64+ akselerator

Apa itu Kimi Delta Attention?

Kimi Delta Attention, atau KDA, adalah mekanisme perhatian linier hybrid Moonshot. Perannya adalah untuk menyediakan dasar yang lebih efisien untuk memproses urutan panjang daripada hanya mengandalkan perhatian penuh konvensional pada setiap lapisan dan token.

Metode-metode perhatian linier umumnya berusaha untuk menghindari pertumbuhan kuadrat yang terkait dengan membandingkan setiap token dengan setiap token lainnya. Kata hybrid penting: arsitektur K3 yang tepat menggabungkan komponen perhatian daripada mengurangi model menjadi satu rumus linier sederhana.

KDA adalah pusat dari K3 1M-posisi token, tapi panjang konteks adalah properti sistem. Perataan memori, kernel, KV atau penanganan negara, caching, paralelisme, dan infrastruktur pelayanan semua mempengaruhi apakah konteks panjang praktis.

KDA dan caching prefix

Sistem pelayanan konvensional sering menyimpan keadaan perhatian untuk prefiks berulang. KDA memperkenalkan persyaratan status dan prasisi yang berbeda, sehingga implementasi prefix-cache biasa tidak dapat dianggap bekerja secara efisien.

Moonshot mengatakan ia berkontribusi dukungan prefill cache KDA untuk komunitas vLLM untuk rilis bersama K3. Ini membantu menjelaskan bagaimana pejabat API dapat menawarkan harga input yang terhit cache jauh di bawah input yang tidak terhidangkan meskipun skala model.

Tim infrastruktur harus menunggu dukungan K3 eksplisit dalam rilis vLLM dan kernel yang relevan daripada memodifikasi nama model dalam penyebaran yang ada.

Apa yang tersisa dari perhatian?

Jaringan mendalam tradisional menyampaikan informasi melalui koneksi residual yang menumpuk lapisan demi lapisan. Moonshot menggambarkan Residu Attention, atau AttnRes, sebagai pengambilan representasi secara selektif di kedalaman daripada mengumpulkan semuanya secara seragam.

Manfaat yang dimaksud adalah aliran informasi yang lebih lancar melalui model yang sangat mendalam. Alih-alih memaksa setiap lapisan hanya bergantung pada keadaan yang terkumpul segera, AttnRes dapat menekankan representasi sebelumnya yang berguna.

Ini penting secara konseptual di 2.8T skala, di mana optimasi dan aliran sinyal menjadi sulit. Persamaan lengkap, ablasi, dan rincian pelatihan harus dievaluasi ketika laporan teknis menjadi publik.

Stabil LatentMoE dan 896 ahli

K3 adalah model campuran-pakar. Router memilih subset kecil dari jaringan ahli untuk setiap token.

K3 memiliki:

  • 896 ahli rute;
  • 16 para ahli yang aktif untuk token;
  • Komponen ahli yang dibagi dan diarahkan dalam diagram yang diterbitkan;
  • Rangka kerja Stable LatentMoE yang dirancang untuk kerangka kerja yang sangat langka.

Rasio aktivasi adalah sekitar:

16 / 896 ≈ 1.8%

Persentase itu tidak secara langsung mengungkapkan jumlah parameter aktif. Lapisan bersama, ukuran ahli, routing, perhatian, dan komponen lainnya berkontribusi pada perhitungan di luar rasio sederhana. Treat mengklaim bahwa K3 memiliki nomor parameter aktif yang tepat sebagai tidak diverifikasi kecuali Moonshot menerbitkannya.

Mengapa kemiskinan MoE ekstrim sulit

Lebih banyak ahli menciptakan lebih banyak kapasitas, tetapi juga lebih sulit routing dan masalah infrastruktur:

  • token dapat membebani para ahli populer;
  • kapasitas limbah ahli yang kurang digunakan;
  • penempatan ahli mempengaruhi komunikasi;
  • ketidakseimbangan beban mengurangi penggunaan akselerator;
  • bentuk dinamis dan sinkronisasi host dapat merusak throughput;
  • keputusan rute harus tetap stabil selama pelatihan.

K3 menangani masalah ini dengan keseimbangan, eksekusi bentuk statis, dan domain komunikasi besar.

Keseimbangan Kuantit

Moonshot menggambarkan Quantile Balancing sebagai penerbitan alokasi ahli dari kuantil skor router. Tujuannya adalah untuk menghindari aturan pembaruan heuristik dan hiperparameter keseimbangan yang sensitif.

Dalam bahasa sederhana, alokasi menyesuaikan dengan distribusi skor routing daripada tergantung pada satu ambang yang disetel secara manual. Hal ini relevan ketika 896 para ahli harus tetap berguna dan disambut secara seragam dalam skala.

Hasil reproduksi dan ablasi independen masih diperlukan untuk mengukur berapa banyak kontribusi Quantile Balancing relatif terhadap sistim pelatihan lainnya.

Muon Per Kepala

Muon adalah pendekatan optimasi yang digunakan selama pelatihan. K3 memperpanjangnya pada basis per kepala perhatian, memungkinkan kepala untuk dioptimalkan lebih independen.

Motivasi Moonshot yang dinyatakan adalah optimasi yang lebih adaptif dalam skala besar. Ini adalah teknik pelatihan daripada teknik API fitur: pengguna tidak mengkonfigurasi Muon Per Kepala selama inferensi.

SiTU dan MLA Gated

Tinjauan peluncuran juga mengidentifikasi:

  • Unit Tanh Sigmoid (SiTU): dimaksudkan untuk meningkatkan kontrol aktivasi;
  • MLA yang terbelah: dimaksudkan untuk meningkatkan selektifitas perhatian.

Komponen ini berada di dalam desain blok yang lebih besar yang menggabungkan KDA, ahli laten, ahli bersama, elemen konvolusi, dan gating. Kontribusi yang tepat mereka membutuhkan laporan teknis dan ablasi yang terkontrol.

Berat MXFP4 dan aktivasi MXFP8

K3 menggunakan pelatihan yang sadar tentang kuantisasi dari tahap penyesuaian halus yang diawasi, dengan berat MXFP4 dan aktivasi MXFP8.

Pelatihan yang sadar kuantisasi mengekspos model terhadap perilaku presisi yang lebih rendah selama pelatihan daripada mengubah model presisi tinggi yang sudah selesai sebagai pemikiran setelahnya. Hal ini dapat mempertahankan kualitas yang lebih baik dalam format inferensi yang efisien.

MXFP4 secara substansial mengurangi penyimpanan berat badan teoritis. Pada empat bit per parameter, 2.8T parameter mentah sesuai dengan sekitar 1.4 TB sebelum skala, metadata, komponen non-kvantifikasi, buffer runtime, dan redundansi. Ini masih jauh melampaui perangkat keras konsumen.

Pelatihan para ahli yang seimbang secara penuh

Moonshot mengatakan K3 menggunakan pelatihan paralel ahli yang seimbang dengan bentuk statis dan tidak ada sinkronisasi host di jalur kritis. Pilihan ini menargetkan pekerjaan akselerator yang dapat diprediksi dan mengurangi istirahat yang disebabkan oleh koordinasi CPU.

Pada saat menyimpulkan, tantangan yang sama tetap luas: para ahli yang tersebar di berbagai perangkat harus berkomunikasi dengan cepat. Moonshot merekomendasikan sebuah supernode dengan setidaknya 64 dan akselerator sehingga lebih banyak komunikasi terjadi di dalam domain bandwidth tinggi.

Bagaimana K3 mencapai 1M-context token

Tidak ada komponen tunggal yang menjelaskan 1M jendela. Kemampuan tergantung pada:

  • proses proses urutan KDA yang efisien;
  • aliran informasi yang stabil melalui AttnRes;
  • pelayanan kernel dan manajemen memori;
  • dukungan prefill cache;
  • infrastruktur akselerator terdistribusi;
  • data dan tujuan pelatihan yang mengajarkan model untuk menggunakan konteks panjang.

Sebuah model yang menerima satu juta token tidak berarti setiap token menerima perhatian yang sama atau bahwa permintaan jutaan token selalu merupakan desain terbaik. Evaluasi konteks panjang harus menguji pengambilan, ketergantungan jarak jauh, gangguan, latensi, dan biaya.

Kimi K3 vs Kimi K2

Daerah Kimi K3 arah Kimi K2 garis dasar
Skala 2.8T total parameter Generasi sebelumnya yang lebih kecil
Perhatian KDA hibrida perhatian linier Arsitektur sebelumnya
kedalaman Perhatian residu Desain residu sebelumnya
MoE 896 para ahli, 16 aktif Kecilkan ekstrem
Efisiensi Dikatakan ~2.5× efisiensi skala Basis
Visi Pemahaman visual asli Berbeda permukaan kapasitas sebelumnya
Konteks 1M token Batas sebelumnya yang lebih rendah tergantung pada model

Pembagian 2.5× angka adalah klaim Moonshot keseluruhan efisiensi skala, bukan janji 2.5× API kecepatan atau 2.5× kinerja benchmark.

Batasan arsitektur dan pertanyaan terbuka

Pertanyaan penting yang belum dijawab meliputi:

  • jumlah parameter aktif yang tepat;
  • lapisan penuh dan dimensi ahli;
  • jumlah dan campuran data token pelatihan;
  • metode pelatihan konteks panjang yang lengkap;
  • ablations arsitektur independen;
  • perangkat keras yang didukung dan throughput yang diukur berdasarkan konfigurasi;
  • jejak file berat yang tepat;
  • waktu berjalan dan dukungan lisensi akhir.

Pertanyaan-pertanyaan ini harus dijawab dari laporan teknis Moonshot dan repositori resmi setelah dirilis.

Mengapa arsitektur penting bagi pengembang

Sebagian besar API pengguna tidak perlu menerapkan routing KDA atau MoE. Mereka perlu memahami konsekuensi operasional:

  • K3 kuat dalam pekerjaan yang berat konteks dan agentik;
  • menjaga keadaan percakapan sangat penting;
  • caching otomatis dapat mengurangi biaya secara signifikan;
  • self-hosting membutuhkan infrastruktur yang ekstrim;
  • perilaku model tidak dapat disimpulkan dari jumlah parameter saja;
  • waktu dan kernel baru harus secara eksplisit mendukung K3.

Bacalah Apakah Kimi K3 Open Source? status penyebaran dan Kimi K3 API Panduan untuk integrasi aplikasi.

Pertanyaan yang sering diajukan

Berapa banyak parameter yang Kimi K3 punya?

K3 memiliki 2.8 Triliun total parameter dalam arsitektur campuran-pakar langka.

Berapa banyak ahli yang aktif?

Moonshot mengatakan 16 dari 896 para ahli yang ditugaskan diaktifkan. Komponen bersama dan non-pakar juga berkontribusi pada perhitungan.

Apa itu Kimi Delta Attention?

KDA adalah mekanisme perhatian linier hybrid Moonshot untuk pengolahan urutan yang efisien dan skala konteks panjang.

Mengapa Kimi K3 dukungan 1M konteksnya?

Jendela diaktifkan oleh arsitektur, pelatihan, caching, kernel, manajemen memori, dan distribusi pelayanan daripada satu fitur saja.

Bisa Kimi K3 berjalan pada GPU konsumen?

Model lengkap tidak dapat secara realistis berjalan pada GPU konsumen. Moonshot merekomendasikan penyebaran super node dengan 64 atau lebih banyak akselerator.

Sumber

Blog · PoYo.aiSemua artikel
HUBUNGI KAMI

Punya proyek?

Ceritakan apa yang Anda bangun. Tim kami akan membantu memilih API AI yang tepat.

Data Anda hanya digunakan untuk menanggapi pertanyaan ini.

PoYo AI

Siap menjelajahi model?

Jelajahi model gambar, video, audio, dan bahasa di PoYo.

Lihat model AI