Kimi K3 API Harga: Biaya token, tabungan cache dan contoh
Memahami Kimi K3 API harga untuk input yang disimpan di caching, input dan output yang tidak disimpan di caching, dengan contoh biaya untuk agen pengkodean, penelitian dan 1M- Kontext token.


Kimi K3 API harga memiliki tiga tingkat: input yang disimpan di cache, input yang tidak disimpan di cache, dan output. Perbedaan antara cache hit dan miss adalah 10×, jadi dua agen yang memproses yang sama 500K- repositori token dapat memiliki biaya yang sangat berbeda tergantung pada desain sesi.
Moonshot tidak menambahkan tingkat per token yang lebih tinggi untuk K3 1- Jendela konteks jutaan token. Konteks panjang masih belum bebas: sebuah yang tidak disimpan 1M-Token prompt biaya $3 sebelum model menghasilkan jawaban.
Ketersediaan dan harga diperbarui Juli 22, 2026. Kimi K3 tersedia di Poyo.ai sebagai
kimi-k3melalui OpenAI-Kompatibel Chat Completions API. Harga adalah $2.28 per 1M token input dan $11.40 per 1M output token — 24% harga yang lebih rendah dari harga resmi.
Resmi Kimi K3 API harga
| Penggunaan | Harga per 1M token |
|---|---|
| input yang terhit cache | $0.30 |
| input cache-miss | $3.00 |
| Output | $15.00 |
K3 menggunakan harga bayar-as-you-go tetap. Dokumen Moonshot tidak menyebutkan biaya tambahan yang terpisah. Pembagian API mencoba cache konteks secara otomatis; aplikasi tidak membuat cache ID atau mengkonfigurasi TTL untuk permintaan biasa.
Kimi Rumus biaya K3
Gunakan rumus ini untuk satu permintaan atau beban kerja agregat:
cost =
cached_input_tokens / 1,000,000 × $0.30
+ uncached_input_tokens / 1,000,000 × $3.00
+ output_tokens / 1,000,000 × $15.00
Pembagian API respon penggunaan dan billing dashboard harus menjadi sumber kebenaran. Perkiraan dapat berbeda ketika tokenizasi, percobaan ulang, alat berputar, atau perilaku caching berubah.
Benar-benar Kimi Contoh biaya K3
Permintaan analisis singkat
Anggap saja 10,000 token input yang tidak disimpan dan 2,000 token output.
| Komponen | Perhitungan | Biaya |
|---|---|---|
| Input | 10K / 1M × $3 | $0.03 |
| Output | 2K / 1M × $15 | $0.03 |
| Total | $0.06 |
Bahkan dengan enam kali lebih banyak input daripada output, kedua bagian biaya sama karena output token lima kali lebih mahal.
A. 100K-Review token repository
Anggap saja 100,000 token input yang tidak disimpan dan 10,000 token output.
| Komponen | Biaya |
|---|---|
| Input | $0.30 |
| Output | $0.15 |
| Total | $0.45 |
Jika prefiks repositori stabil yang sama menerima cache hit pada gilirannya berikutnya, bagian inputnya jatuh dari $0.30 untuk $0.03.
A. 500K-Token research corpus
Anggap saja 500,000 token input dan 20,000 token output.
| Status cache | Biaya input | Biaya output | Total |
|---|---|---|---|
| Cache miss | $1.50 | $0.30 | $1.80 |
| Cache hit | $0.15 | $0.30 | $0.45 |
Itulah mengapa sesi kerja pengetahuan berulang mendapat manfaat dari prefiks yang stabil. Setelah output menjadi biaya terbesar, meminta model untuk ringkas bisa sama pentingnya dengan caching.
Penuh 1M konteks dengan 50K output
| Status cache | Biaya input | Biaya output | Total |
|---|---|---|---|
| Cache miss | $3.00 | $0.75 | $3.75 |
| Cache hit | $0.30 | $0.75 | $1.05 |
Pembagian 1M jendela adalah kapasitas maksimum, bukan target untuk setiap permintaan. Pengumpulan dan analisis bertahap mungkin lebih murah dan lebih mudah untuk diverifikasi.
Biaya agen pengkodean berputar-putar
Pertimbangkan sesi pengkodean lima putaran dengan 200K-token stabil repositori prefix, 20K token input baru per putaran, dan 8K output token per putaran.
Jika putaran pertama gagal dan kemudian prefixes stabil memukul:
| Penggunaan | Biaya perkiraan |
|---|---|
| Awal 200K Prefix yang tidak disimpan | $0.60 |
| Empat 200K cached prefix membaca | $0.24 |
| Lima × 20K input baru yang tidak disimpan | $0.30 |
| Lima × 8K output | $0.60 |
| Total | $1.74 |
Jika aplikasi mengubah awal konteks setiap putaran dan mencegah penggunaan ulang, lima membaca yang tidak disimpan dari 200K Prefix saja akan dikenakan biaya $3.00. Konstruksi sesi menciptakan perbedaan yang lebih besar daripada suntingan prompt kecil.
Cara kerja caching konteks otomatis
Moonshot mengatakan caching otomatis untuk permintaan K3 biasa. Untuk memberikan layanan kesempatan terbaik untuk menggunakan ulang prefiks:
- menjaga awal panjang percakapan tidak berubah;
- Tambahkan pertanyaan baru dan hasil alat alih-alih menulis ulang pesan lama;
- menghindari timestamp dinamis dan meminta ID di dekat awal;
- menjaga instruksi sistem stabil;
- menyimpan pesan asisten lengkap yang diminta oleh K3;
- kelompok pengguna dan dokumen dengan benar sehingga data yang tidak terkait tidak pernah berbagi status aplikasi.
Sebuah cache hit adalah optimasi, bukan jaminan. Memantau jumlah token yang disimpan dan tidak disimpan yang dikembalikan oleh layanan.
Token output bisa mendominasi tagihan
Harga output K3 adalah $15 per juta token, lima kali tingkat input yang tidak disimpan dan 50 kali tingkat input cache. Pertimbangan panjang dan laporan agen yang kasar dapat menghapus tabungan input-cache.
Biaya output kontrol dengan:
- menetapkan sebuah realistis
max_completion_tokensnilai; - meminta artefak akhir yang ringkas;
- menggunakan output terstruktur yang hanya mencakup bidang yang diperlukan;
- menghindari pengulangan berulang rencana besar;
- mengukur apakah upaya penalaran yang lebih rendah dapat menyelesaikan tugas dengan andal;
- menghentikan loop alat setelah verifikasi atau ambang kegagalan yang ditentukan.
Jangan memotong sejarah pemikiran yang diperlukan dari putaran kemudian hanya untuk menyimpan token. Moonshot memperingatkan bahwa keadaan tidak lengkap dapat membuat K3 tidak stabil, yang dapat menciptakan lebih banyak percobaan ulang dan biaya total yang lebih tinggi.
Kimi K3 vs biaya hosting sendiri
Berat terbuka tidak membuat inferensi bebas. K3 memiliki 2.8T total parameter, menggunakan paralelisme ahli ekstrim, dan direkomendasikan untuk supernodes dengan 64 atau lebih banyak akselerator. Self-hosting menambah biaya hardware, jaringan, teknik, penggunaan, pemantauan, dan ketersediaan.
API akses umumnya merupakan pilihan praktis untuk lalu lintas variabel atau sederhana. Self-hosting menjadi diskusi strategis bagi organisasi dengan pemanfaatan berkelanjutan, keahlian infrastruktur, persyaratan kontrol data, dan akses ke kluster yang sesuai. Tunggu lisensi berat badan yang sebenarnya dan tumpukan inferensi yang didukung sebelum membangun anggaran.
Bagaimana mengurangi Kimi K3 API biaya
- Gunakan model yang lebih kecil untuk klasifikasi, routing, dan ekstraksi yang mudah.
- Kirimkan K3 hanya tugas yang mendapat manfaat dari alasan horisontal panjang atau konteks multimodal.
- Jaga prefiks yang dapat digunakan kembali stabil.
- Dapatkan subset yang relevan ketika alasan konteks penuh tidak diperlukan.
- Tentukan output terbatas dan batas loop alat.
- Bandingkan
low,high, danmaxpenalaran pada set evaluasi nyata. - Biaya log per keberhasilan yang diverifikasi, termasuk percobaan ulang.
- Pelacak kegagalan parah dan waktu koreksi manusia.
Apakah Kimi K3 mahal?
K3 murah ketika prefiks panjang yang disimpan di cache mendukung tugas bernilai tinggi dan output tetap terfokus. Ini bisa mahal ketika setiap giliran melewatkan cache, mengeluarkan penyelesaian yang panjang, dan memicu beberapa percobaan ulang.
Perbandingan yang berguna bukan dolar per juta token secara terpisah:
effective task cost =
API cost per attempt × attempts per verified success
+ human correction cost
Untuk konteks kemampuan dan benchmark, baca Kimi K3 review dan Kimi K3 analisis benchmark.
Pertanyaan yang sering diajukan
Berapa banyaknya Kimi K3 per juta token?
Tingkat resmi Moonshot adalah $0.30 untuk input cache-hit, $3 untuk input cache-miss, dan $15 untuk output.
Apakah 1M jendela konteks memiliki harga token yang lebih tinggi?
Moonshot mencantumkan tingkat rata-rata bukan tingkat konteks panjang terpisah. Sebuah prompt yang lebih besar masih lebih mahal karena berisi lebih banyak token.
Apakah ada gratis Kimi K3 API?
Kredit promosi atau penawaran pihak ketiga dapat berubah. Jangan membangun model biaya produksi di sekitar akses bebas sementara; memverifikasi istilah konsol dan penyedia resmi.
Apakah token penalaran dibilling?
Gunakan tanggapan penggunaan resmi dan dokumentasi fakturasi untuk akuntansi akhir setiap permintaan. K3 mengalir alasan terpisah dari konten akhir, dan alasan panjang dapat meningkatkan penggunaan token yang dihasilkan.
Apakah Kimi K3 tersedia di Poyo.ai?
Ya. Pembagian Kimi Halaman model K3 mencakup taman bermain langsung, ID model kimi-k3, API akses, dan arus Poyo harga: $2.28 input dan $11.40 output per 1M token, 24% lebih rendah dari harga resmi.

