
I prezzi dell'API Kimi K3 prevedono tre tariffe: input memorizzato in cache, input non memorizzato e output. La differenza tra cache hit e cache miss è di 10×, quindi due agenti che elaborano lo stesso repository da 500K token possono avere costi molto diversi a seconda di come è progettata la sessione.
Moonshot non applica una tariffa per token più elevata alla finestra di contesto da 1 milione di token di K3. Il contesto lungo non è comunque gratuito: un prompt da 1M token non memorizzato in cache costa $3 prima ancora che il modello produca una risposta.
Disponibilità e prezzi aggiornati al 22 luglio 2026. Kimi K3 è disponibile su Poyo.ai con l'ID
kimi-k3tramite l'API Chat Completions compatibile con OpenAI. Il prezzo è di $2.28 per 1M di token in input e $11.40 per 1M di token in output, ossia il 24% in meno rispetto al prezzo ufficiale.
Prezzi ufficiali Kimi K3 API
| Utilizzo | Prezzo per 1M token |
|---|---|
| Input con cache hit | $0.30 |
| Input con cache miss | $3.00 |
| Output | $15.00 |
K3 applica tariffe fisse a consumo. La documentazione di Moonshot non indica un supplemento separato per i contesti lunghi. L'API tenta automaticamente di memorizzare il contesto in cache; per le richieste ordinarie, le applicazioni non devono creare un ID cache né configurare un TTL.
Formula di costo di Kimi K3
Utilizza questa formula per una richiesta o un carico di lavoro aggregato:
cost =
cached_input_tokens / 1,000,000 × $0.30
+ uncached_input_tokens / 1,000,000 × $3.00
+ output_tokens / 1,000,000 × $15.00
La risposta relativa all'utilizzo dell'API e la dashboard di fatturazione devono essere la fonte di riferimento. Le stime possono differire quando cambiano la tokenizzazione, i tentativi, i turni degli strumenti o il comportamento della cache.
Esempi di costi reali Kimi K3
Breve richiesta di analisi
Supponiamo 10,000 token di input non memorizzati in cache e 2,000 token di output.
| Componente | Calcolo | Costo |
|---|---|---|
| Input | 10K / 1M × $3 | $0.03 |
| Output | 2K / 1M × $15 | $0.03 |
| Totale | $0.06 |
Anche con un input sei volte superiore all’output, entrambe le parti costano lo stesso perché i token di output sono cinque volte più costosi.
Una recensione del repository di 100K token
Supponiamo 100,000 token di input non memorizzati in cache e 10,000 token di output.
| Componente | Costo |
|---|---|
| Input | $0.30 |
| Output | $0.15 |
| Totale | $0.45 |
Se lo stesso prefisso del repository stabile riceve un cache hit al turno successivo, la sua porzione di input cade da $0.30 a $0.03.
Un corpus di ricerca da 500K token
Supponiamo 500,000 token di input e 20,000 token di output.
| Stato della cache | Costo di input | Costo di produzione | Totale |
|---|---|---|---|
| Cache miss | $1.50 | $0.30 | $1.80 |
| Cache hit | $0.15 | $0.30 | $0.45 |
Ecco perché le sessioni ripetute di lavoro conoscitivo beneficiano di un prefisso stabile. Una volta che l’output diventa il costo maggiore, chiedere al modello di essere conciso può avere la stessa importanza della memorizzazione nella cache.
Contesto completo da 1M con output da 50K
| Stato della cache | Costo di input | Costo di produzione | Totale |
|---|---|---|---|
| Cache miss | $3.00 | $0.75 | $3.75 |
| Cache hit | $0.30 | $0.75 | $1.05 |
La finestra 1M rappresenta la capacità massima, non l'obiettivo per ogni richiesta. Il recupero e l'analisi graduale possono essere più economici e più facili da verificare.
Costo di un agente di programmazione multi-turno
Considera una sessione di programmazione in cinque turni con un prefisso stabile del repository da 200K token, 20K nuovi token di input per turno e 8K token di output per turno.
Se il primo turno produce un cache miss e quelli successivi riutilizzano il prefisso stabile:
| Utilizzo | Costo approssimativo |
|---|---|
| Prefisso non memorizzato nella cache 200K iniziale | $0.60 |
| Quattro letture del prefisso memorizzato nella cache 200K | $0.24 |
| Cinque × 20K nuovo input non memorizzato nella cache | $0.30 |
| Cinque × 8K uscita | $0.60 |
| Totale | $1.74 |
Se l'applicazione modifica l'inizio del contesto ogni turno e impedisce il riutilizzo, cinque letture non memorizzate nella cache del solo prefisso 200K costerebbero $3.00. La costruzione della sessione crea una differenza maggiore rispetto alle piccole modifiche ai prompt.
Come funziona la memorizzazione automatica del contesto nella cache
Moonshot afferma che la memorizzazione in cache è automatica per le normali richieste K3. Per offrire al servizio le migliori possibilità di riutilizzare un prefisso:
- mantenere inalterato il lungo inizio della conversazione;
- aggiungere nuove domande e risultati dello strumento invece di riscrivere i vecchi messaggi;
- evitare timestamp dinamici e ID delle richieste vicino all'inizio;
- mantenere stabili le istruzioni del sistema;
- preservare l'intero messaggio di assistenza richiesto da K3;
- raggruppare correttamente utenti e documenti in modo che dati non correlati non condividano mai lo stato dell'applicazione.
Un cache hit è un'ottimizzazione, non una garanzia. Monitora i conteggi effettivi dei token memorizzati e non memorizzati in cache restituiti dal servizio.
I token di output possono dominare il conto
Il prezzo di output di K3 è di $15 per milione di token, cinque volte la tariffa dell'input non memorizzato in cache e 50 volte quella dell'input memorizzato. Ragionamenti lunghi e report dettagliati degli agenti possono annullare i risparmi della cache di input.
Controlla i costi di output in questi modi:
- imposta un valore
max_completion_tokensrealistico; - richiedere artefatti finali concisi;
- usa un output strutturato che includa solo i campi obbligatori;
- evitare ripetute riformulazioni di grandi piani;
- misurare se uno sforzo di ragionamento inferiore risolve il compito in modo affidabile;
- arresta i cicli degli strumenti dopo la verifica o al raggiungimento di una soglia di errore definita.
Non tagliare la cronologia di pensiero richiesta dai turni successivi semplicemente per risparmiare token. Moonshot avverte che lo stato incompleto può rendere instabile K3, il che potrebbe creare più tentativi e costi totali più elevati.
Kimi K3 rispetto al costo del self-hosting
I pesi aperti non rendono gratuita l’inferenza. K3 ha 2.8T parametri totali, usa un parallelismo estremo tra esperti ed è consigliato per supernodi con 64 o più acceleratori. Il self-hosting aggiunge costi per hardware, rete, ingegneria, utilizzo, monitoraggio e disponibilità.
L'accesso via API è generalmente l'opzione pratica per un traffico variabile o moderato. Il self-hosting diventa una scelta strategica per le organizzazioni con utilizzo costante, competenze infrastrutturali, requisiti di controllo dei dati e accesso a cluster adeguati. Prima di definire un budget, attendi la licenza effettiva dei pesi e lo stack di inferenza supportato.
Come ridurre i costi di Kimi K3 API
- Utilizza un modello più piccolo per la classificazione, il routing e l'estrazione semplice.
- Invia a K3 solo le attività che beneficiano di un ragionamento a lungo orizzonte o di un contesto multimodale.
- Mantieni stabili i prefissi riutilizzabili.
- Recupera il sottoinsieme rilevante quando non serve ragionare sull'intero contesto.
- Imposta limiti per l'output e per i cicli degli strumenti.
- Confronta il ragionamento
low,highemaxsu un set di valutazione reale. - Registra il costo per successo verificato, inclusi i nuovi tentativi.
- Tieni traccia dei guasti gravi e dei tempi di correzione umana.
Kimi K3 è costoso?
K3 è poco costoso quando un prefisso lungo memorizzato nella cache supporta un'attività di alto valore e l'output rimane focalizzato. Può essere costoso quando ogni turno non raggiunge la cache, genera un completamento lungo e attiva più tentativi.
Il confronto utile non è quello dei dollari per milione di token presi isolatamente:
effective task cost =
API cost per attempt × attempts per verified success
+ human correction cost
Per informazioni sulle funzionalità e sul contesto dei benchmark, leggi la recensione Kimi K3 e l'analisi benchmark Kimi K3.
Domande frequenti
Quanto costa Kimi K3 per milione di token?
Le tariffe ufficiali Moonshot sono $0.30 per input di cache-hit, $3 per input di cache-miss e $15 per output.
La finestra di contesto 1M ha un prezzo token più alto?
Moonshot elenca tariffe forfettarie anziché un livello separato a contesto lungo. Un prompt più grande costa ancora di più perché contiene più token.
Esiste un'API Kimi K3 gratuita?
I crediti promozionali o le offerte di terze parti possono cambiare. Non costruire un modello di costo per la produzione basato su un accesso gratuito temporaneo; verifica i termini ufficiali della console e del provider.
I token di ragionamento vengono fatturati?
Utilizza la risposta ufficiale sull'utilizzo e la documentazione di fatturazione per la contabilità finale di ciascuna richiesta. K3 trasmette il ragionamento separatamente dal contenuto finale e un ragionamento lungo può aumentare l'utilizzo del token generato.
Kimi K3 è disponibile su Poyo.ai?
Sì. La pagina del modello Kimi K3 include il playground live, l'ID modello kimi-k3, l'accesso API e i prezzi attuali di Poyo: input $2.28 e output $11.40 per 1M token, 24% inferiore al prezzo ufficiale.