
Kimi K3 è il modello di punta da 2.8 trilioni di parametri di Moonshot AI per codifica a lungo orizzonte, lavoro basato sulla conoscenza, ragionamento visivo e agenti che utilizzano strumenti. Combina una finestra di contesto da 1 milione di token con la comprensione nativa di immagini e video, ragionamento sempre attivo, output strutturato e un'architettura di miscela di esperti insolitamente sparsa.
I numeri dei titoli sono impressionanti, ma non rispondono alle domande pratiche. Kimi K3 è migliore dei modelli chiusi più potenti? Il suo contesto 1M è utile o semplicemente costoso? Gli sviluppatori possono ospitare autonomamente un modello 2.8T? E quali limitazioni contano quando K3 controlla gli strumenti per ore invece di rispondere a una richiesta?
Questa revisione separa le funzionalità confermate dalle dichiarazioni di lancio e spiega dove si inserisce Kimi K3 in uno stack di modelli di produzione.
Disponibilità su Poyo aggiornata il 22 luglio 2026. Kimi K3 è disponibile tramite Poyo.ai come
kimi-k3e tramite i prodotti ufficiali Moonshot AI. Moonshot afferma che il rilascio dei pesi completi del modello è previsto entro il 27 luglio 2026; questo articolo verrà aggiornato quando i pesi e la licenza saranno pubblici.
Kimi K3 a colpo d'occhio
| Specificazione | Kimi K3 |
|---|---|
| Fornitore | Moonshot AI |
| ID modello | kimi-k3 nell'API ufficiale di Moonshot |
| Parametri totali | 2.8 trilioni |
| Architettura | KDA, residui di attenzione, MoE latente stabile |
| Esperti | 896 totali, 16 attivi |
| Finestra contestuale | 1 milione di token |
| Completamento massimo | 131,072 token per impostazione predefinita; configurabile fino a 1,048,576 |
| Ingressi | Testo, immagini e video caricati |
| Uscita | Testo |
| Ragionamento | Sempre attivo; sforzo low, high e max |
| Caratteristiche dell'agente | Chiamata degli strumenti, uso obbligatorio degli strumenti e caricamento dinamico |
| Risultati strutturati | Schema JSON rigoroso |
| Cache del contesto | Automatico |
| Stato ufficiale API | Disponibile |
| Poyo.ai stato | Disponibile come kimi-k3 |
| Pesi completi | Annunciato il rilascio entro il 27 luglio 2026 |
Kimi K3 utilizza la scala estrema in modo diverso da un modello 2.8T denso. Stable LatentMoE instrada ciascun token attraverso 16 dei 896 esperti, quindi il conteggio totale dei parametri non è lo stesso del calcolo attivo su ogni token. Questa distinzione è importante quando si confrontano architettura, intelligenza e costi di implementazione.
A cosa serve Kimi K3
Moonshot posiziona K3 attorno a due ampi carichi di lavoro: ingegneria del software a lungo orizzonte e lavoro di conoscenza end-to-end.
Codifica a lungo orizzonte
K3 è costruito per rimanere produttivo anche durante lunghe sessioni di progettazione. Gli esempi ufficiali enfatizzano la navigazione in repository di grandi dimensioni, l'orchestrazione dei terminali, l'ottimizzazione del kernel GPU, lo sviluppo del compilatore, l'ingegneria del frontend, lo sviluppo di giochi, il CAD e la codifica scientifica.
Questo è un obiettivo diverso dal completamento automatico. Un modello di codifica a lungo orizzonte deve ispezionare ripetutamente lo stato, scegliere uno strumento, interpretare il risultato, rivedere il proprio piano e verificare l'artefatto finale. La persistenza e il ripristino possono essere più importanti della qualità del primo esempio di codice.
Visione nel ciclo di codifica
K3 ha una comprensione visiva nativa. Può utilizzare screenshot e output renderizzato come feedback durante la modifica del codice. Ciò supporta l'iterazione del frontend, il QA visivo, i giochi, le scene 3D, i diagrammi e altri flussi di lavoro in cui il superamento dei test unitari non è sufficiente.
L'API ufficiale accetta dati di immagine e video caricati. Gli URL di immagini pubbliche non sono accettati direttamente nei messaggi di visione: le immagini devono essere fornite come base64 o tramite la gestione file supportata e il video viene referenziato tramite un ID file Moonshot.
Lavoro di conoscenza
K3 è rivolto anche a ricerche, report, fogli di calcolo, diapositive, dashboard e analisi in più fasi. Un contesto 1M token può contenere un ampio set di prove, ma un lavoro di conoscenza utile richiede comunque il controllo del codice sorgente, i controlli delle citazioni e la verifica. Una grande finestra riduce la necessità di scartare il contesto; non garantisce che ogni fatto venga ricordato o ponderato correttamente.
Quanto sono buoni i benchmark Kimi K3?
Il rapporto sul lancio di Kimi copre la riparazione del repository, le attività del terminale, la costruzione dell'intero programma, il lavoro di conoscenza, l'automazione, la navigazione e le valutazioni multimodali. Il modello riportato è più importante di qualsiasi singolo punteggio: K3 è più forte su flussi di lavoro lunghi e ad agenti e rimane competitivo con i principali modelli chiusi della suite ufficiale.
Le avvertenze contano:
- I risultati Kimi K3 generalmente utilizzano il massimo sforzo di ragionamento.
- I modelli non sono stati sempre valutati con lo stesso framework dell'agente.
- Alcune attività sono state eseguite su ambienti calibrati H20 anziché sull'hardware standard del benchmark.
- Il rapporto ufficiale rileva un comportamento di riserva per almeno un modello concorrente.
- Le classifiche indipendenti ad ampia intelligenza non collocano K3 al primo posto assoluto.
Analisi indipendenti attualmente collocano il K3 vicino alla frontiera piuttosto che chiaramente al di sopra di essa. Ciò è coerente con l'affermazione di Moonshot secondo cui K3 è ancora dietro ai modelli proprietari più forti in assoluto.
Per le tabelle dei punteggi, le note di cablaggio e la distinzione tra ufficiale e indipendente, leggi Spiegazione dei benchmark Kimi K3.
Prezzi Kimi K3 API
Moonshot elenca tariffe fisse con pagamento in base al consumo con prezzi di input separati memorizzati nella cache e non memorizzati nella cache.
| Tipo di token | Prezzo ufficiale per 1M token |
|---|---|
| Input di successo nella cache | $0.30 |
| Ingresso mancato nella cache | $3.00 |
| Uscita | $15.00 |
Non esiste una fascia di prezzo più alta semplicemente perché una richiesta utilizza un contesto lungo. Il conto totale può ancora diventare elevato: un milione di token di input non memorizzati nella cache costa $3 prima dell'output, mentre i token di output 50,000 aggiungono $0.75.
La memorizzazione nella cache automatica può cambiare l'economia dei repository ripetuti e dei flussi di lavoro di ricerca. Un prefisso 500K token stabile costa $1.50 in caso di errore, ma $0.15 in caso di successo della cache. Le applicazioni dovrebbero registrare il comportamento della cache anziché dare per scontato che ogni richiesta ripetuta riceva la velocità inferiore.
Consulta Spiegazione dei prezzi di Kimi K3 API per esempi completi di carichi di lavoro e strategie di memorizzazione nella cache.
Kimi K3 vs GPT-5.6 Sol
K3 e GPT-5.6 Sol si sovrappongono nella codifica di fascia alta, negli agenti, nel ragionamento e nel lavoro professionale, ma rappresentano compromessi diversi.
| Area decisionale | Kimi K3 | GPT-5.6 Sol |
|---|---|---|
| Vantaggio primario | 1M contesto e pesi aperti previsti | Prestazioni del modello chiuso di fascia alta più elevate |
| Codifica | Forte codifica visiva e a lungo orizzonte | Forte codifica generale e prestazioni del terminale |
| Ingresso multimodale | Comprensione nativa di immagini e video | Le capacità multimodali dipendono dall'attuale superficie API |
| Contesto | 1M token | Verificare il limite dell'endpoint corrente |
| Pesi aperti | Annunciato | No |
| Distribuzione | API ufficiale o futuro cluster self-hosted molto grande | Ospitato API |
| Maturità produttiva | Appena lanciato | Fondata la piattaforma OpenAI |
Nessun modello vince ogni carico di lavoro. K3 è interessante per i team che apprezzano il contesto lungo, la codifica multimodale e l'accesso futuro al peso. GPT-5.6 Sol rimane interessante quando la qualità indipendente di fascia alta, il comportamento maturo della piattaforma e l'infrastruttura ospitata chiusa contano di più.
Leggi la guida completa alla decisione in Kimi K3 vs GPT-5.6 Sol.
Punti di forza Kimi K3
Un contesto lavorativo davvero ampio
Un milione di token offre agli agenti spazio per codice sorgente, documentazione, cronologia degli strumenti, prove visive e artefatti intermedi. Ciò è particolarmente utile quando il recupero aggressivo separerebbe le prove che devono essere considerate insieme.
Codifica e visione in un unico modello
K3 può ispezionare un risultato renderizzato invece di fare affidamento solo sul codice sorgente o sui log di testo. Ciò lo rende rilevante per l'ingegneria dell'interfaccia utente, i giochi, il CAD, la visualizzazione dei dati e i flussi di lavoro multimediali.
Funzionalità API orientate agli agenti
L'API ufficiale supporta strumenti personalizzati, uso forzato degli strumenti, caricamento dinamico degli strumenti, streaming, output strutturato e lunghe sessioni multigiro. Si tratta di elementi costitutivi della produzione piuttosto che di funzionalità di sola chat.
Direzione del peso aperto
Moonshot descrive il K3 come il primo modello aperto della classe 3T e ha annunciato i pesi completi. Se il rilascio e la licenza consentiranno un ampio utilizzo, offriranno ai team dell'infrastruttura un maggiore controllo rispetto ai modelli chiusi solo API. La disponibilità, i termini della licenza e il supporto per l'inferenza della community devono essere comunque verificati dopo il rilascio.
Limitazioni Kimi K3
La storia del pensiero deve essere preservata
Moonshot avverte che K3 è stato addestrato con la storia del pensiero preservata. Un client che elimina lo stato dell'assistente richiesto, mantiene solo il testo finale o cambia modello nel mezzo di una sessione può causare una qualità instabile. Ciò rende essenziale la corretta gestione dello stato della conversazione.
Può essere eccessivamente proattivo
L’addestramento a lungo orizzonte incoraggia il modello a continuare a muoversi. In situazioni ambigue, K3 può prendere decisioni non autorizzate dall'utente. Gli agenti di produzione necessitano di limiti espliciti, strumenti mirati, passaggi di approvazione e istruzioni chiare su quando fermarsi.
Il modello più grande non è un modello di laptop locale
Anche con i pesi MXFP4 e l'attivazione sparsa degli esperti, un modello 2.8T è un'implementazione su scala infrastrutturale. Moonshot consiglia configurazioni di supernodo con 64 o più acceleratori. I pesi aperti non renderanno pratico il K3 su una GPU consumer o su una normale workstation.
La produzione è relativamente costosa
A $15 per milione di token di output, il comportamento dettagliato dell'agente può dominare il conto. Le applicazioni dovrebbero stabilire limiti di completamento ragionevoli e misurare il costo per attività verificata, non il prezzo per richiesta.
Alcuni dettagli sulla versione sono ancora in sospeso
Al 21 luglio, i pesi completi, la licenza finale e il rapporto tecnico non sono ancora pubblici. Gli articoli che sostengono un processo di installazione locale completo prima che esistano tali artefatti dovrebbero essere trattati con cautela.
Chi dovrebbe utilizzare Kimi K3?
K3 è un forte candidato per:
- agenti di codifica su scala di repository;
- flussi di lavoro terminali che richiedono persistenza;
- iterazione di frontend, giochi, CAD e software visivo;
- ricerche di documenti di lunga durata e artefatti professionali;
- analisi multimodale con immagini o video caricati;
- team che valutano futuri schieramenti di frontiera a peso aperto.
Potrebbe essere inutilmente grande o costoso per:
- classificazione, estrazione e supporto semplice;
- risposte brevi sensibili alla latenza;
- piccoli ambienti self-hosted;
- flussi di lavoro che non possono preservare lo stato completo della conversazione;
- agenti senza forti limiti di autorizzazione e verifica.
Verdetto Kimi K3
Kimi K3 è uno dei lanci di modello aperto più importanti di 2026 perché combina un'architettura su scala di frontiera, una finestra di contesto 1M, comprensione visiva nativa e un agente serio API. Il suo caso d'uso più convincente non è una domanda di benchmark one-shot. È un lavoro prolungato su codice, strumenti, documenti e feedback visivo.
Il modello non sostituisce automaticamente i sistemi chiusi più resistenti. La valutazione indipendente, i costi di produzione, i requisiti di gestione statale, l’eccessiva proattività e i requisiti estremi di self-hosting sono tutti fattori importanti. La giusta decisione di produzione è testare K3 su attività rappresentative a lungo termine e confrontare i costi per risultato verificato.
Segui la pagina del modello Kimi K3 per la disponibilità di Poyo.ai, gli ID modello confermati e i prezzi.
Domande frequenti
Kimi K3 è open source?
Moonshot definisce K3 un modello aperto di classe 3T e afferma che i pesi completi saranno rilasciati entro il 27 luglio 2026. Al 21 luglio, gli sviluppatori dovranno attendere i file e la licenza effettivi prima di avanzare richieste di distribuzione o di utilizzo commerciale.
Quanto è grande la finestra di contesto Kimi K3?
Kimi K3 supporta una finestra di contesto da 1 milione di token. La memorizzazione nella cache automatica del contesto è disponibile nell'API ufficiale.
Kimi K3 è migliore di GPT-5.6 Sol?
Non universalmente. K3 è particolarmente interessante per contesti lunghi, pesi aperti pianificati, codifica multimodale e flussi di lavoro degli agenti. GPT-5.6 Sol conserva vantaggi in alcune valutazioni indipendenti e di fascia alta. Testarli entrambi sugli stessi compiti.
Kimi K3 supporta immagini e video?
Sì. L'API ufficiale supporta l'input di immagini e l'input video caricato. Restituisce testo anziché immagini o video generati.
Quanto costa Kimi K3 API?
Moonshot elenca $0.30 per milione di token di input con riscontro nella cache, $3 per milione di token di input con mancato riscontro nella cache e $15 per milione di token di output.
Kimi K3 può essere eseguito localmente?
Non sul normale hardware di consumo. Il modello 2.8T è destinato a grandi infrastrutture distribuite, anche se è attivo solo un sottoinsieme di esperti per token.