
O Kimi K3 é o modelo principal da Moonshot AI com 2,8 trilhões de parâmetros, desenvolvido para programação de longo prazo, trabalho de conhecimento, raciocínio visual e agentes com uso de ferramentas. Ele combina uma janela de contexto de 1 milhão de tokens com compreensão nativa de imagens e vídeos, raciocínio sempre ativo, saída estruturada e uma arquitetura Mixture-of-Experts extremamente esparsa.
Os números de destaque são impressionantes, mas não respondem às perguntas práticas. O Kimi K3 é melhor que os modelos fechados mais fortes? O contexto de 1M é realmente útil ou apenas caro? Desenvolvedores podem hospedar localmente um modelo de 2,8T? E quais limitações importam quando o K3 controla ferramentas por horas em vez de responder a um único prompt?
Esta análise separa recursos confirmados de afirmações de lançamento e explica onde o Kimi K3 se encaixa em uma pilha de modelos de produção.
Disponibilidade no Poyo atualizada em 22 de julho de 2026. O Kimi K3 está disponível no Poyo.ai com o ID
kimi-k3e pelos produtos oficiais da Moonshot AI. A Moonshot informa que os pesos completos estão programados para lançamento até 27 de julho de 2026.
Kimi K3 em resumo
| Especificação | Kimi K3 |
|---|---|
| Provedor | Moonshot AI |
| ID do modelo | kimi-k3 na API oficial da Moonshot |
| Parâmetros totais | 2,8 trilhões |
| Arquitetura | KDA, Attention Residuals, Stable LatentMoE |
| Especialistas | 896 no total, 16 ativados |
| Janela de contexto | 1 milhão de tokens |
| Máximo de conclusão | 131.072 tokens por padrão; configurável até 1.048.576 |
| Entradas | Texto, imagens e vídeo enviado |
| Saída | Texto |
| Raciocínio | Sempre ativo; esforço low, high e max |
| Recursos de agente | Chamada de ferramentas, escolha obrigatória de ferramentas, carregamento dinâmico de ferramentas |
| Saída estruturada | JSON Schema estrito |
| Cache de contexto | Automático |
| Status da API oficial | Disponível |
| Status do Poyo.ai | Disponível como kimi-k3 |
| Pesos completos | Anunciados para lançamento até 27 de julho de 2026 |
O Kimi K3 usa uma escala extrema de forma diferente de um modelo denso de 2,8T. O Stable LatentMoE direciona cada token por 16 dos 896 especialistas, portanto a quantidade total de parâmetros não é igual ao custo computacional ativo em cada token. Essa distinção é importante ao comparar arquitetura, inteligência e custo de implantação.
Para que o Kimi K3 foi projetado
A Moonshot posiciona o K3 para dois grandes tipos de uso: engenharia de software de longo prazo e trabalho de conhecimento completo.
Programação de longo prazo
O K3 foi desenvolvido para permanecer produtivo durante longas sessões de engenharia. Os exemplos oficiais destacam navegação em grandes repositórios, orquestração de terminal, otimização de kernels GPU, desenvolvimento de compiladores, engenharia frontend, desenvolvimento de jogos, CAD e programação científica.
Esse é um objetivo diferente do autocomplete. Um modelo de programação de longo prazo precisa inspecionar o estado repetidamente, escolher uma ferramenta, interpretar o resultado, revisar seu plano e verificar o artefato final. Persistência e recuperação podem ser mais importantes que a qualidade do primeiro exemplo de código.
Visão no ciclo de programação
O K3 possui compreensão visual nativa. Ele pode usar capturas de tela e resultados renderizados como feedback enquanto modifica código. Isso permite iteração de frontend, QA visual, jogos, cenas 3D, diagramas e outros fluxos em que passar nos testes unitários não é suficiente.
A API oficial aceita dados de imagem e vídeos enviados. URLs públicas de imagens não são aceitas diretamente em mensagens de visão: as imagens precisam ser fornecidas em base64 ou por meio do gerenciamento de arquivos compatível, e os vídeos são referenciados por um ID de arquivo da Moonshot.
Trabalho de conhecimento
O K3 também é voltado para pesquisas, relatórios, planilhas, apresentações, dashboards e análises em várias etapas. Um contexto de 1M tokens pode armazenar um grande conjunto de evidências, mas trabalhos de conhecimento úteis ainda exigem controle de fontes, verificação de citações e validação. Uma janela maior reduz a necessidade de descartar contexto; ela não garante que todos os fatos serão recuperados ou ponderados corretamente.
Quão bons são os benchmarks do Kimi K3?
O relatório de lançamento do Kimi cobre reparo de repositórios, tarefas de terminal, construção de programas completos, trabalho de conhecimento, automação, navegação e avaliações multimodais. O padrão relatado é mais importante que qualquer pontuação individual: o K3 é mais forte em fluxos de trabalho longos com agentes e permanece competitivo com os principais modelos fechados no conjunto oficial de avaliações.
As ressalvas importam:
- Os resultados do Kimi K3 geralmente usam esforço máximo de raciocínio.
- Os modelos nem sempre foram avaliados com o mesmo framework de agente.
- Algumas tarefas foram executadas em ambientes calibrados para H20 em vez do hardware padrão do benchmark.
- O relatório oficial menciona comportamento de fallback para pelo menos um modelo concorrente.
- Rankings independentes de inteligência ampla não colocam o K3 em primeiro lugar geral.
Análises independentes atualmente colocam o K3 próximo da fronteira, mas não claramente acima dela. Isso é consistente com a própria declaração da Moonshot de que o K3 ainda fica atrás dos modelos proprietários mais fortes no geral.
Para tabelas de pontuação, observações sobre frameworks e a distinção entre avaliações oficiais e independentes, leia Benchmarks do Kimi K3 explicados.
Preços da API do Kimi K3
A Moonshot lista preços fixos no modelo pay-as-you-go, com valores separados para entrada em cache e sem cache.
| Tipo de token | Preço oficial por 1M de tokens |
|---|---|
| Entrada com cache | $0.30 |
| Entrada sem cache | $3.00 |
| Saída | $15.00 |
Não existe uma faixa de preço superior apenas porque uma solicitação usa um contexto longo. A conta total ainda pode ficar alta: um milhão de tokens de entrada sem cache custa $3 antes da saída, enquanto 50.000 tokens de saída adicionam $0.75.
O cache automático pode mudar a economia de fluxos repetidos de repositórios e pesquisas. Um prefixo estável de 500K tokens custa $1.50 em uma ausência de cache, mas $0.15 em um cache hit. Aplicações devem registrar o comportamento do cache em vez de presumir que toda solicitação repetida recebe a tarifa menor.
Veja Preços da API do Kimi K3 explicados para exemplos completos de uso e estratégias de cache.
Kimi K3 vs GPT-5.6 Sol
O K3 e o GPT-5.6 Sol se sobrepõem em programação avançada, agentes, raciocínio e trabalho profissional, mas representam diferentes compromissos.
| Área de decisão | Kimi K3 | GPT-5.6 Sol |
|---|---|---|
| Principal vantagem | Contexto de 1M e pesos abertos planejados | Melhor desempenho de ponta entre modelos fechados |
| Programação | Forte em programação visual e de longo prazo | Forte em programação geral e desempenho em terminal |
| Entrada multimodal | Compreensão nativa de imagens e vídeos | Recursos multimodais dependem da superfície atual da API |
| Contexto | 1M tokens | Verifique o limite atual do endpoint |
| Pesos abertos | Anunciados | Não |
| Implantação | API oficial ou futuro cluster de auto-hospedagem muito grande | API hospedada |
| Maturidade de produção | Recém-lançado | Plataforma OpenAI estabelecida |
Nenhum modelo vence todos os cenários. O K3 é atraente para equipes que valorizam contexto longo, programação multimodal e futuro acesso aos pesos. O GPT-5.6 Sol continua interessante quando qualidade máxima independente, comportamento maduro da plataforma e infraestrutura hospedada fechada são mais importantes.
Leia o guia completo de decisão em Kimi K3 vs GPT-5.6 Sol.
Pontos fortes do Kimi K3
Um contexto de trabalho realmente grande
Um milhão de tokens dá aos agentes espaço para código-fonte, documentação, histórico de ferramentas, evidências visuais e artefatos intermediários. Isso é especialmente útil quando uma recuperação agressiva separaria evidências que precisam ser consideradas juntas.
Programação e visão em um único modelo
O K3 pode inspecionar um resultado renderizado em vez de depender apenas de código-fonte ou registros de texto. Isso o torna relevante para engenharia de UI, jogos, CAD, visualização de dados e fluxos de mídia.
Recursos de API voltados para agentes
A API oficial suporta ferramentas personalizadas, uso forçado de ferramentas, carregamento dinâmico de ferramentas, streaming, saída estruturada e sessões longas com várias interações. Esses são componentes de produção, não apenas recursos de chat.
Direção para pesos abertos
A Moonshot descreve o K3 como o primeiro modelo aberto de classe 3T e anunciou os pesos completos. Se o lançamento e a licença permitirem uso amplo, ele dará às equipes de infraestrutura mais controle do que modelos fechados disponíveis apenas por API. Disponibilidade, termos de licença e suporte da comunidade para inferência ainda precisam ser verificados após o lançamento.
Limitações do Kimi K3
O histórico de raciocínio precisa ser preservado
A Moonshot alerta que o K3 foi treinado com histórico de raciocínio preservado. Um cliente que descarte o estado necessário do assistente, mantenha apenas o texto final ou altere modelos no meio de uma sessão pode causar instabilidade na qualidade. Isso torna essencial o gerenciamento correto do estado da conversa.
Pode ser excessivamente proativo
O treinamento para longos horizontes incentiva o modelo a continuar avançando. Em situações ambíguas, o K3 pode tomar decisões que o usuário não autorizou. Agentes em produção precisam de limites explícitos, ferramentas restritas, etapas de aprovação e instruções claras sobre quando parar.
O maior modelo não é um modelo para laptop local
Mesmo com pesos MXFP4 e ativação esparsa de especialistas, um modelo de 2,8T exige implantação em escala de infraestrutura. A Moonshot recomenda configurações supernode com 64 ou mais aceleradores. Pesos abertos não tornarão o K3 prático em uma GPU de consumidor ou estação de trabalho comum.
A saída é relativamente cara
Com $15 por milhão de tokens de saída, o comportamento expansivo de agentes pode dominar a conta. Aplicações devem definir limites de conclusão adequados e medir custo por tarefa verificada, não preço por solicitação.
Alguns detalhes de lançamento ainda estão pendentes
Em 21 de julho, os pesos completos, a licença final e o relatório técnico ainda não são públicos. Artigos que afirmam possuir um processo completo de instalação local antes desses materiais existirem devem ser avaliados com cautela.
Quem deve usar o Kimi K3?
O K3 é um forte candidato para:
- agentes de programação em escala de repositório;
- fluxos de terminal que exigem persistência;
- frontend, jogos, CAD e iteração visual de software;
- pesquisas em documentos longos e criação de materiais profissionais;
- análise multimodal com imagens ou vídeos enviados;
- equipes avaliando futuras implantações de modelos abertos de fronteira.
Ele pode ser grande ou caro demais para:
- classificação, extração e suporte simples;
- respostas curtas sensíveis à latência;
- pequenos ambientes de auto-hospedagem;
- fluxos que não conseguem preservar o estado completo da conversa;
- agentes sem limites fortes de permissão e verificação.
Veredito do Kimi K3
O Kimi K3 é um dos lançamentos de modelos abertos mais relevantes de 2026 porque combina arquitetura em escala de fronteira, janela de contexto de 1M, compreensão visual nativa e uma API de agentes robusta. Seu caso de uso mais convincente não é uma pergunta isolada de benchmark. É trabalho contínuo envolvendo código, ferramentas, documentos e feedback visual.
O modelo não é uma substituição automática para os sistemas fechados mais fortes. Avaliações independentes, custo de saída, requisitos de gerenciamento de estado, excesso de proatividade e exigências extremas de auto-hospedagem são fatores importantes. A decisão correta para produção é testar o K3 em tarefas representativas de longa duração e comparar o custo por resultado verificado.
Acompanhe a página do modelo Kimi K3 para disponibilidade no Poyo.ai, IDs confirmados de modelos e preços.
Perguntas frequentes
O Kimi K3 é open source?
A Moonshot chama o K3 de um modelo aberto de classe 3T e afirma que os pesos completos serão lançados até 27 de julho de 2026. Em 21 de julho, os desenvolvedores devem aguardar os arquivos reais e a licença antes de fazer afirmações sobre implantação ou uso comercial.
Qual é o tamanho da janela de contexto do Kimi K3?
O Kimi K3 suporta uma janela de contexto de 1 milhão de tokens. O cache automático de contexto está disponível na API oficial.
O Kimi K3 é melhor que o GPT-5.6 Sol?
Não universalmente. O K3 é especialmente interessante para contexto longo, pesos abertos planejados, programação multimodal e fluxos com agentes. O GPT-5.6 Sol mantém vantagens em algumas avaliações independentes e de ponta. Teste ambos nas mesmas tarefas.
O Kimi K3 suporta imagens e vídeos?
Sim. A API oficial suporta entrada de imagens e entrada de vídeos enviados. Ela retorna texto, não imagens ou vídeos gerados.
Quanto custa a API do Kimi K3?
A Moonshot lista $0.30 por milhão de tokens de entrada com cache, $3 por milhão de tokens de entrada sem cache e $15 por milhão de tokens de saída.
O Kimi K3 pode rodar localmente?
Não em hardware comum de consumidor. O modelo de 2,8T é destinado a grandes infraestruturas distribuídas, mesmo que apenas uma parte dos especialistas seja ativa por token.