Reseña de Kimi K3: benchmarks, precios, contexto de 1M y API
Analiza las capacidades de programación, razonamiento y multimodalidad de Kimi K3, su contexto de 1 millón de tokens, precios de API, estado de pesos abiertos y limitaciones prácticas.


Kimi K3 es el modelo insignia de Moonshot AI con 2,8 billones de parámetros, diseñado para programación de larga duración, trabajo de conocimiento, razonamiento visual y agentes que utilizan herramientas. Combina una ventana de contexto de 1 millón de tokens con comprensión nativa de imágenes y vídeo, razonamiento siempre activo, salida estructurada y una arquitectura Mixture-of-Experts excepcionalmente dispersa.
Las cifras principales son impresionantes, pero no responden a las preguntas prácticas. ¿Es Kimi K3 mejor que los modelos cerrados más potentes? ¿Es útil su contexto de 1M o simplemente resulta caro? ¿Pueden los desarrolladores alojar por sí mismos un modelo de 2,8T? ¿Y qué limitaciones importan cuando K3 controla herramientas durante horas en lugar de responder a un único prompt?
Esta reseña separa las capacidades confirmadas de las afirmaciones de lanzamiento y explica dónde encaja Kimi K3 dentro de una pila de modelos de producción.
Disponibilidad en Poyo actualizada el 22 de julio de 2026. Kimi K3 está disponible en Poyo.ai con el ID
kimi-k3y mediante los productos oficiales de Moonshot AI. Moonshot prevé publicar los pesos completos antes del 27 de julio de 2026.
Kimi K3 de un vistazo
| Especificación | Kimi K3 |
|---|---|
| Proveedor | Moonshot AI |
| ID del modelo | kimi-k3 en la API oficial de Moonshot |
| Parámetros totales | 2,8 billones |
| Arquitectura | KDA, Attention Residuals, Stable LatentMoE |
| Expertos | 896 en total, 16 activados |
| Ventana de contexto | 1 millón de tokens |
| Máxima generación | 131.072 tokens de forma predeterminada; configurable hasta 1.048.576 |
| Entradas | Texto, imágenes y vídeo subido |
| Salida | Texto |
| Razonamiento | Siempre activo; esfuerzo low, high y max |
| Funciones de agente | Llamadas a herramientas, elección obligatoria de herramientas, carga dinámica de herramientas |
| Salida estructurada | JSON Schema estricto |
| Caché de contexto | Automática |
| Estado de API oficial | Disponible |
| Estado de Poyo.ai | Disponible como kimi-k3 |
| Pesos completos | Anunciados para su lanzamiento antes del 27 de julio de 2026 |
Kimi K3 utiliza la escala extrema de forma diferente a un modelo denso de 2,8T. Stable LatentMoE dirige cada token a través de 16 de los 896 expertos, por lo que el número total de parámetros no equivale al cómputo activo en cada token. Esta diferencia es importante al comparar arquitectura, inteligencia y costes de implementación.
Para qué está diseñado Kimi K3
Moonshot posiciona K3 para dos grandes tipos de trabajo: ingeniería de software de larga duración y trabajo de conocimiento de extremo a extremo.
Programación de larga duración
K3 está diseñado para mantener la productividad durante largas sesiones de ingeniería. Los ejemplos oficiales destacan la navegación por grandes repositorios, la orquestación mediante terminal, la optimización de kernels GPU, el desarrollo de compiladores, la ingeniería frontend, el desarrollo de videojuegos, CAD y programación científica.
Este objetivo es diferente al autocompletado. Un modelo de programación de larga duración debe inspeccionar repetidamente el estado, elegir una herramienta, interpretar el resultado, revisar su plan y verificar el artefacto final. La persistencia y la capacidad de recuperación pueden importar más que la calidad del primer fragmento de código.
Visión dentro del ciclo de programación
K3 cuenta con comprensión visual nativa. Puede utilizar capturas de pantalla y resultados renderizados como feedback mientras modifica código. Esto permite iteraciones frontend, control de calidad visual, videojuegos, escenas 3D, diagramas y otros flujos donde superar las pruebas unitarias no es suficiente.
La API oficial acepta datos de imagen y vídeo subido. Las URL públicas de imágenes no se aceptan directamente en los mensajes de visión: las imágenes deben proporcionarse en base64 o mediante la gestión de archivos compatible, y el vídeo se referencia mediante un identificador de archivo de Moonshot.
Trabajo de conocimiento
K3 también está orientado a investigación, informes, hojas de cálculo, presentaciones, paneles de control y análisis de varias etapas. Un contexto de 1M tokens puede contener un gran conjunto de evidencias, pero el trabajo de conocimiento útil sigue necesitando control de fuentes, comprobación de citas y verificación. Una ventana amplia reduce la necesidad de descartar contexto; no garantiza que cada dato se recuerde o se valore correctamente.
¿Qué tal son los benchmarks de Kimi K3?
El informe de lanzamiento de Kimi cubre reparación de repositorios, tareas de terminal, construcción de programas completos, trabajo de conocimiento, automatización, navegación y evaluaciones multimodales. El patrón general es más importante que cualquier puntuación individual: K3 destaca en flujos de trabajo largos con agentes y sigue siendo competitivo frente a los principales modelos cerrados en la suite oficial.
Los matices son importantes:
- Los resultados de Kimi K3 generalmente utilizan el máximo nivel de esfuerzo de razonamiento.
- Los modelos no siempre fueron evaluados con el mismo sistema de agentes.
- Algunas tareas se ejecutaron en entornos calibrados para H20 en lugar del hardware estándar del benchmark.
- El informe oficial menciona comportamiento de respaldo para al menos un modelo competidor.
- Los rankings independientes de inteligencia general no sitúan a K3 en el primer puesto absoluto.
Los análisis independientes actuales sitúan a K3 cerca de la frontera tecnológica, aunque no claramente por encima de ella. Esto coincide con la propia declaración de Moonshot de que K3 todavía queda por detrás de los modelos propietarios más potentes en términos generales.
Para las tablas de puntuaciones, notas sobre los sistemas de evaluación y la diferencia entre resultados oficiales e independientes, consulta Benchmarks de Kimi K3 explicados.
Precios de la API de Kimi K3
Moonshot ofrece tarifas planas de pago por uso con precios separados para entradas almacenadas en caché y no almacenadas.
| Tipo de token | Precio oficial por 1M de tokens |
|---|---|
| Entrada con caché | $0.30 |
| Entrada sin caché | $3.00 |
| Salida | $15.00 |
No existe una tarifa superior simplemente porque una solicitud utilice un contexto largo. Aun así, el coste total puede aumentar considerablemente: un millón de tokens de entrada sin caché cuesta $3 antes de la salida, mientras que 50.000 tokens de salida añaden $0.75.
La caché automática puede cambiar la economía de los flujos repetidos de repositorios e investigación. Un prefijo estable de 500K tokens cuesta $1.50 cuando no está en caché, pero $0.15 cuando se recupera desde caché. Las aplicaciones deberían registrar el comportamiento de la caché en lugar de asumir que cada solicitud repetida recibe la tarifa más baja.
Consulta Precios de la API de Kimi K3 explicados para ver ejemplos completos de cargas de trabajo y estrategias de caché.
Kimi K3 frente a GPT-5.6 Sol
K3 y GPT-5.6 Sol coinciden en programación avanzada, agentes, razonamiento y trabajo profesional, pero representan diferentes compromisos.
| Área de decisión | Kimi K3 | GPT-5.6 Sol |
|---|---|---|
| Ventaja principal | Contexto de 1M y pesos abiertos previstos | Mejor rendimiento máximo de modelo cerrado |
| Programación | Programación visual y de larga duración sólida | Programación general y rendimiento con terminal sólidos |
| Entrada multimodal | Comprensión nativa de imágenes y vídeo | Las capacidades multimodales dependen de la superficie actual de la API |
| Contexto | 1M tokens | Verificar el límite actual del endpoint |
| Pesos abiertos | Anunciados | No |
| Implementación | API oficial o futuro clúster propio de gran escala | API alojada |
| Madurez de producción | Recién lanzado | Plataforma OpenAI consolidada |
Ningún modelo gana en todos los escenarios. K3 resulta atractivo para equipos que valoran contexto amplio, programación multimodal y acceso futuro a pesos. GPT-5.6 Sol sigue siendo atractivo cuando importan más la calidad máxima independiente, el comportamiento maduro de plataforma y la infraestructura alojada cerrada.
Lee la guía completa de decisión en Kimi K3 vs GPT-5.6 Sol.
Fortalezas de Kimi K3
Un contexto de trabajo realmente grande
Un millón de tokens ofrece a los agentes espacio para código fuente, documentación, historial de herramientas, evidencias visuales y artefactos intermedios. Esto resulta especialmente útil cuando una recuperación agresiva separaría evidencias que deben analizarse juntas.
Programación y visión en un mismo modelo
K3 puede inspeccionar un resultado renderizado en lugar de depender únicamente del código fuente o de registros de texto. Esto lo hace relevante para ingeniería de interfaces, videojuegos, CAD, visualización de datos y flujos multimedia.
Funciones de API orientadas a agentes
La API oficial admite herramientas personalizadas, uso forzado de herramientas, carga dinámica de herramientas, streaming, salida estructurada y sesiones largas de varios turnos. Son componentes de producción, no simples funciones de chat.
Orientación hacia pesos abiertos
Moonshot describe K3 como el primer modelo abierto de clase 3T y ha anunciado los pesos completos. Si el lanzamiento y la licencia permiten un uso amplio, proporcionará a los equipos de infraestructura más control que los modelos cerrados basados únicamente en API. La disponibilidad, los términos de licencia y el soporte de inferencia de la comunidad aún deben verificarse después del lanzamiento.
Limitaciones de Kimi K3
El historial de razonamiento debe conservarse
Moonshot advierte que K3 fue entrenado conservando el historial de razonamiento. Un cliente que elimine el estado necesario del asistente, conserve únicamente el texto final o cambie de modelo durante una sesión puede provocar una calidad inestable. Esto hace que una correcta gestión del estado de conversación sea esencial.
Puede ser excesivamente proactivo
El entrenamiento para tareas de larga duración anima al modelo a continuar avanzando. En situaciones ambiguas, K3 puede tomar decisiones que el usuario no autorizó. Los agentes de producción necesitan límites explícitos, herramientas acotadas, pasos de aprobación e instrucciones claras sobre cuándo detenerse.
El modelo más grande no es un modelo para un portátil local
Incluso con pesos MXFP4 y activación dispersa de expertos, un modelo de 2,8T requiere una infraestructura de escala empresarial. Moonshot recomienda configuraciones supernode con 64 o más aceleradores. Los pesos abiertos no harán que K3 sea práctico en una GPU de consumo o una estación de trabajo normal.
La salida es relativamente cara
Con $15 por millón de tokens de salida, el comportamiento detallado de los agentes puede dominar la factura. Las aplicaciones deberían establecer límites razonables de generación y medir el coste por tarea verificada, no el precio por solicitud.
Algunos detalles del lanzamiento siguen pendientes
A fecha de 21 de julio, los pesos completos, la licencia final y el informe técnico todavía no son públicos. Los artículos que afirmen un proceso completo de instalación local antes de que existan esos materiales deben tratarse con cautela.
¿Quién debería usar Kimi K3?
K3 es un candidato sólido para:
- agentes de programación a escala de repositorio;
- flujos con terminal que requieren persistencia;
- iteración visual en frontend, videojuegos, CAD y software creativo;
- investigación con documentos extensos y creación de materiales profesionales;
- análisis multimodal con imágenes o vídeo subido;
- equipos que evalúan futuras implementaciones de modelos frontera con pesos abiertos.
Puede ser innecesariamente grande o caro para:
- clasificación, extracción y soporte sencillo;
- respuestas breves sensibles a la latencia;
- entornos pequeños de autoalojamiento;
- flujos que no pueden conservar el estado completo de conversación;
- agentes sin límites sólidos de permisos y verificación.
Veredicto sobre Kimi K3
Kimi K3 es uno de los lanzamientos de modelos abiertos más importantes de 2026 porque combina arquitectura de escala frontera, una ventana de contexto de 1M, comprensión visual nativa y una API de agentes completa. Su caso de uso más convincente no es una pregunta puntual de benchmark. Es el trabajo sostenido con código, herramientas, documentos y feedback visual.
El modelo no sustituye automáticamente a los sistemas cerrados más potentes. Las evaluaciones independientes, el coste de salida, los requisitos de gestión del estado, la proactividad excesiva y las exigencias extremas de autoalojamiento son factores importantes. La decisión adecuada en producción es probar K3 con tareas representativas de larga duración y comparar el coste por resultado verificado.
Sigue la página del modelo Kimi K3 para conocer la disponibilidad en Poyo.ai, los ID de modelo confirmados y los precios.
Preguntas frecuentes
¿Kimi K3 es open source?
Moonshot denomina a K3 un modelo abierto de clase 3T y afirma que los pesos completos se publicarán antes del 27 de julio de 2026. A fecha del 21 de julio, los desarrolladores deberían esperar a los archivos reales y a la licencia antes de realizar afirmaciones sobre implementación o uso comercial.
¿Qué tamaño tiene la ventana de contexto de Kimi K3?
Kimi K3 admite una ventana de contexto de 1 millón de tokens. La caché automática de contexto está disponible en la API oficial.
¿Es Kimi K3 mejor que GPT-5.6 Sol?
No de forma universal. K3 resulta especialmente atractivo por su contexto amplio, los pesos abiertos previstos, la programación multimodal y los flujos con agentes. GPT-5.6 Sol mantiene ventajas en algunas evaluaciones independientes y de máximo nivel. Prueba ambos con las mismas tareas.
¿Kimi K3 admite imágenes y vídeo?
Sí. La API oficial admite entrada de imágenes y vídeo subido. Devuelve texto, no imágenes ni vídeo generados.
¿Cuánto cuesta la API de Kimi K3?
Moonshot indica $0.30 por millón de tokens de entrada con caché, $3 por millón de tokens de entrada sin caché y $15 por millón de tokens de salida.
¿Puede Kimi K3 ejecutarse localmente?
No en hardware de consumo normal. El modelo de 2,8T está diseñado para infraestructura distribuida de gran escala, aunque solo una parte de los expertos se activa por token.


