Todos los artículos
guides12 min de lectura

Reseña de Kimi K3: benchmarks, precios, contexto de 1M y API

Analiza las capacidades de programación, razonamiento y multimodalidad de Kimi K3, su contexto de 1 millón de tokens, precios de API, estado de pesos abiertos y limitaciones prácticas.

Reseña de Kimi K3: benchmarks, precios, contexto de 1M y API
guides

Reseña del modelo Kimi K3

Kimi K3 es el modelo insignia de Moonshot AI con 2,8 billones de parámetros, diseñado para programación de larga duración, trabajo de conocimiento, razonamiento visual y agentes que utilizan herramientas. Combina una ventana de contexto de 1 millón de tokens con comprensión nativa de imágenes y vídeo, razonamiento siempre activo, salida estructurada y una arquitectura Mixture-of-Experts excepcionalmente dispersa.

Las cifras principales son impresionantes, pero no responden a las preguntas prácticas. ¿Es Kimi K3 mejor que los modelos cerrados más potentes? ¿Es útil su contexto de 1M o simplemente resulta caro? ¿Pueden los desarrolladores alojar por sí mismos un modelo de 2,8T? ¿Y qué limitaciones importan cuando K3 controla herramientas durante horas en lugar de responder a un único prompt?

Esta reseña separa las capacidades confirmadas de las afirmaciones de lanzamiento y explica dónde encaja Kimi K3 dentro de una pila de modelos de producción.

Disponibilidad en Poyo actualizada el 22 de julio de 2026. Kimi K3 está disponible en Poyo.ai con el ID kimi-k3 y mediante los productos oficiales de Moonshot AI. Moonshot prevé publicar los pesos completos antes del 27 de julio de 2026.

Kimi K3 de un vistazo

Especificación Kimi K3
Proveedor Moonshot AI
ID del modelo kimi-k3 en la API oficial de Moonshot
Parámetros totales 2,8 billones
Arquitectura KDA, Attention Residuals, Stable LatentMoE
Expertos 896 en total, 16 activados
Ventana de contexto 1 millón de tokens
Máxima generación 131.072 tokens de forma predeterminada; configurable hasta 1.048.576
Entradas Texto, imágenes y vídeo subido
Salida Texto
Razonamiento Siempre activo; esfuerzo low, high y max
Funciones de agente Llamadas a herramientas, elección obligatoria de herramientas, carga dinámica de herramientas
Salida estructurada JSON Schema estricto
Caché de contexto Automática
Estado de API oficial Disponible
Estado de Poyo.ai Disponible como kimi-k3
Pesos completos Anunciados para su lanzamiento antes del 27 de julio de 2026

Kimi K3 utiliza la escala extrema de forma diferente a un modelo denso de 2,8T. Stable LatentMoE dirige cada token a través de 16 de los 896 expertos, por lo que el número total de parámetros no equivale al cómputo activo en cada token. Esta diferencia es importante al comparar arquitectura, inteligencia y costes de implementación.

Para qué está diseñado Kimi K3

Moonshot posiciona K3 para dos grandes tipos de trabajo: ingeniería de software de larga duración y trabajo de conocimiento de extremo a extremo.

Programación de larga duración

K3 está diseñado para mantener la productividad durante largas sesiones de ingeniería. Los ejemplos oficiales destacan la navegación por grandes repositorios, la orquestación mediante terminal, la optimización de kernels GPU, el desarrollo de compiladores, la ingeniería frontend, el desarrollo de videojuegos, CAD y programación científica.

Este objetivo es diferente al autocompletado. Un modelo de programación de larga duración debe inspeccionar repetidamente el estado, elegir una herramienta, interpretar el resultado, revisar su plan y verificar el artefacto final. La persistencia y la capacidad de recuperación pueden importar más que la calidad del primer fragmento de código.

Visión dentro del ciclo de programación

K3 cuenta con comprensión visual nativa. Puede utilizar capturas de pantalla y resultados renderizados como feedback mientras modifica código. Esto permite iteraciones frontend, control de calidad visual, videojuegos, escenas 3D, diagramas y otros flujos donde superar las pruebas unitarias no es suficiente.

La API oficial acepta datos de imagen y vídeo subido. Las URL públicas de imágenes no se aceptan directamente en los mensajes de visión: las imágenes deben proporcionarse en base64 o mediante la gestión de archivos compatible, y el vídeo se referencia mediante un identificador de archivo de Moonshot.

Trabajo de conocimiento

K3 también está orientado a investigación, informes, hojas de cálculo, presentaciones, paneles de control y análisis de varias etapas. Un contexto de 1M tokens puede contener un gran conjunto de evidencias, pero el trabajo de conocimiento útil sigue necesitando control de fuentes, comprobación de citas y verificación. Una ventana amplia reduce la necesidad de descartar contexto; no garantiza que cada dato se recuerde o se valore correctamente.

¿Qué tal son los benchmarks de Kimi K3?

El informe de lanzamiento de Kimi cubre reparación de repositorios, tareas de terminal, construcción de programas completos, trabajo de conocimiento, automatización, navegación y evaluaciones multimodales. El patrón general es más importante que cualquier puntuación individual: K3 destaca en flujos de trabajo largos con agentes y sigue siendo competitivo frente a los principales modelos cerrados en la suite oficial.

Los matices son importantes:

  • Los resultados de Kimi K3 generalmente utilizan el máximo nivel de esfuerzo de razonamiento.
  • Los modelos no siempre fueron evaluados con el mismo sistema de agentes.
  • Algunas tareas se ejecutaron en entornos calibrados para H20 en lugar del hardware estándar del benchmark.
  • El informe oficial menciona comportamiento de respaldo para al menos un modelo competidor.
  • Los rankings independientes de inteligencia general no sitúan a K3 en el primer puesto absoluto.

Los análisis independientes actuales sitúan a K3 cerca de la frontera tecnológica, aunque no claramente por encima de ella. Esto coincide con la propia declaración de Moonshot de que K3 todavía queda por detrás de los modelos propietarios más potentes en términos generales.

Para las tablas de puntuaciones, notas sobre los sistemas de evaluación y la diferencia entre resultados oficiales e independientes, consulta Benchmarks de Kimi K3 explicados.

Precios de la API de Kimi K3

Moonshot ofrece tarifas planas de pago por uso con precios separados para entradas almacenadas en caché y no almacenadas.

Tipo de token Precio oficial por 1M de tokens
Entrada con caché $0.30
Entrada sin caché $3.00
Salida $15.00

No existe una tarifa superior simplemente porque una solicitud utilice un contexto largo. Aun así, el coste total puede aumentar considerablemente: un millón de tokens de entrada sin caché cuesta $3 antes de la salida, mientras que 50.000 tokens de salida añaden $0.75.

La caché automática puede cambiar la economía de los flujos repetidos de repositorios e investigación. Un prefijo estable de 500K tokens cuesta $1.50 cuando no está en caché, pero $0.15 cuando se recupera desde caché. Las aplicaciones deberían registrar el comportamiento de la caché en lugar de asumir que cada solicitud repetida recibe la tarifa más baja.

Consulta Precios de la API de Kimi K3 explicados para ver ejemplos completos de cargas de trabajo y estrategias de caché.

Kimi K3 frente a GPT-5.6 Sol

K3 y GPT-5.6 Sol coinciden en programación avanzada, agentes, razonamiento y trabajo profesional, pero representan diferentes compromisos.

Área de decisión Kimi K3 GPT-5.6 Sol
Ventaja principal Contexto de 1M y pesos abiertos previstos Mejor rendimiento máximo de modelo cerrado
Programación Programación visual y de larga duración sólida Programación general y rendimiento con terminal sólidos
Entrada multimodal Comprensión nativa de imágenes y vídeo Las capacidades multimodales dependen de la superficie actual de la API
Contexto 1M tokens Verificar el límite actual del endpoint
Pesos abiertos Anunciados No
Implementación API oficial o futuro clúster propio de gran escala API alojada
Madurez de producción Recién lanzado Plataforma OpenAI consolidada

Ningún modelo gana en todos los escenarios. K3 resulta atractivo para equipos que valoran contexto amplio, programación multimodal y acceso futuro a pesos. GPT-5.6 Sol sigue siendo atractivo cuando importan más la calidad máxima independiente, el comportamiento maduro de plataforma y la infraestructura alojada cerrada.

Lee la guía completa de decisión en Kimi K3 vs GPT-5.6 Sol.

Fortalezas de Kimi K3

Un contexto de trabajo realmente grande

Un millón de tokens ofrece a los agentes espacio para código fuente, documentación, historial de herramientas, evidencias visuales y artefactos intermedios. Esto resulta especialmente útil cuando una recuperación agresiva separaría evidencias que deben analizarse juntas.

Programación y visión en un mismo modelo

K3 puede inspeccionar un resultado renderizado en lugar de depender únicamente del código fuente o de registros de texto. Esto lo hace relevante para ingeniería de interfaces, videojuegos, CAD, visualización de datos y flujos multimedia.

Funciones de API orientadas a agentes

La API oficial admite herramientas personalizadas, uso forzado de herramientas, carga dinámica de herramientas, streaming, salida estructurada y sesiones largas de varios turnos. Son componentes de producción, no simples funciones de chat.

Orientación hacia pesos abiertos

Moonshot describe K3 como el primer modelo abierto de clase 3T y ha anunciado los pesos completos. Si el lanzamiento y la licencia permiten un uso amplio, proporcionará a los equipos de infraestructura más control que los modelos cerrados basados únicamente en API. La disponibilidad, los términos de licencia y el soporte de inferencia de la comunidad aún deben verificarse después del lanzamiento.

Limitaciones de Kimi K3

El historial de razonamiento debe conservarse

Moonshot advierte que K3 fue entrenado conservando el historial de razonamiento. Un cliente que elimine el estado necesario del asistente, conserve únicamente el texto final o cambie de modelo durante una sesión puede provocar una calidad inestable. Esto hace que una correcta gestión del estado de conversación sea esencial.

Puede ser excesivamente proactivo

El entrenamiento para tareas de larga duración anima al modelo a continuar avanzando. En situaciones ambiguas, K3 puede tomar decisiones que el usuario no autorizó. Los agentes de producción necesitan límites explícitos, herramientas acotadas, pasos de aprobación e instrucciones claras sobre cuándo detenerse.

El modelo más grande no es un modelo para un portátil local

Incluso con pesos MXFP4 y activación dispersa de expertos, un modelo de 2,8T requiere una infraestructura de escala empresarial. Moonshot recomienda configuraciones supernode con 64 o más aceleradores. Los pesos abiertos no harán que K3 sea práctico en una GPU de consumo o una estación de trabajo normal.

La salida es relativamente cara

Con $15 por millón de tokens de salida, el comportamiento detallado de los agentes puede dominar la factura. Las aplicaciones deberían establecer límites razonables de generación y medir el coste por tarea verificada, no el precio por solicitud.

Algunos detalles del lanzamiento siguen pendientes

A fecha de 21 de julio, los pesos completos, la licencia final y el informe técnico todavía no son públicos. Los artículos que afirmen un proceso completo de instalación local antes de que existan esos materiales deben tratarse con cautela.

¿Quién debería usar Kimi K3?

K3 es un candidato sólido para:

  • agentes de programación a escala de repositorio;
  • flujos con terminal que requieren persistencia;
  • iteración visual en frontend, videojuegos, CAD y software creativo;
  • investigación con documentos extensos y creación de materiales profesionales;
  • análisis multimodal con imágenes o vídeo subido;
  • equipos que evalúan futuras implementaciones de modelos frontera con pesos abiertos.

Puede ser innecesariamente grande o caro para:

  • clasificación, extracción y soporte sencillo;
  • respuestas breves sensibles a la latencia;
  • entornos pequeños de autoalojamiento;
  • flujos que no pueden conservar el estado completo de conversación;
  • agentes sin límites sólidos de permisos y verificación.

Veredicto sobre Kimi K3

Kimi K3 es uno de los lanzamientos de modelos abiertos más importantes de 2026 porque combina arquitectura de escala frontera, una ventana de contexto de 1M, comprensión visual nativa y una API de agentes completa. Su caso de uso más convincente no es una pregunta puntual de benchmark. Es el trabajo sostenido con código, herramientas, documentos y feedback visual.

El modelo no sustituye automáticamente a los sistemas cerrados más potentes. Las evaluaciones independientes, el coste de salida, los requisitos de gestión del estado, la proactividad excesiva y las exigencias extremas de autoalojamiento son factores importantes. La decisión adecuada en producción es probar K3 con tareas representativas de larga duración y comparar el coste por resultado verificado.

Sigue la página del modelo Kimi K3 para conocer la disponibilidad en Poyo.ai, los ID de modelo confirmados y los precios.

Preguntas frecuentes

¿Kimi K3 es open source?

Moonshot denomina a K3 un modelo abierto de clase 3T y afirma que los pesos completos se publicarán antes del 27 de julio de 2026. A fecha del 21 de julio, los desarrolladores deberían esperar a los archivos reales y a la licencia antes de realizar afirmaciones sobre implementación o uso comercial.

¿Qué tamaño tiene la ventana de contexto de Kimi K3?

Kimi K3 admite una ventana de contexto de 1 millón de tokens. La caché automática de contexto está disponible en la API oficial.

¿Es Kimi K3 mejor que GPT-5.6 Sol?

No de forma universal. K3 resulta especialmente atractivo por su contexto amplio, los pesos abiertos previstos, la programación multimodal y los flujos con agentes. GPT-5.6 Sol mantiene ventajas en algunas evaluaciones independientes y de máximo nivel. Prueba ambos con las mismas tareas.

¿Kimi K3 admite imágenes y vídeo?

Sí. La API oficial admite entrada de imágenes y vídeo subido. Devuelve texto, no imágenes ni vídeo generados.

¿Cuánto cuesta la API de Kimi K3?

Moonshot indica $0.30 por millón de tokens de entrada con caché, $3 por millón de tokens de entrada sin caché y $15 por millón de tokens de salida.

¿Puede Kimi K3 ejecutarse localmente?

No en hardware de consumo normal. El modelo de 2,8T está diseñado para infraestructura distribuida de gran escala, aunque solo una parte de los expertos se activa por token.

Fuentes

Blog · PoYo.aiTodos los artículos
HABLEMOS

¿Tienes un proyecto?

Cuéntanos qué estás creando. Nuestro equipo te ayudará a elegir la API de IA adecuada.

Usaremos tus datos solo para responder a esta consulta.

PoYo AI

¿Listo para explorar modelos?

Descubre modelos de imagen, vídeo, audio y lenguaje en PoYo.

Ver modelos de IA