Arquitectura de Kimi K3: KDA, AttnRes y 896 expertos MoE
Explora la arquitectura de 2.8T de Kimi K3, incluidos Kimi Delta Attention, Attention Residuals, Stable LatentMoE, 896 expertos e inferencia MXFP4.


Kimi K3 escala hasta 2.8 billones de parámetros mediante una combinación de Kimi Delta Attention, Attention Residuals y un sistema Stable LatentMoE altamente disperso con 896 expertos. Solo se activan 16 expertos por token, lo que permite que la capacidad total del modelo crezca mucho más rápido que la computación activa.
Moonshot afirma que estos cambios arquitectónicos y de entrenamiento producen aproximadamente 2.5× la eficiencia de escalado general de Kimi K2. Esto no significa que K3 sea barato de ejecutar. El modelo sigue diseñado para inferencia a escala de supernodo con 64 o más aceleradores.
Información de arquitectura comprobada el 21 de julio de 2026. Moonshot ha publicado una descripción general del lanzamiento, mientras que el informe técnico completo y los pesos todavía están previstos para su publicación. Este artículo señala las cuestiones abiertas en lugar de inventar detalles de implementación que no se han publicado.
Resumen de la arquitectura
| Componente | Detalle publicado de Kimi K3 |
|---|---|
| Parámetros totales | 2.8 billones |
| Atención | Kimi Delta Attention, con Gated MLA en la arquitectura |
| Conexión de profundidad | Attention Residuals |
| MoE | Stable LatentMoE |
| Expertos | 896 expertos enrutados |
| Expertos activos | 16 por token |
| Equilibrado | Quantile Balancing |
| Técnica del optimizador | Per-Head Muon |
| Componente de activación | Sigmoid Tanh Unit |
| Formato de pesos | MXFP4 mediante entrenamiento consciente de la cuantización |
| Formato de activaciones | MXFP8 |
| Contexto | 1 millón de tokens |
| Orientación de despliegue | Supernodo con 64+ aceleradores |
¿Qué es Kimi Delta Attention?
Kimi Delta Attention, o KDA, es el mecanismo híbrido de atención lineal de Moonshot. Su función es proporcionar una base más eficiente para procesar secuencias largas que depender únicamente de la atención completa convencional en cada capa y token.
Los métodos de atención lineal generalmente buscan evitar el crecimiento cuadrático asociado a comparar cada token con todos los demás tokens. La palabra “híbrido” es importante: la arquitectura exacta de K3 combina componentes de atención en lugar de reducir el modelo a una única fórmula lineal sencilla.
KDA es fundamental para la posición de K3 con una ventana de 1M tokens, pero la longitud de contexto es una propiedad del sistema. La disposición de memoria, los kernels, la gestión de KV o estados, el almacenamiento en caché, el paralelismo y la infraestructura de servicio influyen en si un contexto largo resulta práctico.
KDA y la caché de prefijos
Los sistemas de servicio convencionales suelen almacenar en caché el estado de atención de un prefijo repetido. KDA introduce requisitos diferentes para el estado y el prefill, por lo que no se puede asumir simplemente que las implementaciones habituales de caché de prefijos funcionarán de forma eficiente.
Moonshot afirma que aportó compatibilidad con la caché de prefill de KDA a la comunidad de vLLM para su lanzamiento junto con K3. Esto ayuda a explicar cómo la API oficial puede ofrecer un precio de entrada con caché mucho más bajo que la entrada sin caché a pesar de la escala del modelo.
Los equipos de infraestructura deberían esperar a una compatibilidad explícita con K3 en la versión correspondiente de vLLM y sus kernels, en lugar de modificar únicamente el nombre del modelo en un despliegue existente.
¿Qué son los Attention Residuals?
Las redes profundas tradicionales transmiten información mediante conexiones residuales que acumulan capas progresivamente. Moonshot describe Attention Residuals, o AttnRes, como un mecanismo que recupera selectivamente representaciones a través de la profundidad en lugar de acumularlo todo de manera uniforme.
El beneficio esperado es un flujo de información más estable a través de un modelo muy profundo. En lugar de obligar a cada capa a depender únicamente del estado acumulado inmediatamente anterior, AttnRes puede dar más importancia a representaciones anteriores útiles.
Esto es conceptualmente importante a escala de 2.8T, donde la optimización y el flujo de señales se vuelven difíciles. Las ecuaciones completas, los estudios de ablación y los detalles de entrenamiento deberían evaluarse cuando el informe técnico sea público.
Stable LatentMoE y 896 expertos
K3 es un modelo Mixture-of-Experts. Un router selecciona un pequeño subconjunto de redes expertas para cada token.
K3 cuenta con:
- 896 expertos enrutados;
- 16 expertos activos por token;
- componentes de expertos compartidos y enrutados en el diagrama publicado;
- un marco Stable LatentMoE diseñado para una dispersión extrema.
La proporción de activación es aproximadamente:
16 / 896 ≈ 1.8%
Ese porcentaje no revela directamente el número de parámetros activos. Las capas compartidas, los tamaños de los expertos, el enrutamiento, la atención y otros componentes contribuyen a la computación fuera de esta proporción simple. Considera no verificados los datos que afirmen que K3 tiene un número exacto de parámetros activos, salvo que Moonshot lo publique.
Por qué la dispersión extrema de MoE es difícil
Más expertos proporcionan más capacidad, pero también crean problemas de enrutamiento e infraestructura más complejos:
- los tokens pueden sobrecargar expertos populares;
- los expertos infrautilizados desperdician capacidad;
- la ubicación de expertos afecta a la comunicación;
- el desequilibrio de carga reduce la utilización de los aceleradores;
- las formas dinámicas y la sincronización con el host pueden reducir el rendimiento;
- las decisiones de enrutamiento deben mantenerse estables durante el entrenamiento.
K3 aborda estos problemas con equilibrado, ejecución con formas estáticas y grandes dominios de comunicación.
Quantile Balancing
Moonshot describe Quantile Balancing como un método que deriva la asignación de expertos a partir de cuantiles de las puntuaciones del router. El objetivo es evitar reglas heurísticas de actualización y un hiperparámetro de equilibrado sensible.
En términos sencillos, la asignación se adapta a la distribución de las puntuaciones de enrutamiento en lugar de depender de un único umbral ajustado manualmente. Esto es relevante cuando 896 expertos deben seguir siendo útiles y recibir una carga equilibrada a escala.
Todavía se necesitan reproducciones independientes y resultados de ablación para cuantificar cuánto contribuye Quantile Balancing frente al resto del sistema de entrenamiento.
Per-Head Muon
Muon es un enfoque de optimización utilizado durante el entrenamiento. K3 lo amplía a nivel de cada cabeza de atención, permitiendo que las cabezas se optimicen de forma más independiente.
La motivación declarada por Moonshot es lograr una optimización más adaptable a gran escala. Se trata de una técnica de entrenamiento, no de una característica de la API: los usuarios no configuran Per-Head Muon durante la inferencia.
SiTU y Gated MLA
La descripción general del lanzamiento también identifica:
- Sigmoid Tanh Unit (SiTU): diseñada para mejorar el control de activaciones;
- Gated MLA: diseñada para mejorar la selectividad de la atención.
Estos componentes forman parte de un diseño de bloque más amplio que combina KDA, expertos latentes, expertos compartidos, elementos convolucionales y mecanismos de compuerta. Su contribución exacta requiere el informe técnico y estudios de ablación controlados.
Pesos MXFP4 y activaciones MXFP8
K3 utiliza entrenamiento consciente de la cuantización desde la etapa de ajuste fino supervisado, con pesos MXFP4 y activaciones MXFP8.
El entrenamiento consciente de la cuantización expone al modelo al comportamiento de menor precisión durante el entrenamiento en lugar de convertir posteriormente un modelo terminado de alta precisión. Esto puede conservar más calidad en un formato de inferencia eficiente.
MXFP4 reduce considerablemente el almacenamiento teórico de pesos. Con cuatro bits por parámetro, 2.8T de parámetros sin procesar equivalen aproximadamente a 1.4 TB antes de incluir escalas, metadatos, componentes no cuantizados, búferes de ejecución y redundancia. Sigue estando muy lejos del hardware de consumo.
Entrenamiento experto-paralelo completamente equilibrado
Moonshot afirma que K3 utiliza entrenamiento experto-paralelo completamente equilibrado con formas estáticas y sin sincronización con el host en la ruta crítica. Estas decisiones buscan un trabajo predecible de los aceleradores y reducir pausas provocadas por la coordinación con CPU.
Durante la inferencia, el mismo desafío general permanece: los expertos distribuidos entre muchos dispositivos deben comunicarse rápidamente. Moonshot recomienda un despliegue de supernodo con al menos 64 aceleradores para que más comunicación tenga lugar dentro de un dominio de alto ancho de banda.
Cómo alcanza K3 un contexto de 1M tokens
Ningún componente individual explica la ventana de 1M. La capacidad depende de:
- procesamiento eficiente de secuencias con KDA;
- flujo estable de información mediante AttnRes;
- kernels de servicio y gestión de memoria;
- compatibilidad con caché de prefill;
- infraestructura distribuida de aceleradores;
- datos y objetivos de entrenamiento que enseñan al modelo a utilizar contextos largos.
Que un modelo acepte un millón de tokens no significa que cada token reciba la misma atención ni que un prompt de un millón de tokens sea siempre el mejor diseño. La evaluación de contexto largo debería probar recuperación, dependencias lejanas, distracciones, latencia y coste.
Kimi K3 frente a Kimi K2
| Área | Dirección de Kimi K3 | Referencia de Kimi K2 |
|---|---|---|
| Escala | 2.8T de parámetros totales | Generación anterior más pequeña |
| Atención | Atención lineal híbrida KDA | Arquitectura anterior |
| Profundidad | Attention Residuals | Diseño residual anterior |
| MoE | 896 expertos, 16 activos | Menor dispersión |
| Eficiencia | Reclamación de ~2.5× eficiencia de escalado | Referencia |
| Visión | Comprensión visual nativa | Superficie de capacidades anterior diferente |
| Contexto | 1M tokens | Límite anterior inferior según el modelo |
La cifra de 2.5× corresponde a la afirmación de eficiencia de escalado general de Moonshot, no a una promesa de velocidad de API 2.5× superior ni de rendimiento en benchmarks 2.5× mayor.
Limitaciones de la arquitectura y cuestiones abiertas
Entre las preguntas importantes aún sin respuesta se incluyen:
- número exacto de parámetros activos;
- dimensiones completas de capas y expertos;
- cantidad de tokens de entrenamiento y mezcla de datos;
- método completo de entrenamiento de contexto largo;
- ablaciones independientes de arquitectura;
- hardware compatible y rendimiento medido por configuración;
- tamaño exacto de los archivos de pesos;
- compatibilidad final de ejecución y licencia.
Estas cuestiones deberían responderse a partir del informe técnico de Moonshot y los repositorios oficiales tras su publicación.
Por qué la arquitectura importa a los desarrolladores
La mayoría de usuarios de API no necesitan implementar KDA ni el enrutamiento MoE. Sí necesitan comprender las consecuencias operativas:
- K3 destaca en trabajos con mucho contexto y tareas de agentes;
- conservar el estado de conversación es esencial;
- la caché automática puede reducir notablemente el coste;
- el autoalojamiento requiere una infraestructura extrema;
- el comportamiento del modelo no puede deducirse únicamente por el número total de parámetros;
- los nuevos runtimes y kernels deben ofrecer compatibilidad explícita con K3.
Lee ¿Es Kimi K3 de código abierto? para conocer el estado del despliegue y Guía de API de Kimi K3 para la integración de aplicaciones.
Preguntas frecuentes
¿Cuántos parámetros tiene Kimi K3?
K3 tiene 2.8 billones de parámetros totales en una arquitectura dispersa Mixture-of-Experts.
¿Cuántos expertos están activos?
Moonshot afirma que se activan 16 de los 896 expertos enrutados. Los componentes compartidos y no expertos también contribuyen a la computación.
¿Qué es Kimi Delta Attention?
KDA es el mecanismo híbrido de atención lineal de Moonshot para el procesamiento eficiente de secuencias y el escalado de contexto largo.
¿Por qué Kimi K3 admite un contexto de 1M?
La ventana está habilitada por la arquitectura, el entrenamiento, la caché, los kernels, la gestión de memoria y el servicio distribuido, no por una única característica.
¿Puede Kimi K3 ejecutarse en GPU de consumo?
El modelo completo no puede ejecutarse de forma realista en GPU de consumo. Moonshot recomienda despliegues de supernodo con 64 o más aceleradores.


