Precios de la API de Kimi K3: costes de tokens, ahorros de caché y ejemplos
Descubre los precios de la API de Kimi K3 para entradas en caché, entradas sin caché y salidas, con ejemplos de costes para agentes de programación, investigación y contextos de 1M de tokens.


Los precios de la API de Kimi K3 tienen tres tarifas: entrada en caché, entrada sin caché y salida. La diferencia entre un acierto y un fallo de caché es de 10×, por lo que dos agentes que procesen el mismo repositorio de 500K tokens pueden tener costes muy distintos según el diseño de la sesión.
Moonshot no añade una tarifa superior por token para la ventana de contexto de 1 millón de tokens de K3. Un contexto largo sigue teniendo coste: un prompt sin caché de 1M de tokens cuesta $3 antes de que el modelo genere una respuesta.
Disponibilidad y precios actualizados el 22 de julio de 2026. Kimi K3 está disponible en Poyo.ai como
kimi-k3mediante la API Chat Completions compatible con OpenAI. El precio es de $2.28 por 1M tokens de entrada y $11.40 por 1M tokens de salida, un 24 % menos que el precio oficial.
Precios oficiales de la API de Kimi K3
| Uso | Precio por 1M de tokens |
|---|---|
| Entrada con acierto de caché | $0.30 |
| Entrada sin caché | $3.00 |
| Salida | $15.00 |
K3 utiliza precios planos de pago por uso. La documentación de Moonshot no incluye un recargo independiente por contexto largo. La API intenta aplicar caché de contexto automáticamente; las aplicaciones no crean un ID de caché ni configuran un TTL para solicitudes normales.
Fórmula de coste de Kimi K3
Usa esta fórmula para una solicitud individual o una carga de trabajo agregada:
cost =
cached_input_tokens / 1,000,000 × $0.30
+ uncached_input_tokens / 1,000,000 × $3.00
+ output_tokens / 1,000,000 × $15.00
La respuesta de uso de la API y el panel de facturación deben ser la fuente de referencia. Las estimaciones pueden variar cuando cambian la tokenización, los reintentos, los turnos con herramientas o el comportamiento de la caché.
Ejemplos reales de costes de Kimi K3
Solicitud de análisis breve
Supongamos 10,000 tokens de entrada sin caché y 2,000 tokens de salida.
| Componente | Cálculo | Coste |
|---|---|---|
| Entrada | 10K / 1M × $3 | $0.03 |
| Salida | 2K / 1M × $15 | $0.03 |
| Total | $0.06 |
Incluso con seis veces más entrada que salida, ambas partes cuestan lo mismo porque los tokens de salida son cinco veces más caros.
Revisión de un repositorio de 100K tokens
Supongamos 100,000 tokens de entrada sin caché y 10,000 tokens de salida.
| Componente | Coste |
|---|---|
| Entrada | $0.30 |
| Salida | $0.15 |
| Total | $0.45 |
Si el mismo prefijo estable del repositorio obtiene un acierto de caché en el siguiente turno, su parte de entrada baja de $0.30 a $0.03.
Corpus de investigación de 500K tokens
Supongamos 500,000 tokens de entrada y 20,000 tokens de salida.
| Estado de caché | Coste de entrada | Coste de salida | Total |
|---|---|---|---|
| Fallo de caché | $1.50 | $0.30 | $1.80 |
| Acierto de caché | $0.15 | $0.30 | $0.45 |
Por eso las sesiones repetidas de trabajo de conocimiento se benefician de un prefijo estable. Cuando la salida se convierte en el mayor coste, pedir al modelo que sea conciso puede importar tanto como la caché.
Contexto completo de 1M con 50K de salida
| Estado de caché | Coste de entrada | Coste de salida | Total |
|---|---|---|---|
| Fallo de caché | $3.00 | $0.75 | $3.75 |
| Acierto de caché | $0.30 | $0.75 | $1.05 |
La ventana de 1M es una capacidad máxima, no un objetivo para cada solicitud. La recuperación de información y el análisis por etapas pueden ser más baratos y fáciles de verificar.
Coste de un agente de programación con múltiples turnos
Considera una sesión de programación de cinco turnos con un prefijo estable de repositorio de 200K tokens, 20K tokens de entrada nueva por turno y 8K tokens de salida por turno.
Si el primer turno no tiene caché y los prefijos estables posteriores sí tienen acierto:
| Uso | Coste aproximado |
|---|---|
| Prefijo inicial de 200K sin caché | $0.60 |
| Cuatro lecturas de prefijo en caché de 200K | $0.24 |
| Cinco × 20K de nueva entrada sin caché | $0.30 |
| Cinco × 8K de salida | $0.60 |
| Total | $1.74 |
Si la aplicación cambia el inicio del contexto en cada turno e impide la reutilización, cinco lecturas sin caché del prefijo de 200K por sí solas costarían $3.00. La construcción de la sesión genera una diferencia mayor que pequeños cambios en los prompts.
Cómo funciona la caché automática de contexto
Moonshot indica que la caché es automática para las solicitudes normales de K3. Para dar al servicio la mejor oportunidad de reutilizar un prefijo:
- mantén sin cambios la parte inicial larga de la conversación;
- añade nuevas preguntas y resultados de herramientas en lugar de reescribir mensajes antiguos;
- evita marcas de tiempo dinámicas e IDs de solicitud cerca del inicio;
- mantén estables las instrucciones del sistema;
- conserva el mensaje completo del asistente requerido por K3;
- organiza correctamente usuarios y documentos para que datos no relacionados nunca compartan el estado de la aplicación.
Un acierto de caché es una optimización, no una garantía. Supervisa los recuentos reales de tokens en caché y sin caché que devuelve el servicio.
Los tokens de salida pueden dominar la factura
El precio de salida de K3 es de $15 por millón de tokens, cinco veces la tarifa de entrada sin caché y 50 veces la tarifa de entrada en caché. Los razonamientos largos y los informes extensos de agentes pueden eliminar los ahorros de la caché de entrada.
Controla el coste de salida mediante:
- establecer un valor realista de
max_completion_tokens; - solicitar artefactos finales concisos;
- usar salidas estructuradas que incluyan únicamente los campos necesarios;
- evitar repetir grandes planes una y otra vez;
- medir si un menor esfuerzo de razonamiento resuelve la tarea de forma fiable;
- detener los bucles de herramientas tras la verificación o un umbral de fallo definido.
No elimines el historial de pensamiento necesario de turnos posteriores únicamente para ahorrar tokens. Moonshot advierte que un estado incompleto puede hacer que K3 sea inestable, lo que puede generar más reintentos y un coste total mayor.
Coste de Kimi K3 frente al alojamiento propio
Los pesos abiertos no hacen que la inferencia sea gratuita. K3 tiene 2.8T parámetros totales, utiliza paralelismo extremo de expertos y se recomienda para supernodos con 64 o más aceleradores. El alojamiento propio añade costes de hardware, red, ingeniería, utilización, monitorización y disponibilidad.
El acceso mediante API suele ser la opción práctica para tráfico variable o moderado. El alojamiento propio se convierte en una cuestión estratégica para organizaciones con uso sostenido, experiencia en infraestructura, requisitos de control de datos y acceso a clústeres adecuados. Espera a conocer la licencia real de los pesos y la pila de inferencia compatible antes de crear un presupuesto.
Cómo reducir el coste de la API de Kimi K3
- Usa un modelo más pequeño para clasificación, enrutamiento y extracción sencilla.
- Envía a K3 únicamente tareas que se beneficien del razonamiento a largo plazo o del contexto multimodal.
- Mantén estables los prefijos reutilizables.
- Recupera el subconjunto relevante cuando el razonamiento con contexto completo no sea necesario.
- Establece límites de salida y de bucles de herramientas.
- Compara
low,highymaxrazonamiento en un conjunto de evaluación real. - Registra el coste por éxito verificado, incluidos los reintentos.
- Haz seguimiento de fallos graves y del tiempo de corrección humana.
¿Es caro Kimi K3?
K3 es económico cuando un prefijo largo en caché permite realizar una tarea de alto valor y la salida se mantiene enfocada. Puede resultar caro cuando cada turno no tiene acierto de caché, genera una respuesta extensa y activa múltiples reintentos.
La comparación útil no es solo el coste por millón de tokens:
effective task cost =
API cost per attempt × attempts per verified success
+ human correction cost
Para conocer el contexto de capacidades y benchmarks, consulta la reseña de Kimi K3 y el análisis de benchmarks de Kimi K3.
Preguntas frecuentes
¿Cuánto cuesta Kimi K3 por millón de tokens?
Las tarifas oficiales de Moonshot son $0.30 para entrada con acierto de caché, $3 para entrada sin caché y $15 para salida.
¿La ventana de contexto de 1M tiene un precio superior por token?
Moonshot publica tarifas planas en lugar de un nivel independiente para contextos largos. Un prompt más grande sigue costando más porque contiene más tokens.
¿Existe una API gratuita de Kimi K3?
Los créditos promocionales o las ofertas de terceros pueden cambiar. No construyas un modelo de costes de producción basándote en acceso gratuito temporal; verifica la consola oficial y las condiciones del proveedor.
¿Los tokens de razonamiento tienen coste?
Usa la respuesta de uso oficial y la documentación de facturación para la contabilidad final de cada solicitud. K3 transmite el razonamiento por separado del contenido final, y un razonamiento largo puede aumentar el uso de tokens generados.
¿Está disponible Kimi K3 en Poyo.ai?
Sí. La página del modelo Kimi K3 incluye Playground, el ID kimi-k3, acceso API y el precio actual de Poyo: $2.28 de entrada y $11.40 de salida por 1M tokens, un 24 % menos que el oficial.


