
Kimi K3 API 定价包含三种费率:缓存输入、未缓存输入和输出。缓存命中与缓存未命中的成本差异达到 10 倍,因此,两个处理同一个 500K-token 代码仓库的智能体,可能会因为会话设计不同而产生完全不同的成本。
Moonshot 不会针对 K3 的 100 万 token 上下文窗口增加更高的单 token 价格。长上下文仍然不是免费的:一个未缓存的 1M-token 提示词在模型生成答案之前就需要支付 $3。
可用状态与价格更新于 2026 年 7 月 22 日。 Kimi K3 已在 Poyo.ai 上线,模型 ID 为
kimi-k3,支持 OpenAI 兼容的 Chat Completions API。价格为每百万输入 Token $2.28、每百万输出 Token $11.40,比官方价格便宜 24%。
Kimi K3 API 官方价格
| 用量 | 每 1M tokens 价格 |
|---|---|
| 缓存命中输入 | $0.30 |
| 缓存未命中输入 | $3.00 |
| 输出 | $15.00 |
K3 采用统一的按量付费定价。Moonshot 文档没有列出单独的长上下文附加费用。API 会自动尝试进行上下文缓存;对于普通请求,应用程序无需创建缓存 ID 或配置 TTL。
Kimi K3 成本计算公式
对于单个请求或聚合工作负载,可以使用以下公式:
cost =
cached_input_tokens / 1,000,000 × $0.30
+ uncached_input_tokens / 1,000,000 × $3.00
+ output_tokens / 1,000,000 × $15.00
API 使用量响应和计费面板应作为最终依据。当分词方式、重试、工具调用轮次或缓存行为发生变化时,估算结果可能会有所不同。
Kimi K3 实际成本示例
短分析请求
假设有 10,000 个未缓存输入 tokens 和 2,000 个输出 tokens。
| 项目 | 计算方式 | 成本 |
|---|---|---|
| 输入 | 10K / 1M × $3 | $0.03 |
| 输出 | 2K / 1M × $15 | $0.03 |
| 总计 | $0.06 |
即使输入量是输出量的 6 倍,两者成本仍然相同,因为输出 tokens 的价格是输入 tokens 的 5 倍。
一个 100K-token 代码仓库审查
假设有 100,000 个未缓存输入 tokens 和 10,000 个输出 tokens。
| 项目 | 成本 |
|---|---|
| 输入 | $0.30 |
| 输出 | $0.15 |
| 总计 | $0.45 |
如果同一个稳定代码仓库前缀在下一轮触发缓存命中,其输入部分成本会从 $0.30 降至 $0.03。
一个 500K-token 研究语料库
假设有 500,000 个输入 tokens 和 20,000 个输出 tokens。
| 缓存状态 | 输入成本 | 输出成本 | 总计 |
|---|---|---|---|
| 缓存未命中 | $1.50 | $0.30 | $1.80 |
| 缓存命中 | $0.15 | $0.30 | $0.45 |
这就是为什么重复的知识工作会话适合使用稳定前缀。当输出成为最大成本来源时,让模型保持简洁的重要性可能与缓存优化不相上下。
完整 1M 上下文并生成 50K 输出
| 缓存状态 | 输入成本 | 输出成本 | 总计 |
|---|---|---|---|
| 缓存未命中 | $3.00 | $0.75 | $3.75 |
| 缓存命中 | $0.30 | $0.75 | $1.05 |
1M 上下文窗口是一项最大能力,而不是每个请求的目标。检索和分阶段分析可能更便宜,也更容易验证。
多轮代码智能体成本
考虑一个五轮代码会话:包含 200K-token 稳定代码仓库前缀,每轮新增 20K tokens 输入,每轮输出 8K tokens。
如果第一轮未命中缓存,之后稳定前缀均命中缓存:
| 用量 | 大致成本 |
|---|---|
| 初始 200K 未缓存前缀 | $0.60 |
| 四次 200K 缓存前缀读取 | $0.24 |
| 五次 × 20K 新增未缓存输入 | $0.30 |
| 五次 × 8K 输出 | $0.60 |
| 总计 | $1.74 |
如果应用程序每轮都修改上下文开头,导致无法复用缓存,仅 5 次未缓存读取 200K 前缀就会产生 $3.00 成本。会话结构设计造成的差异,往往比小范围提示词修改更大。
自动上下文缓存如何工作
Moonshot 表示,普通 K3 请求会自动启用缓存。为了让服务更有机会复用前缀:
- 保持对话开头的长内容不变;
- 在旧消息之后追加新问题和工具结果,而不是重写旧消息;
- 避免在上下文开头附近加入动态时间戳和请求 ID;
- 保持系统指令稳定;
- 保留 K3 所需的完整 assistant 消息;
- 正确组织用户和文档,避免无关数据共享应用状态。
缓存命中是一种优化方式,并非保证结果。请监控服务返回的实际缓存和未缓存 token 数量。
输出 tokens 可能占据主要账单
K3 输出价格为每百万 tokens $15,是未缓存输入价格的 5 倍,也是缓存输入价格的 50 倍。长推理过程和冗长的智能体报告可能会抵消输入缓存带来的节省。
可以通过以下方式控制输出成本:
- 设置合理的
max_completion_tokens值; - 要求生成简洁的最终产物;
- 使用仅包含必要字段的结构化输出;
- 避免重复陈述大型计划;
- 测量较低推理强度是否能稳定完成任务;
- 在验证完成或达到明确失败阈值后停止工具循环。
不要仅为了节省 tokens 而从后续轮次中删除必要的思考历史。Moonshot 提醒,不完整的状态可能导致 K3 不稳定,从而造成更多重试并增加总成本。
Kimi K3 与自托管成本对比
开放权重并不意味着推理免费。K3 拥有 2.8T 总参数,采用极端专家并行架构,并建议使用配备 64 个或更多加速器的超级节点。自托管还会增加硬件、网络、工程、利用率、监控和可用性成本。
对于流量不稳定或规模适中的场景,API 接入通常是更实际的选择。对于具备持续使用需求、基础设施能力、数据控制要求以及合适集群资源的组织,自托管才会成为战略性选择。在制定预算前,应等待实际权重许可证和支持的推理技术栈确认。
如何降低 Kimi K3 API 成本
- 使用更小的模型处理分类、路由和简单提取任务。
- 仅将 K3 用于受益于长期推理或多模态上下文的任务。
- 保持可复用前缀稳定。
- 在不需要完整上下文推理时,检索相关子集。
- 设置有边界的输出和工具循环限制。
- 在真实评估集上比较
low、high和max推理效果。 - 记录每次验证成功的成本,包括重试成本。
- 跟踪严重失败情况和人工修正时间。
Kimi K3 贵吗?
当缓存的长前缀支持高价值任务且输出保持聚焦时,K3 的成本较低。如果每轮都无法命中缓存、生成大量输出,并触发多次重试,成本可能会很高。
有意义的比较并不是单独看每百万 tokens 的价格:
effective task cost =
API cost per attempt × attempts per verified success
+ human correction cost
如需了解能力和基准测试背景,请阅读 Kimi K3 评测 和 Kimi K3 基准分析。
常见问题
Kimi K3 每百万 tokens 多少钱?
Moonshot 官方价格为:缓存命中输入 $0.30,缓存未命中输入 $3,输出 $15。
1M 上下文窗口是否有更高的 token 价格?
Moonshot 提供的是统一费率,而不是单独的长上下文价格层级。更大的提示词仍然会产生更高成本,因为其中包含更多 tokens。
是否有免费的 Kimi K3 API?
促销额度或第三方优惠可能会变化。不要基于临时免费访问建立生产成本模型;请确认官方控制台和服务提供商条款。
推理 tokens 是否计费?
最终每个请求的计费情况应以官方使用量响应和计费文档为准。K3 会将推理过程与最终内容分开流式输出,而较长的推理过程可能增加生成 token 使用量。
Kimi K3 是否已在 Poyo.ai 上线?
已经上线。Kimi K3 模型页面现已提供 Playground、模型 ID kimi-k3、API 接入方式和当前 Poyo 价格:每百万 Token 输入 $2.28、输出 $11.40,比官方价格便宜 24%。