guides

Kimi K3 API 定价:Token 成本、缓存节省与示例

Poyo.ai Team
3 min read
Share:

Kimi K3 API 定价和上下文成本

Kimi K3 API 定价包含三种费率:缓存输入、未缓存输入和输出。缓存命中与缓存未命中的成本差异达到 10 倍,因此,两个处理同一个 500K-token 代码仓库的智能体,可能会因为会话设计不同而产生完全不同的成本。

Moonshot 不会针对 K3 的 100 万 token 上下文窗口增加更高的单 token 价格。长上下文仍然不是免费的:一个未缓存的 1M-token 提示词在模型生成答案之前就需要支付 $3。

可用状态与价格更新于 2026 年 7 月 22 日。 Kimi K3 已在 Poyo.ai 上线,模型 ID 为 kimi-k3,支持 OpenAI 兼容的 Chat Completions API。价格为每百万输入 Token $2.28每百万输出 Token $11.40比官方价格便宜 24%

Kimi K3 API 官方价格

用量每 1M tokens 价格
缓存命中输入$0.30
缓存未命中输入$3.00
输出$15.00

K3 采用统一的按量付费定价。Moonshot 文档没有列出单独的长上下文附加费用。API 会自动尝试进行上下文缓存;对于普通请求,应用程序无需创建缓存 ID 或配置 TTL。

Kimi K3 成本计算公式

对于单个请求或聚合工作负载,可以使用以下公式:

cost =
  cached_input_tokens / 1,000,000 × $0.30
  + uncached_input_tokens / 1,000,000 × $3.00
  + output_tokens / 1,000,000 × $15.00

API 使用量响应和计费面板应作为最终依据。当分词方式、重试、工具调用轮次或缓存行为发生变化时,估算结果可能会有所不同。

Kimi K3 实际成本示例

短分析请求

假设有 10,000 个未缓存输入 tokens 和 2,000 个输出 tokens。

项目计算方式成本
输入10K / 1M × $3$0.03
输出2K / 1M × $15$0.03
总计$0.06

即使输入量是输出量的 6 倍,两者成本仍然相同,因为输出 tokens 的价格是输入 tokens 的 5 倍。

一个 100K-token 代码仓库审查

假设有 100,000 个未缓存输入 tokens 和 10,000 个输出 tokens。

项目成本
输入$0.30
输出$0.15
总计$0.45

如果同一个稳定代码仓库前缀在下一轮触发缓存命中,其输入部分成本会从 $0.30 降至 $0.03。

一个 500K-token 研究语料库

假设有 500,000 个输入 tokens 和 20,000 个输出 tokens。

缓存状态输入成本输出成本总计
缓存未命中$1.50$0.30$1.80
缓存命中$0.15$0.30$0.45

这就是为什么重复的知识工作会话适合使用稳定前缀。当输出成为最大成本来源时,让模型保持简洁的重要性可能与缓存优化不相上下。

完整 1M 上下文并生成 50K 输出

缓存状态输入成本输出成本总计
缓存未命中$3.00$0.75$3.75
缓存命中$0.30$0.75$1.05

1M 上下文窗口是一项最大能力,而不是每个请求的目标。检索和分阶段分析可能更便宜,也更容易验证。

多轮代码智能体成本

考虑一个五轮代码会话:包含 200K-token 稳定代码仓库前缀,每轮新增 20K tokens 输入,每轮输出 8K tokens。

如果第一轮未命中缓存,之后稳定前缀均命中缓存:

用量大致成本
初始 200K 未缓存前缀$0.60
四次 200K 缓存前缀读取$0.24
五次 × 20K 新增未缓存输入$0.30
五次 × 8K 输出$0.60
总计$1.74

如果应用程序每轮都修改上下文开头,导致无法复用缓存,仅 5 次未缓存读取 200K 前缀就会产生 $3.00 成本。会话结构设计造成的差异,往往比小范围提示词修改更大。

自动上下文缓存如何工作

Moonshot 表示,普通 K3 请求会自动启用缓存。为了让服务更有机会复用前缀:

  • 保持对话开头的长内容不变;
  • 在旧消息之后追加新问题和工具结果,而不是重写旧消息;
  • 避免在上下文开头附近加入动态时间戳和请求 ID;
  • 保持系统指令稳定;
  • 保留 K3 所需的完整 assistant 消息;
  • 正确组织用户和文档,避免无关数据共享应用状态。

缓存命中是一种优化方式,并非保证结果。请监控服务返回的实际缓存和未缓存 token 数量。

输出 tokens 可能占据主要账单

K3 输出价格为每百万 tokens $15,是未缓存输入价格的 5 倍,也是缓存输入价格的 50 倍。长推理过程和冗长的智能体报告可能会抵消输入缓存带来的节省。

可以通过以下方式控制输出成本:

  • 设置合理的 max_completion_tokens 值;
  • 要求生成简洁的最终产物;
  • 使用仅包含必要字段的结构化输出;
  • 避免重复陈述大型计划;
  • 测量较低推理强度是否能稳定完成任务;
  • 在验证完成或达到明确失败阈值后停止工具循环。

不要仅为了节省 tokens 而从后续轮次中删除必要的思考历史。Moonshot 提醒,不完整的状态可能导致 K3 不稳定,从而造成更多重试并增加总成本。

Kimi K3 与自托管成本对比

开放权重并不意味着推理免费。K3 拥有 2.8T 总参数,采用极端专家并行架构,并建议使用配备 64 个或更多加速器的超级节点。自托管还会增加硬件、网络、工程、利用率、监控和可用性成本。

对于流量不稳定或规模适中的场景,API 接入通常是更实际的选择。对于具备持续使用需求、基础设施能力、数据控制要求以及合适集群资源的组织,自托管才会成为战略性选择。在制定预算前,应等待实际权重许可证和支持的推理技术栈确认。

如何降低 Kimi K3 API 成本

  1. 使用更小的模型处理分类、路由和简单提取任务。
  2. 仅将 K3 用于受益于长期推理或多模态上下文的任务。
  3. 保持可复用前缀稳定。
  4. 在不需要完整上下文推理时,检索相关子集。
  5. 设置有边界的输出和工具循环限制。
  6. 在真实评估集上比较 lowhighmax 推理效果。
  7. 记录每次验证成功的成本,包括重试成本。
  8. 跟踪严重失败情况和人工修正时间。

Kimi K3 贵吗?

当缓存的长前缀支持高价值任务且输出保持聚焦时,K3 的成本较低。如果每轮都无法命中缓存、生成大量输出,并触发多次重试,成本可能会很高。

有意义的比较并不是单独看每百万 tokens 的价格:

effective task cost =
  API cost per attempt × attempts per verified success
  + human correction cost

如需了解能力和基准测试背景,请阅读 Kimi K3 评测Kimi K3 基准分析

常见问题

Kimi K3 每百万 tokens 多少钱?

Moonshot 官方价格为:缓存命中输入 $0.30,缓存未命中输入 $3,输出 $15。

1M 上下文窗口是否有更高的 token 价格?

Moonshot 提供的是统一费率,而不是单独的长上下文价格层级。更大的提示词仍然会产生更高成本,因为其中包含更多 tokens。

是否有免费的 Kimi K3 API?

促销额度或第三方优惠可能会变化。不要基于临时免费访问建立生产成本模型;请确认官方控制台和服务提供商条款。

推理 tokens 是否计费?

最终每个请求的计费情况应以官方使用量响应和计费文档为准。K3 会将推理过程与最终内容分开流式输出,而较长的推理过程可能增加生成 token 使用量。

Kimi K3 是否已在 Poyo.ai 上线?

已经上线。Kimi K3 模型页面现已提供 Playground、模型 ID kimi-k3、API 接入方式和当前 Poyo 价格:每百万 Token 输入 $2.28、输出 $11.40,比官方价格便宜 24%。

来源

Share: