
Kimi K3 是 Moonshot AI 推出的 2.8 万亿参数旗舰模型,面向长周期编程、知识工作、视觉推理以及工具调用型智能体。它结合了 100 万 token 上下文窗口、原生图像和视频理解能力、持续开启的推理能力、结构化输出,以及一种极其稀疏的混合专家(Mixture-of-Experts)架构。
这些亮眼的数据令人印象深刻,但它们并不能回答实际应用中的关键问题。Kimi K3 是否优于最强的闭源模型?它的 100 万上下文是真正有用,还是只是成本更高?开发者能否自行部署一个 2.8T 模型?当 K3 连续数小时控制工具运行,而不是只回答单次提示词时,哪些限制会真正产生影响?
本文将区分已确认的能力与发布阶段的宣传内容,并分析 Kimi K3 在生产级模型技术栈中的定位。
Poyo 可用状态更新于 2026 年 7 月 22 日。 Kimi K3 已通过 Poyo.ai 的
kimi-k3模型及 Moonshot AI 官方产品提供服务。Moonshot 表示完整模型权重计划于 2026 年 7 月 27 日前发布;本文将在权重和许可证公开后更新。
Kimi K3 快速概览
| 规格 | Kimi K3 |
|---|---|
| 提供商 | Moonshot AI |
| 模型 ID | 官方 Moonshot API 中的 kimi-k3 |
| 总参数量 | 2.8 万亿 |
| 架构 | KDA、Attention Residuals、Stable LatentMoE |
| 专家数量 | 共 896 个,激活 16 个 |
| 上下文窗口 | 100 万 token |
| 最大输出长度 | 默认 131,072 tokens;可配置至 1,048,576 |
| 输入 | 文本、图像以及上传的视频 |
| 输出 | 文本 |
| 推理 | 始终开启;支持 low、high 和 max 三档强度 |
| 智能体功能 | 工具调用、强制工具选择、动态工具加载 |
| 结构化输出 | 严格 JSON Schema |
| 上下文缓存 | 自动 |
| 官方 API 状态 | 已上线 |
| Poyo.ai 状态 | 已上线,模型 ID 为 kimi-k3 |
| 完整权重 | 已宣布将于 2026 年 7 月 27 日前发布 |
Kimi K3 采用与密集型 2.8T 模型不同的方式实现超大规模。Stable LatentMoE 会让每个 token 仅经过 896 个专家中的 16 个,因此总参数量并不等同于每个 token 的实际计算量。在比较架构、智能水平和部署成本时,这一区别非常重要。
Kimi K3 的设计目标
Moonshot 将 K3 定位于两类核心工作负载:长周期软件工程和端到端知识工作。
长周期编程
K3 的目标是在长时间工程任务中持续保持生产力。官方示例重点展示了大型代码仓库导航、终端协作、GPU 内核优化、编译器开发、前端工程、游戏开发、CAD 以及科学计算编程。
这与代码补全是不同方向。长周期编程模型需要不断检查状态、选择工具、理解结果、调整计划,并验证最终产物。相比第一次生成代码样例的质量,持续性和恢复能力可能更加重要。
编程流程中的视觉能力
K3 具备原生视觉理解能力。它可以利用截图和渲染结果作为修改代码时的反馈。这使其适用于前端迭代、视觉测试、游戏、3D 场景、图表以及其他仅通过单元测试无法验证的工作流程。
官方 API 支持图像数据和上传的视频。视觉消息中不直接接受公开图像 URL:图像必须通过 base64 或支持的文件处理方式提供,视频则通过 Moonshot 文件 ID 引用。
知识工作
K3 同样面向研究、报告、电子表格、演示文稿、仪表盘以及多阶段分析任务。100 万 token 上下文可以容纳大量资料,但高质量知识工作仍然需要来源管理、引用检查和事实验证。超大上下文窗口减少了丢弃上下文的需求,但并不能保证模型会正确回忆或权衡所有信息。
Kimi K3 基准测试表现如何?
Kimi 的发布报告覆盖了代码仓库修复、终端任务、完整程序构建、知识工作、自动化、浏览以及多模态评测。比单个分数更重要的是整体趋势:K3 在长周期智能体工作流中表现最强,并且在官方测试套件中保持了与领先闭源模型的竞争力。
但其中的限制也很重要:
- Kimi K3 的测试结果通常使用最高推理强度。
- 不同模型并不总是在完全相同的智能体框架下进行评测。
- 部分任务运行于针对 H20 校准的环境,而不是基准测试标准硬件。
- 官方报告指出,至少有一个竞争模型存在回退行为。
- 独立综合智能排名并未将 K3 排在第一。
目前的独立分析将 K3 定位于前沿水平附近,而不是明确超越其他模型。这与 Moonshot 自身关于“K3 整体仍落后于最强专有模型”的说明一致。
如需查看评分表、测试框架说明以及官方评测与独立评测之间的区别,请阅读 Kimi K3 基准测试解析。
Kimi K3 API 价格
Moonshot 提供统一的按量计费价格,并区分缓存命中和未命中的输入价格。
| Token 类型 | 官方价格(每 1M tokens) |
|---|---|
| 缓存命中输入 | $0.30 |
| 缓存未命中输入 | $3.00 |
| 输出 | $15.00 |
请求使用长上下文不会触发更高价格层级。但总费用仍可能快速增加:100 万未缓存输入 token 的成本为 $3,此外 50,000 输出 token 还会增加 $0.75。
自动缓存可能改变重复代码仓库和研究任务的成本结构。稳定的 500K token 前缀在未命中缓存时成本为 $1.50,而缓存命中时仅为 $0.15。应用程序应记录缓存行为,而不是默认所有重复请求都会获得低价。
完整工作负载示例和缓存策略请查看 Kimi K3 API 定价解析。
Kimi K3 vs GPT-5.6 Sol
K3 和 GPT-5.6 Sol 都覆盖高端编程、智能体、推理以及专业工作场景,但它们代表不同的技术取舍。
| 对比方向 | Kimi K3 | GPT-5.6 Sol |
|---|---|---|
| 主要优势 | 100 万上下文以及计划开放权重 | 更强的顶级闭源模型性能 |
| 编程 | 强于长周期和视觉编程 | 强大的通用编程和终端能力 |
| 多模态输入 | 原生图像和视频理解 | 多模态能力取决于当前 API 能力范围 |
| 上下文 | 100 万 tokens | 请确认当前接口限制 |
| 开放权重 | 已宣布 | 否 |
| 部署方式 | 官方 API 或未来超大规模自部署集群 | 托管 API |
| 生产成熟度 | 新发布 | 成熟的 OpenAI 平台 |
没有任何模型能在所有工作负载中胜出。K3 对重视长上下文、多模态编程以及未来权重访问的团队具有吸引力。GPT-5.6 Sol 则更适合看重独立测试中的顶级质量、成熟平台表现以及闭源托管基础设施的场景。
完整决策指南请阅读 Kimi K3 vs GPT-5.6 Sol。
Kimi K3 的优势
真正超大规模的工作上下文
100 万 token 可以让智能体同时保留源代码、文档、工具历史、视觉证据以及中间产物。当需要综合考虑大量关联证据时,这种能力尤其有价值。
编程与视觉能力融合于同一模型
K3 可以检查渲染结果,而不仅依赖源代码或文本日志。这使其适用于 UI 开发、游戏、CAD、数据可视化以及媒体工作流。
面向智能体的 API 能力
官方 API 支持自定义工具、强制工具调用、动态工具加载、流式输出、结构化输出以及长时间多轮会话。这些是生产环境构建模块,而不是单纯聊天功能。
开放权重方向
Moonshot 将 K3 描述为首个开放的 3T 级模型,并已宣布将发布完整权重。如果发布版本和许可证允许广泛使用,它将比仅提供 API 的闭源模型给予基础设施团队更多控制权。但可用性、许可证条款以及社区推理支持仍需在发布后确认。
Kimi K3 的限制
必须保留思考历史
Moonshot 提醒,K3 的训练过程保留了思考历史。若客户端丢弃必要的助手状态、只保留最终文本,或在会话中途切换模型,都可能导致质量不稳定。因此,正确处理会话状态非常重要。
可能过于主动
长周期训练会鼓励模型持续推进任务。在模糊情况下,K3 可能会执行用户未明确授权的操作。生产级智能体需要明确边界、限制工具权限、设置审批步骤,并清楚规定何时停止。
最大模型并非本地笔记本模型
即使采用 MXFP4 权重和稀疏专家激活,2.8T 模型仍属于基础设施级部署。Moonshot 推荐使用包含 64 个或更多加速器的超级节点配置。开放权重并不会让 K3 适用于消费级 GPU 或普通工作站。
输出成本相对较高
每百万输出 token $15 的价格意味着冗长的智能体行为可能成为主要成本来源。应用应设置合理的输出限制,并衡量每个已验证任务的成本,而不是单次请求价格。
部分发布信息仍待确认
截至 7 月 21 日,完整权重、最终许可证以及技术报告尚未公开。在这些资料正式发布前,任何声称已经提供完整本地部署流程的文章都应谨慎看待。
谁适合使用 Kimi K3?
K3 适合:
- 仓库级代码智能体;
- 需要持续执行能力的终端工作流;
- 前端、游戏、CAD 和视觉软件迭代;
- 长文档研究和专业内容产出;
- 使用图像或上传视频的多模态分析;
- 评估未来开放权重前沿模型部署的团队。
它可能不适合:
- 分类、提取以及简单客服任务;
- 对延迟敏感的短响应场景;
- 小规模自部署环境;
- 无法保存完整会话状态的工作流;
- 缺少权限控制和验证机制的智能体。
Kimi K3 总结
Kimi K3 是 2026 年最具影响力的开放模型发布之一,因为它结合了前沿级架构、100 万上下文窗口、原生视觉理解能力以及成熟的智能体 API。它最有说服力的应用场景并不是一次性的基准测试问题,而是持续处理代码、工具、文档和视觉反馈的长期任务。
该模型并不会自动取代最强闭源系统。独立评测、输出成本、状态管理要求、过度主动行为以及极高的自部署门槛都需要考虑。正确的生产决策方式,是在真实长期任务中测试 K3,并比较每个已验证结果的成本。
关注 Kimi K3 模型页面,获取 Poyo.ai 上线状态、确认后的模型 ID 和价格信息。
常见问题
Kimi K3 是开源的吗?
Moonshot 将 K3 称为开放的 3T 级模型,并表示完整权重将在 2026 年 7 月 27 日前发布。截至 7 月 21 日,开发者应等待实际文件和许可证发布后,再做部署或商业使用方面的判断。
Kimi K3 的上下文窗口有多大?
Kimi K3 支持 100 万 token 上下文窗口。官方 API 支持自动上下文缓存。
Kimi K3 比 GPT-5.6 Sol 更好吗?
并非所有场景都是如此。K3 在长上下文、计划开放权重、多模态编程以及智能体工作流方面更具吸引力。GPT-5.6 Sol 在部分独立评测和顶级能力测试中仍具有优势。应针对相同任务进行测试比较。
Kimi K3 支持图像和视频吗?
支持。官方 API 支持图像输入和上传视频输入。它返回文本,而不是生成图像或视频。
Kimi K3 API 多少钱?
Moonshot 定价为:每百万缓存命中输入 token $0.30,每百万缓存未命中输入 token $3,每百万输出 token $15。
Kimi K3 可以本地运行吗?
不能在普通消费级硬件上运行。即使每个 token 只激活部分专家,2.8T 模型仍面向大型分布式基础设施。