guides

Kimi K3 评测:基准测试、价格、100 万上下文与 API

Poyo.ai Team
4 min read
Share:

Kimi K3 模型评测

Kimi K3 是 Moonshot AI 推出的 2.8 万亿参数旗舰模型,面向长周期编程、知识工作、视觉推理以及工具调用型智能体。它结合了 100 万 token 上下文窗口、原生图像和视频理解能力、持续开启的推理能力、结构化输出,以及一种极其稀疏的混合专家(Mixture-of-Experts)架构。

这些亮眼的数据令人印象深刻,但它们并不能回答实际应用中的关键问题。Kimi K3 是否优于最强的闭源模型?它的 100 万上下文是真正有用,还是只是成本更高?开发者能否自行部署一个 2.8T 模型?当 K3 连续数小时控制工具运行,而不是只回答单次提示词时,哪些限制会真正产生影响?

本文将区分已确认的能力与发布阶段的宣传内容,并分析 Kimi K3 在生产级模型技术栈中的定位。

Poyo 可用状态更新于 2026 年 7 月 22 日。 Kimi K3 已通过 Poyo.ai 的 kimi-k3 模型及 Moonshot AI 官方产品提供服务。Moonshot 表示完整模型权重计划于 2026 年 7 月 27 日前发布;本文将在权重和许可证公开后更新。

Kimi K3 快速概览

规格Kimi K3
提供商Moonshot AI
模型 ID官方 Moonshot API 中的 kimi-k3
总参数量2.8 万亿
架构KDA、Attention Residuals、Stable LatentMoE
专家数量共 896 个,激活 16 个
上下文窗口100 万 token
最大输出长度默认 131,072 tokens;可配置至 1,048,576
输入文本、图像以及上传的视频
输出文本
推理始终开启;支持 lowhighmax 三档强度
智能体功能工具调用、强制工具选择、动态工具加载
结构化输出严格 JSON Schema
上下文缓存自动
官方 API 状态已上线
Poyo.ai 状态已上线,模型 ID 为 kimi-k3
完整权重已宣布将于 2026 年 7 月 27 日前发布

Kimi K3 采用与密集型 2.8T 模型不同的方式实现超大规模。Stable LatentMoE 会让每个 token 仅经过 896 个专家中的 16 个,因此总参数量并不等同于每个 token 的实际计算量。在比较架构、智能水平和部署成本时,这一区别非常重要。

Kimi K3 的设计目标

Moonshot 将 K3 定位于两类核心工作负载:长周期软件工程和端到端知识工作。

长周期编程

K3 的目标是在长时间工程任务中持续保持生产力。官方示例重点展示了大型代码仓库导航、终端协作、GPU 内核优化、编译器开发、前端工程、游戏开发、CAD 以及科学计算编程。

这与代码补全是不同方向。长周期编程模型需要不断检查状态、选择工具、理解结果、调整计划,并验证最终产物。相比第一次生成代码样例的质量,持续性和恢复能力可能更加重要。

编程流程中的视觉能力

K3 具备原生视觉理解能力。它可以利用截图和渲染结果作为修改代码时的反馈。这使其适用于前端迭代、视觉测试、游戏、3D 场景、图表以及其他仅通过单元测试无法验证的工作流程。

官方 API 支持图像数据和上传的视频。视觉消息中不直接接受公开图像 URL:图像必须通过 base64 或支持的文件处理方式提供,视频则通过 Moonshot 文件 ID 引用。

知识工作

K3 同样面向研究、报告、电子表格、演示文稿、仪表盘以及多阶段分析任务。100 万 token 上下文可以容纳大量资料,但高质量知识工作仍然需要来源管理、引用检查和事实验证。超大上下文窗口减少了丢弃上下文的需求,但并不能保证模型会正确回忆或权衡所有信息。

Kimi K3 基准测试表现如何?

Kimi 的发布报告覆盖了代码仓库修复、终端任务、完整程序构建、知识工作、自动化、浏览以及多模态评测。比单个分数更重要的是整体趋势:K3 在长周期智能体工作流中表现最强,并且在官方测试套件中保持了与领先闭源模型的竞争力。

但其中的限制也很重要:

  • Kimi K3 的测试结果通常使用最高推理强度。
  • 不同模型并不总是在完全相同的智能体框架下进行评测。
  • 部分任务运行于针对 H20 校准的环境,而不是基准测试标准硬件。
  • 官方报告指出,至少有一个竞争模型存在回退行为。
  • 独立综合智能排名并未将 K3 排在第一。

目前的独立分析将 K3 定位于前沿水平附近,而不是明确超越其他模型。这与 Moonshot 自身关于“K3 整体仍落后于最强专有模型”的说明一致。

如需查看评分表、测试框架说明以及官方评测与独立评测之间的区别,请阅读 Kimi K3 基准测试解析

Kimi K3 API 价格

Moonshot 提供统一的按量计费价格,并区分缓存命中和未命中的输入价格。

Token 类型官方价格(每 1M tokens)
缓存命中输入$0.30
缓存未命中输入$3.00
输出$15.00

请求使用长上下文不会触发更高价格层级。但总费用仍可能快速增加:100 万未缓存输入 token 的成本为 $3,此外 50,000 输出 token 还会增加 $0.75。

自动缓存可能改变重复代码仓库和研究任务的成本结构。稳定的 500K token 前缀在未命中缓存时成本为 $1.50,而缓存命中时仅为 $0.15。应用程序应记录缓存行为,而不是默认所有重复请求都会获得低价。

完整工作负载示例和缓存策略请查看 Kimi K3 API 定价解析

Kimi K3 vs GPT-5.6 Sol

K3 和 GPT-5.6 Sol 都覆盖高端编程、智能体、推理以及专业工作场景,但它们代表不同的技术取舍。

对比方向Kimi K3GPT-5.6 Sol
主要优势100 万上下文以及计划开放权重更强的顶级闭源模型性能
编程强于长周期和视觉编程强大的通用编程和终端能力
多模态输入原生图像和视频理解多模态能力取决于当前 API 能力范围
上下文100 万 tokens请确认当前接口限制
开放权重已宣布
部署方式官方 API 或未来超大规模自部署集群托管 API
生产成熟度新发布成熟的 OpenAI 平台

没有任何模型能在所有工作负载中胜出。K3 对重视长上下文、多模态编程以及未来权重访问的团队具有吸引力。GPT-5.6 Sol 则更适合看重独立测试中的顶级质量、成熟平台表现以及闭源托管基础设施的场景。

完整决策指南请阅读 Kimi K3 vs GPT-5.6 Sol

Kimi K3 的优势

真正超大规模的工作上下文

100 万 token 可以让智能体同时保留源代码、文档、工具历史、视觉证据以及中间产物。当需要综合考虑大量关联证据时,这种能力尤其有价值。

编程与视觉能力融合于同一模型

K3 可以检查渲染结果,而不仅依赖源代码或文本日志。这使其适用于 UI 开发、游戏、CAD、数据可视化以及媒体工作流。

面向智能体的 API 能力

官方 API 支持自定义工具、强制工具调用、动态工具加载、流式输出、结构化输出以及长时间多轮会话。这些是生产环境构建模块,而不是单纯聊天功能。

开放权重方向

Moonshot 将 K3 描述为首个开放的 3T 级模型,并已宣布将发布完整权重。如果发布版本和许可证允许广泛使用,它将比仅提供 API 的闭源模型给予基础设施团队更多控制权。但可用性、许可证条款以及社区推理支持仍需在发布后确认。

Kimi K3 的限制

必须保留思考历史

Moonshot 提醒,K3 的训练过程保留了思考历史。若客户端丢弃必要的助手状态、只保留最终文本,或在会话中途切换模型,都可能导致质量不稳定。因此,正确处理会话状态非常重要。

可能过于主动

长周期训练会鼓励模型持续推进任务。在模糊情况下,K3 可能会执行用户未明确授权的操作。生产级智能体需要明确边界、限制工具权限、设置审批步骤,并清楚规定何时停止。

最大模型并非本地笔记本模型

即使采用 MXFP4 权重和稀疏专家激活,2.8T 模型仍属于基础设施级部署。Moonshot 推荐使用包含 64 个或更多加速器的超级节点配置。开放权重并不会让 K3 适用于消费级 GPU 或普通工作站。

输出成本相对较高

每百万输出 token $15 的价格意味着冗长的智能体行为可能成为主要成本来源。应用应设置合理的输出限制,并衡量每个已验证任务的成本,而不是单次请求价格。

部分发布信息仍待确认

截至 7 月 21 日,完整权重、最终许可证以及技术报告尚未公开。在这些资料正式发布前,任何声称已经提供完整本地部署流程的文章都应谨慎看待。

谁适合使用 Kimi K3?

K3 适合:

  • 仓库级代码智能体;
  • 需要持续执行能力的终端工作流;
  • 前端、游戏、CAD 和视觉软件迭代;
  • 长文档研究和专业内容产出;
  • 使用图像或上传视频的多模态分析;
  • 评估未来开放权重前沿模型部署的团队。

它可能不适合:

  • 分类、提取以及简单客服任务;
  • 对延迟敏感的短响应场景;
  • 小规模自部署环境;
  • 无法保存完整会话状态的工作流;
  • 缺少权限控制和验证机制的智能体。

Kimi K3 总结

Kimi K3 是 2026 年最具影响力的开放模型发布之一,因为它结合了前沿级架构、100 万上下文窗口、原生视觉理解能力以及成熟的智能体 API。它最有说服力的应用场景并不是一次性的基准测试问题,而是持续处理代码、工具、文档和视觉反馈的长期任务。

该模型并不会自动取代最强闭源系统。独立评测、输出成本、状态管理要求、过度主动行为以及极高的自部署门槛都需要考虑。正确的生产决策方式,是在真实长期任务中测试 K3,并比较每个已验证结果的成本。

关注 Kimi K3 模型页面,获取 Poyo.ai 上线状态、确认后的模型 ID 和价格信息。

常见问题

Kimi K3 是开源的吗?

Moonshot 将 K3 称为开放的 3T 级模型,并表示完整权重将在 2026 年 7 月 27 日前发布。截至 7 月 21 日,开发者应等待实际文件和许可证发布后,再做部署或商业使用方面的判断。

Kimi K3 的上下文窗口有多大?

Kimi K3 支持 100 万 token 上下文窗口。官方 API 支持自动上下文缓存。

Kimi K3 比 GPT-5.6 Sol 更好吗?

并非所有场景都是如此。K3 在长上下文、计划开放权重、多模态编程以及智能体工作流方面更具吸引力。GPT-5.6 Sol 在部分独立评测和顶级能力测试中仍具有优势。应针对相同任务进行测试比较。

Kimi K3 支持图像和视频吗?

支持。官方 API 支持图像输入和上传视频输入。它返回文本,而不是生成图像或视频。

Kimi K3 API 多少钱?

Moonshot 定价为:每百万缓存命中输入 token $0.30,每百万缓存未命中输入 token $3,每百万输出 token $15。

Kimi K3 可以本地运行吗?

不能在普通消费级硬件上运行。即使每个 token 只激活部分专家,2.8T 模型仍面向大型分布式基础设施。

来源

Share: