Kimi K3 API Giá: Chi phí token, tiết kiệm cache và ví dụ
Hiểu giá Kimi K3 API cho đầu vào được lưu trữ trong cache, đầu vào và đầu ra không lưu trữ trong cache, với ví dụ chi phí cho các đại lý mã hóa, nghiên cứu và bối cảnh mã 1M.


Giá Kimi K3 API có ba tỷ lệ: đầu vào được lưu trữ trong cache, đầu vào không lưu trữ và đầu ra. Sự khác biệt giữa một hit cache và một miss là 10×, vì vậy hai đại lý xử lý kho lưu trữ mã 500K tương tự có thể có chi phí rất khác nhau tùy thuộc vào thiết kế phiên.
Moonshot không thêm một cấp độ cao hơn cho mỗi token cho cửa sổ bối cảnh 1 triệu token của K3. Lịch chiếu dài vẫn không tự do: một dấu hiệu 1M-tốc hiệu không được lưu trữ chi phí $3 trước khi mô hình tạo ra một câu trả lời.
Kế hoạch hiện hành và giá cả tháng 7 22, 2026. Kimi K3 có sẵn trên Poyo.ai như
kimi-k3thông qua các Chat Complements OpenAI tương thích API. Giá cả là $2.28 cho mỗi token nhập 1M và $11.40 cho mỗi token đầu ra 1M — 24% thấp hơn giá chính thức.
Giá chính thức Kimi K3 API
| Mức sử dụng | Giá cho mỗi token 1M |
|---|---|
| Cache hit input | $0.30 |
| Cache-miss input | $3.00 |
| Đầu ra | $15.00 |
K3 sử dụng giá thanh toán theo giá. Tài liệu của Moonshot không liệt kê một khoản phụ phí dài ngữ cảnh riêng biệt. API cố gắng lưu trữ nội dung tự động; các ứng dụng không tạo ID lưu trữ hoặc cấu hình TTL cho các yêu cầu thông thường.
Công thức chi phí Kimi K3
Sử dụng công thức này cho một yêu cầu hoặc khối lượng công việc tổng hợp:
cost =
cached_input_tokens / 1,000,000 × $0.30
+ uncached_input_tokens / 1,000,000 × $3.00
+ output_tokens / 1,000,000 × $15.00
Phản ứng sử dụng và bảng điều khiển thanh toán API nên là nguồn của sự thật. Các ước tính có thể khác nhau khi mã hóa, thử lại, biến công cụ, hoặc lưu trữ hành vi thay đổi.
Ví dụ về chi phí thực tế Kimi K3
Yêu cầu phân tích ngắn
Giả sử các token nhập không được lưu trữ 10,000 và các token đầu ra 2,000.
| Thành phần | Xét tính | Chi phí |
|---|---|---|
| Đầu vào | 10K / 1M × $3 | $0.03 |
| Đầu ra | 2K / 1M × $15 | $0.03 |
| Tổng số | $0.06 |
Ngay cả với số lượng đầu vào gấp 6 lần so với đầu ra, cả hai phần đều có giá tương tự vì các token đầu ra cao hơn gấp 5 lần.
Một đánh giá lưu trữ mã 100K
Giả sử các token nhập không được lưu trữ 100,000 và các token đầu ra 10,000.
| Thành phần | Chi phí |
|---|---|
| Đầu vào | $0.30 |
| Đầu ra | $0.15 |
| Tổng số | $0.45 |
Nếu cùng một tiền tố kho kho ổn định nhận được một cú đánh cache ở lượt tiếp theo, phần đầu vào của nó giảm từ $0.30 đến $0.03.
Một cơ quan nghiên cứu mã 500K
Giả sử các token nhập 500,000 và các token ra mắt 20,000.
| Tiểu bang cache | Chi phí nhập khẩu | Chi phí đầu ra | Tổng số |
|---|---|---|---|
| Cache miss | $1.50 | $0.30 | $1.80 |
| Cache hit | $0.15 | $0.30 | $0.45 |
Đây là lý do tại sao các buổi làm việc kiến thức lặp đi lặp lại được hưởng lợi từ một tiền tố ổn định. Một khi đầu ra trở thành chi phí lớn nhất, yêu cầu mô hình phải ngắn gọn có thể quan trọng như lưu trữ.
Vị trường 1M đầy đủ với đầu ra 50K
| Tiểu bang cache | Chi phí nhập khẩu | Chi phí đầu ra | Tổng số |
|---|---|---|---|
| Cache miss | $3.00 | $0.75 | $3.75 |
| Cache hit | $0.30 | $0.75 | $1.05 |
Chiếc cửa sổ 1M là khả năng tối đa, không phải là mục tiêu cho mọi yêu cầu. Việc lấy lại và phân tích từng giai đoạn có thể rẻ hơn và dễ xác minh hơn.
Chi phí của đại lý mã hóa nhiều lượt
Hãy xem xét một phiên mã hóa năm lượt với một prefix kho lưu trữ ổn định 200K-token, 20K mã thông báo đầu vào mới mỗi lượt, và 8K mã thông báo đầu ra mỗi lượt.
Nếu lượt đầu tiên không được thực hiện và sau đó các tiền tố ổn định bị nhấn:
| Mức sử dụng | Chi phí gần như |
|---|---|
| 200K tiền đề không được lưu trữ ban đầu | $0.60 |
| Bốn 200K đọc tiền đề được lưu trữ trong cache | $0.24 |
| Năm × 20K đầu vào mới không được lưu trữ | $0.30 |
| 5 × 8K đầu ra | $0.60 |
| Tổng số | $1.74 |
Nếu ứng dụng thay đổi đầu ngữ cảnh mỗi lần và ngăn chặn việc tái sử dụng, chỉ có năm đọc không được lưu trữ của tiền đề 200K sẽ tốn kém cho $3.00. Việc xây dựng phiên tạo ra sự khác biệt lớn hơn so với các chỉnh sửa nhanh nhỏ.
Làm thế nào tự động lưu trữ nội dung hoạt động
Moonshot nói rằng lưu trữ tự động cho các yêu cầu K3 thường xuyên.
- giữ cho sự khởi đầu dài của cuộc trò chuyện không thay đổi;
- thêm các câu hỏi mới và kết quả công cụ thay vì viết lại các tin nhắn cũ;
- tránh các dấu thời gian động và yêu cầu ID gần khi bắt đầu;
- giữ cho hướng dẫn hệ thống ổn định;
- lưu giữ thông điệp trợ lý đầy đủ mà K3 yêu cầu;
- nhóm người dùng và tài liệu đúng để dữ liệu không liên quan không bao giờ chia sẻ trạng thái ứng dụng.
Một cú đánh cache là một sự tối ưu hóa, không phải là một đảm bảo. Theo dõi số lượng token được lưu trữ và không lưu trữ thực tế được dịch vụ trả về.
Các token đầu ra có thể thống trị hóa đơn
Giá đầu ra của K3 là $15 cho mỗi triệu token, gấp năm lần tỷ lệ đầu vào không lưu trữ và 50 gấp đôi tỷ lệ đầu vào lưu trữ. Những lý luận dài và các báo cáo của các đại lý có thể xóa bỏ tiết kiệm tiền dự trữ.
Chi phí đầu ra kiểm soát bằng:
- thiết lập một thực tế
max_completion_tokensgiá trị; - yêu cầu các đồ tạo vật cuối cùng ngắn gọn;
- sử dụng đầu ra có cấu trúc bao gồm chỉ các trường yêu cầu;
- tránh lặp đi lặp lại các kế hoạch lớn;
- đo lường liệu nỗ lực lý luận thấp hơn có giải quyết nhiệm vụ một cách đáng tin cậy hay không;
- dừng vòng xoáy công cụ sau khi xác minh hoặc ngưỡng lỗi được xác định.
Đừng cắt giảm lịch sử suy nghĩ cần thiết từ lượt sau đó chỉ để lưu token. Moonshot cảnh báo rằng trạng thái không hoàn chỉnh có thể làm cho K3 không ổn định, có thể tạo ra nhiều thử nghiệm và chi phí tổng cộng cao hơn.
Chi phí Kimi K3 so với chi phí tự lưu trữ
Các trọng lượng mở không làm cho suy luận miễn phí. K3 có các tham số tổng cộng 2.8T, sử dụng sự song song cực của chuyên gia, và được khuyến cáo cho các siêu nút có 64 hoặc nhiều bộ tăng tốc. Self-hosting thêm chi phí phần cứng, mạng, kỹ thuật, sử dụng, giám sát và sẵn có.
Phiên bản API thường là lựa chọn thực tế cho lưu lượng truy cập biến hoặc khiêm tốn. Bản chủ lưu trữ trở thành một cuộc thảo luận chiến lược cho các tổ chức có sử dụng bền vững, chuyên môn cơ sở hạ tầng, yêu cầu kiểm soát dữ liệu và truy cập vào các cụm phù hợp. Hãy chờ giấy phép trọng lượng thực tế và đống suy luận hỗ trợ trước khi xây dựng ngân sách.
Làm thế nào để giảm chi phí Kimi K3 API
- Sử dụng mô hình nhỏ hơn để phân loại, định tuyến và lấy dễ dàng.
- Chỉ gửi cho K3 các nhiệm vụ có lợi từ lý luận đường chân trời dài hoặc bối cảnh đa phương thức.
- Giữ các tiền đề có thể được sử dụng lại ổn định.
- Nhận lại bộ phụ liên quan khi lý luận hoàn toàn trong bối cảnh là không cần thiết.
- Đặt giới hạn đầu ra và giới hạn vòng công cụ.
- So sánh
low,high, vàmaxlý luận trên một bộ đánh giá thực tế. - Chi phí ghi chép cho mỗi thành công được xác minh, bao gồm thử nghiệm lại.
- Theo dõi các lỗi nghiêm trọng và thời gian sửa chữa của con người.
Kimi K3 có đắt không?
K3 là rẻ khi một tiền đề dài được lưu trữ trong cache hỗ trợ một nhiệm vụ có giá trị cao và đầu ra vẫn tập trung. Nó có thể đắt tiền khi mỗi lượt bỏ lỡ bộ nhớ cache, phát ra một hoàn thành dài, và kích hoạt nhiều lần thử lại.
So sánh hữu ích không phải là đô la mỗi triệu token một cách riêng biệt:
effective task cost =
API cost per attempt × attempts per verified success
+ human correction cost
Đối với các kết quả của các công nghệ và các kết quả tham khảo, hãy đọc Đánh giá Kimi K3 và Phân tích điểm chuẩn Kimi K3.
Những câu hỏi thường được hỏi
Kimi K3 là bao nhiêu cho mỗi triệu token?
Tỷ lệ lunshot chính thức là $0.30 cho đầu vào cache-hit, $3 cho đầu vào cache-miss, và $15 cho đầu ra.
Có cửa sổ ngữ cảnh 1M có giá token cao hơn không?
Moonshot liệt kê các tỷ lệ cố định thay vì một cấp độ ngữ cảnh dài riêng biệt. Một lời yêu cầu lớn hơn vẫn tốn kém hơn vì nó chứa nhiều token.
Có một chiếc Kimi K3 API miễn phí không?
Các khoản tín dụng khuyến mãi hoặc các ưu đãi của bên thứ ba có thể thay đổi. Không xây dựng mô hình chi phí sản xuất dựa trên quyền truy cập miễn phí tạm thời; kiểm tra các điều khoản chính thức của máy điều khiển và nhà cung cấp.
Các token lý luận có được tính toán không?
Sử dụng các thông tin trả lời sử dụng chính thức và tài liệu hóa đơn để tính toán cuối cùng của mỗi yêu cầu. K3 lưu thông lý luận riêng biệt với nội dung cuối cùng, và lý luận dài có thể làm tăng việc sử dụng mã thông báo được tạo ra.
Kimi K3 có sẵn trên Poyo.ai không?
Vâng. Trang mô hình Kimi K3 bao gồm sân chơi trực tiếp, ID mô hình kimi-k3, truy cập API, và giá hiện tại Poyo: nhập $2.28 và đầu ra $11.40 cho mỗi token 1M, 24% thấp hơn giá chính thức.

