Kimi K3 Thiết kế: KDA, AttnRes và 896 Các chuyên gia MoE
Khám phá kiến trúc Kimi K3 của 2.8T, bao gồm Kimi Delta Attention, Attention Residuals, Stable LatentMoE, chuyên gia 896 và suy luận MXFP4.


Kimi K3 đạt đến 2.8 tỷ tham số thông qua sự kết hợp của Kimi Delta Attention, Attention Residuals, và một hệ thống Stable LatentMoE rất hiếm có với các chuyên gia 896. Chỉ có các chuyên gia 16 được kích hoạt cho một token, cho phép tổng dung lượng mô hình tăng nhanh hơn nhiều so với tính toán hoạt động.
Moonshot nói những thay đổi kiến trúc và đào tạo này tạo ra khoảng 2.5 × hiệu quả quy mô tổng thể của Kimi K2. Điều đó không có nghĩa là K3 là rẻ để chạy. Mô hình vẫn được thiết kế cho suy luận quy mô siêu nút với 64 hoặc nhiều bộ đẩy.
Thông tin kiến trúc được kiểm tra tháng 7 21, 2026. Moonshot đã công bố một bản tổng quan về việc phóng, trong khi báo cáo kỹ thuật đầy đủ và trọng lượng vẫn được lên kế hoạch cho việc phát hành. Bài viết này ghi lại các câu hỏi mở thay vì phát minh ra các chi tiết thực hiện thiếu sót.
Kiến trúc một cái nhìn
| Thành phần | Thông tin chi tiết Kimi K3 được xuất bản |
|---|---|
| Tổng tham số | 2.8 nghìn tỷ |
| Chú ý | Kimi Delta Attention, với MLA Gate trong kiến trúc |
| Kết nối độ sâu | Chú ý: |
| M.O.E. | Lượng điện tử latente ổn định |
| Các chuyên gia | Các chuyên gia được chuyển hướng 896 |
| Các chuyên gia hoạt động | 16 cho mỗi token |
| Sự cân bằng | Tương đương lượng tử |
| Kỹ thuật tối ưu hóa | Muon mỗi đầu |
| Thành phần kích hoạt | Đơn vị Tanh Sigmoid |
| Tự lượng | MXFP4 thông qua đào tạo nhận thức về định lượng |
| Phương thức kích hoạt | MXFP8 |
| Khối cảnh | 1 triệu token |
| Định hướng triển khai | Supernode với các bộ đẩy 64+ |
Kimi Delta Attention là gì?
Kimi Delta Attention, hoặc KDA, là cơ chế chú ý tuyến tính lai của Moonshot. Vai trò của nó là cung cấp một nền tảng hiệu quả hơn để xử lý chuỗi dài hơn là chỉ dựa vào sự chú ý đầy đủ thông thường ở mỗi lớp và token.
Các phương pháp chú ý tuyến tính thường tìm cách tránh sự tăng trưởng vuông liên quan đến so sánh mỗi token với mọi token khác. Từ hybrid quan trọng: kiến trúc K3 chính xác kết hợp các thành phần chú ý thay vì giảm mô hình thành một công thức tuyến tính đơn giản.
KDA là trung tâm cho định vị mã 1M của K3, nhưng chiều dài ngữ cảnh là một thuộc tính của hệ thống. Layout bộ nhớ, lõi, xử lý KV hoặc trạng thái, lưu trữ cache, song song và dịch vụ cơ sở hạ tầng tất cả ảnh hưởng đến việc liệu một bối cảnh dài có thực tế hay không.
KDA và cache tiền tố
Hệ thống phục vụ thông thường thường lưu trữ trạng thái chú ý cho một tiền tố lặp lại. KDA giới thiệu các yêu cầu trạng thái và prefill khác nhau, vì vậy việc thực hiện cache tiền tố thông thường không thể đơn giản được cho là hoạt động hiệu quả.
Moonshot nói rằng nó đã đóng góp hỗ trợ KDA prefill cache cho cộng đồng vLLM để phát hành cùng với K3. Điều này giúp giải thích cách thức API chính thức có thể cung cấp giá đầu vào được ghi nhớ trong cache thấp hơn nhiều so với đầu vào không ghi nhớ mặc dù quy mô của mô hình.
Các nhóm cơ sở hạ tầng nên chờ đợi hỗ trợ K3 rõ ràng trong bản phát hành và lõi vLLM có liên quan thay vì thay đổi tên mô hình trong một triển khai hiện có.
Những gì là những phần còn lại của sự chú ý?
Các mạng lưới sâu truyền thống truyền thông thông tin thông qua các kết nối dư thừa tích lũy lớp bằng lớp. Moonshot mô tả Attention Residuals, hoặc AttnRes, là chọn lọc lấy lại các đại diện trên chiều sâu thay vì tích lũy mọi thứ một cách đồng nhất.
Lợi ích dự kiến là dòng thông tin thông qua mô hình rất sâu hơn. Thay vì buộc mỗi lớp chỉ phụ thuộc vào trạng thái tích lũy ngay lập tức, AttnRes có thể nhấn mạnh các đại diện trước đây hữu ích.
Điều này quan trọng về mặt khái niệm ở thang đo 2.8T, nơi tối ưu hóa và lưu lượng tín hiệu trở nên khó khăn. Các phương trình, trừu tượng và chi tiết đào tạo đầy đủ nên được đánh giá khi báo cáo kỹ thuật được công bố.
Các chuyên gia của LatentMoE và 896 ổn định
K3 là một mô hình hỗn hợp các chuyên gia. Một router chọn một bộ phận nhỏ của các mạng chuyên gia cho mỗi token.
K3 có:
- Các chuyên gia hướng dẫn 896;
- Các chuyên gia 16 hoạt động cho một token;
- Các thành phần chuyên gia được chia sẻ và chuyển hướng trong sơ đồ được công bố;
- Một khung LatentMoE ổn định được thiết kế cho sự ít thắt cực kỳ.
Tỷ lệ kích hoạt là khoảng:
16 / 896 ≈ 1.8%
Tỷ lệ phần trăm đó không trực tiếp tiết lộ số lượng tham số hoạt động. Các lớp chia sẻ, kích thước chuyên gia, định tuyến, sự chú ý và các thành phần khác góp phần tính toán ngoài tỷ lệ đơn giản. Treat tuyên bố rằng K3 có một số tham số hoạt động chính xác như không xác minh trừ khi Moonshot công bố nó.
Tại sao sự thâm hụt cực đoan của MoE là khó khăn
Nhiều chuyên gia tạo ra nhiều năng lực hơn, nhưng cũng gây ra các vấn đề về đường dẫn và cơ sở hạ tầng khó khăn hơn:
- token có thể quá tải các chuyên gia phổ biến;
- năng lượng lãng phí của các chuyên gia bị thiếu sử dụng;
- Việc đặt chuyên gia ảnh hưởng đến giao tiếp;
- Sự mất cân bằng tải giảm sử dụng máy đẩy;
- hình dạng động và đồng bộ hóa máy chủ có thể làm tổn hại đến thông qua;
- Các quyết định định hướng phải ổn định trong quá trình đào tạo.
K3 giải quyết các vấn đề này bằng cách cân bằng, thực hiện hình dạng tĩnh và các lĩnh vực giao tiếp lớn.
Tương đương lượng tử
Moonshot mô tả Quantile Balancing là lấy phân bổ chuyên gia từ các số lượng điểm của router. Mục tiêu là tránh các quy tắc cập nhật heuristic và một siêu tham số cân bằng nhạy cảm.
Trong ngôn ngữ đơn giản, phân bổ thích nghi với phân phối điểm định tuyến thay vì phụ thuộc vào một ngưỡng được điều chỉnh bằng tay. Điều này có ý nghĩa khi các chuyên gia 896 phải vẫn hữu ích và phục vụ một cách bình đẳng trên quy mô.
Các kết quả sinh sản và phân hủy độc lập vẫn cần thiết để định lượng lượng Quantile Balancing đóng góp tương đối với phần còn lại của hệ thống đào tạo.
Muon mỗi đầu
Muon là một phương pháp tối ưu hóa được sử dụng trong quá trình đào tạo. K3 mở rộng nó trên cơ sở mỗi đầu chú ý, cho phép các đầu được tối ưu hóa độc lập hơn.
Nguyên nhân được tuyên bố của Moonshot là tối ưu hóa thích ứng hơn ở quy mô lớn. Đây là một kỹ thuật đào tạo thay vì tính năng API: người dùng không cấu hình Muon Per Head trong thời gian suy luận.
SiTU và MLA Gated
Bản tổng quan về việc ra mắt cũng xác định:
- Đơn vị Tanh Sigmoid (SiTU): được thiết kế để cải thiện kiểm soát kích hoạt;
- MLA bị cổng: nhằm cải thiện sự chọn lọc sự chú ý.
Các thành phần này nằm trong một thiết kế khối lớn hơn kết hợp KDA, các chuyên gia tiềm ẩn, các chuyên gia chia sẻ, các yếu tố convolutional và các cửa. Sự đóng góp chính xác của họ đòi hỏi báo cáo kỹ thuật và các sự bỏ qua kiểm soát.
Đánh nặng MXFP4 và kích hoạt MXFP8
K3 sử dụng đào tạo nhận thức về lượng từ giai đoạn điều chỉnh tinh tế được giám sát, với trọng lượng MXFP4 và kích hoạt MXFP8.
Việc đào tạo nhận thức về lượng tử làm cho mô hình bị tiếp xúc với hành vi chính xác thấp hơn trong quá trình đào tạo thay vì chuyển đổi mô hình chính xác cao hoàn thành thành một suy nghĩ sau. Điều này có thể bảo tồn chất lượng cao hơn trong một định dạng suy luận hiệu quả.
MXFP4 làm giảm đáng kể lưu trữ trọng lượng lý thuyết. Ở bốn bit mỗi tham số, các tham số thô 2.8T tương ứng với khoảng 1.4 TB trước khi quy mô, siêu dữ liệu, các thành phần không định lượng, bộ đệm thời gian chạy và dư thừa. Nó vẫn còn vượt xa hơn cả phần cứng tiêu dùng.
Việc đào tạo chuyên gia song song đầy cân bằng
Moonshot nói K3 sử dụng đào tạo chuyên gia song song cân với hình dạng tĩnh và không đồng bộ máy chủ trên con đường quan trọng. Những lựa chọn này nhắm vào công việc tăng tốc dự đoán và giảm các tạm dừng do sự phối hợp của CPU.
Vào thời điểm suy luận, thách thức rộng lớn vẫn còn như vậy: các chuyên gia được phân phối trên nhiều thiết bị phải giao tiếp nhanh chóng. Moonshot khuyên nên một siêu node với ít nhất 64 gia tốc để giao tiếp nhiều hơn xảy ra bên trong một miền băng thông cao.
Làm thế nào K3 đạt đến một ngữ cảnh mã 1M
Không có thành phần nào giải thích cửa sổ 1M. Khả năng phụ thuộc vào:
- xử lý chuỗi KDA hiệu quả;
- lưu lượng thông tin ổn định thông qua AttnRes;
- phục vụ các hạt nhân và quản lý bộ nhớ;
- hỗ trợ cache prefill;
- cơ sở hạ tầng gia tốc phân tán;
- dữ liệu và mục tiêu đào tạo dạy mô hình sử dụng ngữ cảnh dài.
Một mô hình chấp nhận một triệu token không có nghĩa là mỗi token nhận được sự chú ý bằng nhau hoặc một triệu token luôn là thiết kế tốt nhất. Đánh giá trong bối cảnh dài nên kiểm tra việc lấy lại, phụ thuộc từ xa, làm phân tâm, thời gian trễ và chi phí.
Kimi K3 so với Kimi K2
| Khu vực | Định hướng Kimi K3 | Hãng cơ sở Kimi K2 |
|---|---|---|
| Scale | 2.8T tổng tham số | lần tạo trước nhỏ hơn |
| Chú ý | KDA Hybrid Linear Attention | Kiến trúc trước đây |
| Độ sâu | Chú ý: | Thiết kế dư thừa trước đó |
| M.O.E. | Các chuyên gia 896, hoạt động 16 | Sự ít cực đoan hơn |
| Hiệu quả | Tự dụng quy mô được tuyên bố ~2.5× | Tỷ lệ cơ bản |
| Hình ảnh | Nghĩ thị giác bản địa | Dải bề mặt khả năng trước khác nhau |
| Khối cảnh | Các mã thông báo 1M | Giới hạn trước thấp hơn tùy thuộc vào mô hình |
Số 2.5× là tuyên bố hiệu quả quy mô tổng thể của Moonshot, không phải là lời hứa về tốc độ 2.5× API hoặc hiệu suất chuẩn 2.5×.
Những hạn chế về kiến trúc và những câu hỏi mở
Những câu hỏi quan trọng chưa được trả lời bao gồm:
- Số lượng tham số hoạt động chính xác;
- lớp đầy đủ và kích thước chuyên môn;
- Số lượng và hỗn hợp dữ liệu của mã thông báo đào tạo;
- phương pháp đào tạo dài hoàn chỉnh;
- các bộ sưu tập kiến trúc độc lập;
- Phần cứng hỗ trợ và thông suất đo theo cấu hình;
- dấu chân tệp trọng lượng chính xác;
- thời gian chạy cuối cùng và hỗ trợ giấy phép.
Những câu hỏi này nên được trả lời từ báo cáo kỹ thuật của Moonshot và kho lưu trữ chính thức sau khi phát hành.
Tại sao kiến trúc quan trọng với các nhà phát triển
Hầu hết người dùng API không cần phải thực hiện định tuyến KDA hoặc MoE. Họ cần phải hiểu những hậu quả hoạt động:
- K3 mạnh trong công việc có bối cảnh nặng và tác nhân;
- Bảo tồn trạng thái trò chuyện là điều cần thiết;
- Việc lưu trữ tự động có thể làm giảm đáng kể chi phí;
- tự lưu trữ đòi hỏi cơ sở hạ tầng cực đoan;
- Hành vi mô hình không thể được suy luận chỉ từ tổng số lượng tham số;
- thời gian chạy mới và các lõi phải rõ ràng hỗ trợ K3.
Đọc Kimi K3 có nguồn mở không? cho tình trạng triển khai và Kimi K3 API hướng dẫn cho việc tích hợp ứng dụng.
Những câu hỏi thường được hỏi
Kimi K3 có bao nhiêu tham số?
K3 có tổng số tham số 2.8 nghìn tỷ trong kiến trúc Mixture-of-Experts hiếm.
Có bao nhiêu chuyên gia đang hoạt động?
Moonshot nói rằng 16 của các chuyên gia 896 đã được kích hoạt. Các thành phần chia sẻ và không chuyên gia cũng đóng góp vào tính toán.
Kimi Delta Attention là gì?
KDA là cơ chế chú ý tuyến tính lai của Moonshot cho xử lý chuỗi hiệu quả và quy mô ngữ cảnh dài.
Tại sao Kimi K3 hỗ trợ ngữ cảnh 1M?
Chiếc cửa sổ được kích hoạt bởi kiến trúc, đào tạo, lưu trữ trước khi lưu trữ, lõi, quản lý bộ nhớ và phân phối dịch vụ thay vì một tính năng duy nhất.
Kimi K3 có thể chạy trên các GPU tiêu dùng không?
Mô hình hoàn chỉnh không thể thực tế chạy trên GPU tiêu dùng. Moonshot khuyên nên triển khai siêu nút với 64 hoặc nhiều bộ đẩy.

