Tất cả bài viết
hướng dẫn13 phút đọc

Kimi K3 Thiết kế: KDA, AttnRes và 896 Các chuyên gia MoE

Khám phá kiến trúc Kimi K3 của 2.8T, bao gồm Kimi Delta Attention, Attention Residuals, Stable LatentMoE, chuyên gia 896 và suy luận MXFP4.

Kimi K3 Thiết kế: KDA, AttnRes và 896 Các chuyên gia MoE
hướng dẫn

Kiến trúc Kimi K3 được giải thích

Kimi K3 đạt đến 2.8 tỷ tham số thông qua sự kết hợp của Kimi Delta Attention, Attention Residuals, và một hệ thống Stable LatentMoE rất hiếm có với các chuyên gia 896. Chỉ có các chuyên gia 16 được kích hoạt cho một token, cho phép tổng dung lượng mô hình tăng nhanh hơn nhiều so với tính toán hoạt động.

Moonshot nói những thay đổi kiến trúc và đào tạo này tạo ra khoảng 2.5 × hiệu quả quy mô tổng thể của Kimi K2. Điều đó không có nghĩa là K3 là rẻ để chạy. Mô hình vẫn được thiết kế cho suy luận quy mô siêu nút với 64 hoặc nhiều bộ đẩy.

Thông tin kiến trúc được kiểm tra tháng 7 21, 2026. Moonshot đã công bố một bản tổng quan về việc phóng, trong khi báo cáo kỹ thuật đầy đủ và trọng lượng vẫn được lên kế hoạch cho việc phát hành. Bài viết này ghi lại các câu hỏi mở thay vì phát minh ra các chi tiết thực hiện thiếu sót.

Kiến trúc một cái nhìn

Thành phần Thông tin chi tiết Kimi K3 được xuất bản
Tổng tham số 2.8 nghìn tỷ
Chú ý Kimi Delta Attention, với MLA Gate trong kiến trúc
Kết nối độ sâu Chú ý:
M.O.E. Lượng điện tử latente ổn định
Các chuyên gia Các chuyên gia được chuyển hướng 896
Các chuyên gia hoạt động 16 cho mỗi token
Sự cân bằng Tương đương lượng tử
Kỹ thuật tối ưu hóa Muon mỗi đầu
Thành phần kích hoạt Đơn vị Tanh Sigmoid
Tự lượng MXFP4 thông qua đào tạo nhận thức về định lượng
Phương thức kích hoạt MXFP8
Khối cảnh 1 triệu token
Định hướng triển khai Supernode với các bộ đẩy 64+

Kimi Delta Attention là gì?

Kimi Delta Attention, hoặc KDA, là cơ chế chú ý tuyến tính lai của Moonshot. Vai trò của nó là cung cấp một nền tảng hiệu quả hơn để xử lý chuỗi dài hơn là chỉ dựa vào sự chú ý đầy đủ thông thường ở mỗi lớp và token.

Các phương pháp chú ý tuyến tính thường tìm cách tránh sự tăng trưởng vuông liên quan đến so sánh mỗi token với mọi token khác. Từ hybrid quan trọng: kiến trúc K3 chính xác kết hợp các thành phần chú ý thay vì giảm mô hình thành một công thức tuyến tính đơn giản.

KDA là trung tâm cho định vị mã 1M của K3, nhưng chiều dài ngữ cảnh là một thuộc tính của hệ thống. Layout bộ nhớ, lõi, xử lý KV hoặc trạng thái, lưu trữ cache, song song và dịch vụ cơ sở hạ tầng tất cả ảnh hưởng đến việc liệu một bối cảnh dài có thực tế hay không.

KDA và cache tiền tố

Hệ thống phục vụ thông thường thường lưu trữ trạng thái chú ý cho một tiền tố lặp lại. KDA giới thiệu các yêu cầu trạng thái và prefill khác nhau, vì vậy việc thực hiện cache tiền tố thông thường không thể đơn giản được cho là hoạt động hiệu quả.

Moonshot nói rằng nó đã đóng góp hỗ trợ KDA prefill cache cho cộng đồng vLLM để phát hành cùng với K3. Điều này giúp giải thích cách thức API chính thức có thể cung cấp giá đầu vào được ghi nhớ trong cache thấp hơn nhiều so với đầu vào không ghi nhớ mặc dù quy mô của mô hình.

Các nhóm cơ sở hạ tầng nên chờ đợi hỗ trợ K3 rõ ràng trong bản phát hành và lõi vLLM có liên quan thay vì thay đổi tên mô hình trong một triển khai hiện có.

Những gì là những phần còn lại của sự chú ý?

Các mạng lưới sâu truyền thống truyền thông thông tin thông qua các kết nối dư thừa tích lũy lớp bằng lớp. Moonshot mô tả Attention Residuals, hoặc AttnRes, là chọn lọc lấy lại các đại diện trên chiều sâu thay vì tích lũy mọi thứ một cách đồng nhất.

Lợi ích dự kiến là dòng thông tin thông qua mô hình rất sâu hơn. Thay vì buộc mỗi lớp chỉ phụ thuộc vào trạng thái tích lũy ngay lập tức, AttnRes có thể nhấn mạnh các đại diện trước đây hữu ích.

Điều này quan trọng về mặt khái niệm ở thang đo 2.8T, nơi tối ưu hóa và lưu lượng tín hiệu trở nên khó khăn. Các phương trình, trừu tượng và chi tiết đào tạo đầy đủ nên được đánh giá khi báo cáo kỹ thuật được công bố.

Các chuyên gia của LatentMoE và 896 ổn định

K3 là một mô hình hỗn hợp các chuyên gia. Một router chọn một bộ phận nhỏ của các mạng chuyên gia cho mỗi token.

K3 có:

  • Các chuyên gia hướng dẫn 896;
  • Các chuyên gia 16 hoạt động cho một token;
  • Các thành phần chuyên gia được chia sẻ và chuyển hướng trong sơ đồ được công bố;
  • Một khung LatentMoE ổn định được thiết kế cho sự ít thắt cực kỳ.

Tỷ lệ kích hoạt là khoảng:

16 / 896 ≈ 1.8%

Tỷ lệ phần trăm đó không trực tiếp tiết lộ số lượng tham số hoạt động. Các lớp chia sẻ, kích thước chuyên gia, định tuyến, sự chú ý và các thành phần khác góp phần tính toán ngoài tỷ lệ đơn giản. Treat tuyên bố rằng K3 có một số tham số hoạt động chính xác như không xác minh trừ khi Moonshot công bố nó.

Tại sao sự thâm hụt cực đoan của MoE là khó khăn

Nhiều chuyên gia tạo ra nhiều năng lực hơn, nhưng cũng gây ra các vấn đề về đường dẫn và cơ sở hạ tầng khó khăn hơn:

  • token có thể quá tải các chuyên gia phổ biến;
  • năng lượng lãng phí của các chuyên gia bị thiếu sử dụng;
  • Việc đặt chuyên gia ảnh hưởng đến giao tiếp;
  • Sự mất cân bằng tải giảm sử dụng máy đẩy;
  • hình dạng động và đồng bộ hóa máy chủ có thể làm tổn hại đến thông qua;
  • Các quyết định định hướng phải ổn định trong quá trình đào tạo.

K3 giải quyết các vấn đề này bằng cách cân bằng, thực hiện hình dạng tĩnh và các lĩnh vực giao tiếp lớn.

Tương đương lượng tử

Moonshot mô tả Quantile Balancing là lấy phân bổ chuyên gia từ các số lượng điểm của router. Mục tiêu là tránh các quy tắc cập nhật heuristic và một siêu tham số cân bằng nhạy cảm.

Trong ngôn ngữ đơn giản, phân bổ thích nghi với phân phối điểm định tuyến thay vì phụ thuộc vào một ngưỡng được điều chỉnh bằng tay. Điều này có ý nghĩa khi các chuyên gia 896 phải vẫn hữu ích và phục vụ một cách bình đẳng trên quy mô.

Các kết quả sinh sản và phân hủy độc lập vẫn cần thiết để định lượng lượng Quantile Balancing đóng góp tương đối với phần còn lại của hệ thống đào tạo.

Muon mỗi đầu

Muon là một phương pháp tối ưu hóa được sử dụng trong quá trình đào tạo. K3 mở rộng nó trên cơ sở mỗi đầu chú ý, cho phép các đầu được tối ưu hóa độc lập hơn.

Nguyên nhân được tuyên bố của Moonshot là tối ưu hóa thích ứng hơn ở quy mô lớn. Đây là một kỹ thuật đào tạo thay vì tính năng API: người dùng không cấu hình Muon Per Head trong thời gian suy luận.

SiTU và MLA Gated

Bản tổng quan về việc ra mắt cũng xác định:

  • Đơn vị Tanh Sigmoid (SiTU): được thiết kế để cải thiện kiểm soát kích hoạt;
  • MLA bị cổng: nhằm cải thiện sự chọn lọc sự chú ý.

Các thành phần này nằm trong một thiết kế khối lớn hơn kết hợp KDA, các chuyên gia tiềm ẩn, các chuyên gia chia sẻ, các yếu tố convolutional và các cửa. Sự đóng góp chính xác của họ đòi hỏi báo cáo kỹ thuật và các sự bỏ qua kiểm soát.

Đánh nặng MXFP4 và kích hoạt MXFP8

K3 sử dụng đào tạo nhận thức về lượng từ giai đoạn điều chỉnh tinh tế được giám sát, với trọng lượng MXFP4 và kích hoạt MXFP8.

Việc đào tạo nhận thức về lượng tử làm cho mô hình bị tiếp xúc với hành vi chính xác thấp hơn trong quá trình đào tạo thay vì chuyển đổi mô hình chính xác cao hoàn thành thành một suy nghĩ sau. Điều này có thể bảo tồn chất lượng cao hơn trong một định dạng suy luận hiệu quả.

MXFP4 làm giảm đáng kể lưu trữ trọng lượng lý thuyết. Ở bốn bit mỗi tham số, các tham số thô 2.8T tương ứng với khoảng 1.4 TB trước khi quy mô, siêu dữ liệu, các thành phần không định lượng, bộ đệm thời gian chạy và dư thừa. Nó vẫn còn vượt xa hơn cả phần cứng tiêu dùng.

Việc đào tạo chuyên gia song song đầy cân bằng

Moonshot nói K3 sử dụng đào tạo chuyên gia song song cân với hình dạng tĩnh và không đồng bộ máy chủ trên con đường quan trọng. Những lựa chọn này nhắm vào công việc tăng tốc dự đoán và giảm các tạm dừng do sự phối hợp của CPU.

Vào thời điểm suy luận, thách thức rộng lớn vẫn còn như vậy: các chuyên gia được phân phối trên nhiều thiết bị phải giao tiếp nhanh chóng. Moonshot khuyên nên một siêu node với ít nhất 64 gia tốc để giao tiếp nhiều hơn xảy ra bên trong một miền băng thông cao.

Làm thế nào K3 đạt đến một ngữ cảnh mã 1M

Không có thành phần nào giải thích cửa sổ 1M. Khả năng phụ thuộc vào:

  • xử lý chuỗi KDA hiệu quả;
  • lưu lượng thông tin ổn định thông qua AttnRes;
  • phục vụ các hạt nhân và quản lý bộ nhớ;
  • hỗ trợ cache prefill;
  • cơ sở hạ tầng gia tốc phân tán;
  • dữ liệu và mục tiêu đào tạo dạy mô hình sử dụng ngữ cảnh dài.

Một mô hình chấp nhận một triệu token không có nghĩa là mỗi token nhận được sự chú ý bằng nhau hoặc một triệu token luôn là thiết kế tốt nhất. Đánh giá trong bối cảnh dài nên kiểm tra việc lấy lại, phụ thuộc từ xa, làm phân tâm, thời gian trễ và chi phí.

Kimi K3 so với Kimi K2

Khu vực Định hướng Kimi K3 Hãng cơ sở Kimi K2
Scale 2.8T tổng tham số lần tạo trước nhỏ hơn
Chú ý KDA Hybrid Linear Attention Kiến trúc trước đây
Độ sâu Chú ý: Thiết kế dư thừa trước đó
M.O.E. Các chuyên gia 896, hoạt động 16 Sự ít cực đoan hơn
Hiệu quả Tự dụng quy mô được tuyên bố ~2.5× Tỷ lệ cơ bản
Hình ảnh Nghĩ thị giác bản địa Dải bề mặt khả năng trước khác nhau
Khối cảnh Các mã thông báo 1M Giới hạn trước thấp hơn tùy thuộc vào mô hình

Số 2.5× là tuyên bố hiệu quả quy mô tổng thể của Moonshot, không phải là lời hứa về tốc độ 2.5× API hoặc hiệu suất chuẩn 2.5×.

Những hạn chế về kiến trúc và những câu hỏi mở

Những câu hỏi quan trọng chưa được trả lời bao gồm:

  • Số lượng tham số hoạt động chính xác;
  • lớp đầy đủ và kích thước chuyên môn;
  • Số lượng và hỗn hợp dữ liệu của mã thông báo đào tạo;
  • phương pháp đào tạo dài hoàn chỉnh;
  • các bộ sưu tập kiến trúc độc lập;
  • Phần cứng hỗ trợ và thông suất đo theo cấu hình;
  • dấu chân tệp trọng lượng chính xác;
  • thời gian chạy cuối cùng và hỗ trợ giấy phép.

Những câu hỏi này nên được trả lời từ báo cáo kỹ thuật của Moonshot và kho lưu trữ chính thức sau khi phát hành.

Tại sao kiến trúc quan trọng với các nhà phát triển

Hầu hết người dùng API không cần phải thực hiện định tuyến KDA hoặc MoE. Họ cần phải hiểu những hậu quả hoạt động:

  • K3 mạnh trong công việc có bối cảnh nặng và tác nhân;
  • Bảo tồn trạng thái trò chuyện là điều cần thiết;
  • Việc lưu trữ tự động có thể làm giảm đáng kể chi phí;
  • tự lưu trữ đòi hỏi cơ sở hạ tầng cực đoan;
  • Hành vi mô hình không thể được suy luận chỉ từ tổng số lượng tham số;
  • thời gian chạy mới và các lõi phải rõ ràng hỗ trợ K3.

Đọc Kimi K3 có nguồn mở không? cho tình trạng triển khai và Kimi K3 API hướng dẫn cho việc tích hợp ứng dụng.

Những câu hỏi thường được hỏi

Kimi K3 có bao nhiêu tham số?

K3 có tổng số tham số 2.8 nghìn tỷ trong kiến trúc Mixture-of-Experts hiếm.

Có bao nhiêu chuyên gia đang hoạt động?

Moonshot nói rằng 16 của các chuyên gia 896 đã được kích hoạt. Các thành phần chia sẻ và không chuyên gia cũng đóng góp vào tính toán.

Kimi Delta Attention là gì?

KDA là cơ chế chú ý tuyến tính lai của Moonshot cho xử lý chuỗi hiệu quả và quy mô ngữ cảnh dài.

Tại sao Kimi K3 hỗ trợ ngữ cảnh 1M?

Chiếc cửa sổ được kích hoạt bởi kiến trúc, đào tạo, lưu trữ trước khi lưu trữ, lõi, quản lý bộ nhớ và phân phối dịch vụ thay vì một tính năng duy nhất.

Kimi K3 có thể chạy trên các GPU tiêu dùng không?

Mô hình hoàn chỉnh không thể thực tế chạy trên GPU tiêu dùng. Moonshot khuyên nên triển khai siêu nút với 64 hoặc nhiều bộ đẩy.

Nguồn tin

Blog · PoYo.aiTất cả bài viết
KẾT NỐI

Bạn đang có dự án?

Hãy chia sẻ nhu cầu của bạn. Chúng tôi sẽ tư vấn API AI phù hợp.

Chúng tôi chỉ dùng thông tin để phản hồi yêu cầu này.

PoYo AI

Sẵn sàng khám phá mô hình?

Xem các mô hình hình ảnh, video, âm thanh và ngôn ngữ trên PoYo.

Xem mô hình AI