Hugging Face Blog

Tổng quan về mô hình Kimi K3: 2,8 nghìn tỷ tham số, lượng tử hóa MXFP4 và ý nghĩa của trọng số mở đối với cộng đồng

🕐 20/07/2026 07:32 📰 Hugging Face Blog ✅ Đã dịch sang tiếng Việt

Vào ngày 16 tháng 7 năm 2026, Moonshot AI đã công khai phát hành Kimi K3, cam kết mở hoàn toàn mã nguồn trọng số vào ngày 27 tháng 7. Với 2,8 nghìn tỷ tham số, đây là mô hình mã nguồn mở đầu tiên đạt đến cấp độ 3 nghìn tỷ tham số. Bài viết này cung cấp tổng quan có cấu trúc về mô hình dành cho cộng đồng nghiên cứu và MLOps.

Kimi K3 giới thiệu một số cải tiến kiến trúc, mang lại hiệu suất mở rộng gấp khoảng 2,5 lần so với phiên bản tiền nhiệm K2.

Cơ chế chú ý tuyến tính lai thay thế chú ý bậc hai tiêu chuẩn trong một tập hợp các lớp. KDA duy trì khả năng biểu đạt đầy đủ cho các lớp quan trọng, đồng thời giảm chi phí tính toán của chú ý trên toàn bộ cửa sổ ngữ cảnh 1 triệu token của mô hình. Để tìm hiểu chi tiết về thiết kế của KDA và mối quan hệ của nó với các nghiên cứu chú ý tuyến tính trước đó, hãy xem bài viết chuyên sâu về kiến trúc trên Hashnode.

Một giải pháp thay thế trực tiếp cho các kết nối dư tiêu chuẩn. Thay vì tích lũy đồng đều đầu ra của các lớp, AttnRes cho phép mỗi lớp chọn lọc truy xuất biểu diễn từ các lớp trước đó bất kỳ. Điều này đặc biệt có tác động trong các kiến trúc MoE, nơi các chuyên gia khác nhau được kích hoạt ở các độ sâu khác nhau.

Khung MoE quản lý 896 chuyên gia với 16 chuyên gia hoạt động trên mỗi token. Các thành phần chính bao gồm định tuyến không gian tiềm ẩn, Cân bằng Phân vị để quản lý tải và loại bỏ mềm đối với các token tràn. Để phân tích kỹ thuật đầy đủ, hãy xem bài viết chuyên sâu về MoE trên Zenn.dev.

K3 sử dụng huấn luyện nhận thức lượng tử hóa (QAT) bắt đầu từ giai đoạn tinh chỉnh có giám sát, chứ không phải lượng tử hóa sau huấn luyện. Đây là một điểm khác biệt quan trọng — mô hình học cách bù đắp lỗi lượng tử hóa trong quá trình huấn luyện, dẫn đến suy giảm chất lượng ít hơn đáng kể.

Các lựa chọn định dạng có chủ đích:

Định dạng trọng số MXFP4 có nghĩa là mô hình 2,8T đầy đủ yêu cầu khoảng 1,4 TB dung lượng lưu trữ trọng số — ít hơn đáng kể so với khoảng 5,6 TB mà trọng số FP16 yêu cầu. Điều này đưa việc tự lưu trữ trong tầm tay của các tổ chức có cụm GPU đa nút (ví dụ: 8-16 nút với 8x H100/B200).

Việc phục vụ của Moonshot sử dụng cơ sở hạ tầng suy luận phân tách Mooncake, phân tách prefill và decode trên các nhóm nút khác nhau và đạt được tỷ lệ hit cache 90% trên các khối lượng công việc lập trình. Kiến trúc này cho phép định giá đầu vào được cache mạnh mẽ ở mức $0,30/MTok.

K3 dẫn đầu tất cả các mô hình trên SWE Marathon và Program Bench, cho thấy sức mạnh đặc biệt trong các phiên lập trình kéo dài — phù hợp với cửa sổ ngữ cảnh 1 triệu token cho phép hiểu toàn bộ kho lưu trữ.

Phân tích chuyên môn hóa chuyên gia: Với 896 chuyên gia, các nhà nghiên cứu có thể khám phá liệu các chuyên gia có chuyên môn hóa theo ngôn ngữ, lĩnh vực, loại nhiệm vụ hay một khía cạnh nào khác không. Dữ liệu này có thể cung cấp thông tin cho các thiết kế MoE trong tương lai.

Cắt tỉa và chưng cất: Liệu nhóm 896 chuyên gia có thể được giảm xuống còn 256 hoặc 128 chuyên gia để triển khai trên các cụm nhỏ hơn không? Đường cong đánh đổi giữa chất lượng và tính toán là gì?

Loại bỏ các kết nối dư chú ý: AttnRes được mô tả là một "giải pháp thay thế trực tiếp" cho các kết nối dư. Thử nghiệm điều này trên các mô hình nhỏ hơn có thể xác nhận liệu kỹ thuật này có tổng quát hóa vượt quá quy mô của K3 hay không.

Động lực tinh chỉnh: LoRA hoặc QLoRA tương tác như thế nào với một mô hình MoE đã được lượng tử hóa? Cơ sở MXFP4 đặt ra những thách thức mới cho việc tinh chỉnh dựa trên adapter.

Moonshot thừa nhận ba lĩnh vực mà K3 còn thiếu sót:

Kimi K3 đại diện cho một cột mốc quan trọng: hiệu suất ở cấp độ tiên tiến trong một gói mã nguồn mở. Sự kết hợp giữa Stable LatentMoE, KDA và huấn luyện nhận thức lượng tử hóa làm cho số lượng tham số 2,8T trở nên kinh tế.

📎 Nguồn gốc: Hugging Face Blog Xem bài gốc →