MarkTechPost

Ai đó đã tinh chỉnh mô hình MiniCPM5-1B của OpenBMB trên các dấu vết Claude Fable 5 để phát hành một mô hình suy luận cục bộ có dung lượng 657MB.

🕐 20/07/2026 09:32 📰 MarkTechPost ✅ Đã dịch sang tiếng Việt

Một nhà phát triển cộng đồng, GnLOLot, đã công bố mô hình 1B chạy hoàn toàn trên phần cứng cục bộ. Mô hình này có tên MiniCPM5-1B-Claude-Opus-Fable5-Thinking, với các bản dựng GGUF cho các runtime tương thích với llama.cpp. Nó không cần khóa API và không thực hiện cuộc gọi đám mây.

Mô hình được xây dựng trên openbmb/MiniCPM5-1B. Nền tảng đó là một bản phát hành thực tế, có tài liệu từ OpenBMB. Đây là mô hình tham số 1,08B dày đặc sử dụng kiến trúc LlamaForCausalLM tiêu chuẩn. Nó có 24 lớp, cơ chế chú ý nhóm truy vấn và độ dài ngữ cảnh 131.072 token. OpenBMB báo cáo đây là mô hình nguồn mở hàng đầu lớp 1B trong tập so sánh của riêng họ.

Nền tảng đã có sẵn một mẫu suy luận gốc. Lý luận được bật/tắt thông qua enable_thinking, cung cấp cả chế độ Think và No Think. Mô hình phái sinh giữ nguyên mẫu đó và định dạng gọi công cụ của MiniCPM5.

Trên nền tảng đó, nhà phát triển đã áp dụng tinh chỉnh. Thẻ mô tả cho biết mô hình 'được tinh chỉnh thêm trên dữ liệu Fable 5' để cải thiện khả năng viết mã và tuân theo hướng dẫn. Thẻ GGUF lặp lại điều này là 'được huấn luyện sau trên dữ liệu Fable 5.'

Phương pháp được mô tả không phải là chưng cất cổ điển. Bạn không thu nhỏ mô hình gốc. Thay vào đó, bạn tạo ra nhiều cuộc hội thoại với mô hình giáo viên. Bạn ghi lại các phản hồi và dấu vết lý luận của nó dưới dạng văn bản. Sau đó, bạn tinh chỉnh có giám sát một mô hình nền tảng nhỏ hơn trên các dấu vết đó.

Sự khác biệt này quan trọng cho độ chính xác. Chưng cất cổ điển truyền tín hiệu từ logits hoặc trọng số của giáo viên. Không ai có quyền truy cập vào trọng số hoặc logits của Claude. Vì vậy, đây là tinh chỉnh có giám sát trên các đầu ra được tạo ra, không phải chưng cất ở cấp độ trọng số. Ngược lại, mô hình nền tảng của OpenBMB sử dụng giai đoạn Chưng cất Trong Chính sách được tài liệu hóa giữa các điểm kiểm tra giáo viên và học sinh của riêng họ.

Hiệu quả thực tế là mô hình 1B học cách bắt chước định dạng và phong cách phản hồi. Nó không hấp thụ khả năng cơ bản của giáo viên. Ngân sách tham số 1B không thể chứa lý luận quy mô tiên tiến.

Cửa sổ ngữ cảnh là 128K token, kế thừa từ config.json cơ sở (131.072). Kho lưu trữ GGUF cung cấp bốn mức lượng tử hóa. Q4_K_M khoảng 657MB và được gắn nhãn là dấu chân nhỏ nhất. Q5_K_M khoảng 751MB. Q8_0 khoảng 1,1GB và là mặc định được khuyến nghị của người bảo trì. F16 khoảng 2,1GB.

'Dấu chân 657MB' là lượng tử hóa nhỏ nhất, không phải bản dựng mặc định. Mô hình tải trực tiếp trong llama.cpp, Ollama, LM Studio, jan và KoboldCpp.

Phần giải thích dưới đây đi qua quy trình xây dựng, sự đánh đổi dấu chân và sự phân chia trung thực về những gì tinh chỉnh có thể và không thể mang lại.

Thẻ GGUF đưa ra một đường dẫn một dòng qua Ollama:

Cùng một kho lưu trữ tài liệu cho llama.cpp, LM Studio, jan và KoboldCpp. Lấy mẫu được khuyến nghị cho chế độ Think là temperature=0,9, top_p=0,95. Mô hình có thể phát ra các khối lý luận trước câu trả lời cuối cùng, mà các ứng dụng hạ nguồn có thể loại bỏ.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những hiểu biết có thể hành động.

📎 Nguồn gốc: MarkTechPost Xem bài gốc →