Hugging Face Blog

Triển khai GLM-5.2-FP8 làm tác nhân tiên phong mở của bạn

🕐 20/07/2026 07:32 📰 Hugging Face Blog ✅ Đã dịch sang tiếng Việt

Khi nói đến các tác vụ mã hóa theo hướng tác nhân (agentic coding tasks) cụ thể, khoảng cách về chất lượng đang thu hẹp dần từng ngày. Ví dụ, tháng trước, Z.AI đã phát hành GLM-5.2, mô hình hàng đầu mới của họ cạnh tranh trực tiếp với các mô hình đóng mạnh nhất từ Anthropic hoặc OpenAI.

Mục tiêu của tôi trong bài viết này là triển khai GLM-5.2-FP8 và sử dụng nó như một tác nhân mã hóa, chứng minh rằng các mô hình mở có thể mang lại hiệu suất xuất sắc cho các tác vụ phức tạp.

Các mô hình AI hiệu suất cao thường đòi hỏi yêu cầu phần cứng nặng nề (ngay cả khi tác giả tuyên bố chúng có thể chạy trên cái gọi là "phần cứng tiêu dùng"), và thực tế là đối với suy luận "cục bộ", đây vẫn là một rào cản gia nhập lớn. Chúng ta đã thấy điều này trong vài năm qua khi giá RAM và bộ tăng tốc không ngừng tăng.

Sử dụng các lựa chọn thay thế nhỏ hơn, chẳng hạn như các mô hình lượng tử hóa GGUF, có thể giúp ích, nhưng đối với các mô hình mở hàng đầu, bạn vẫn cần một số GPU. Ví dụ, unsloth/Kimi-K2.7-Code-GGUF vẫn yêu cầu 304 GB cho lượng tử hóa GGUF 1-bit nhỏ nhất của nó.

Đối với người dùng trung bình (bao gồm cả tôi), việc sở hữu phần cứng cần thiết để chạy các mô hình mở tiên tiến lớn này là không khả thi. Điều này khiến các nhà cung cấp điện toán đám mây hoặc không máy chủ trở thành lựa chọn thực tế duy nhất để làm việc với chúng. Tuy nhiên, đối với các nhóm nhỏ hoặc phòng thí nghiệm sẵn sàng đầu tư vào phần cứng và chuẩn bị đối phó với mức độ khó khăn về cơ sở hạ tầng khác nhau, tôi tin rằng "mô hình cục bộ" đã có ý nghĩa và đáng để nỗ lực. Bạn sẽ có toàn quyền kiểm soát dữ liệu, mô hình và token của mình, với khả năng đủ để phục vụ nhiều người dùng.

Như đã đề cập ở trên, tôi tin rằng các mô hình hàng đầu đôi khi là quá mức cần thiết đối với hầu hết người dùng và tác vụ. Với một khoản chi phí "nhỏ hơn", bạn có thể mua một GPU có khả năng, một NVIDIA DGX Spark hoặc một máy Mac với bộ nhớ thống nhất đủ lớn. Điều đó đủ để chạy các mô hình xuất sắc như google/gemma-4-31B-it hoặc unsloth/Qwen3.6-35B-A3B-GGUF, có thể phục vụ bạn khá tốt trong các tác vụ hàng ngày.

Để chạy GLM-5.2-FP8 với độ dài ngữ cảnh tối đa 131k token, dung lượng VRAM cần thiết là khoảng 940 GB (ước tính qua hf mem).

Cho bản demo này, các đối tác của chúng tôi tại Dell đã cung cấp cho tôi quyền truy cập vào một trong các máy trạm AI của họ: Dell PowerEdge XE9680 8xH200. Mỗi GPU NVIDIA H200 có khoảng 144 GB VRAM, cho chúng tôi nhiều không gian để triển khai mô hình với cấu hình ngữ cảnh đã mô tả.

Dell Enterprise Hub cung cấp một danh mục rộng lớn các mô hình và ứng dụng AI. Đây là các hình ảnh Docker an toàn, sẵn sàng triển khai do Hugging Face xây dựng và tối ưu hóa để chạy trên phần cứng Dell, lý tưởng cho bản demo này.

Bạn có thể dễ dàng duyệt danh mục mô hình DEH, lọc theo phần cứng của bạn trong menu bên trái và lấy đoạn mã triển khai Docker cho mô hình ưa thích của bạn.

Trong trường hợp này, đoạn mã triển khai để chạy GLM-5.2-FP8 trên Dell PowerEdge XE9680 8xH200 của chúng tôi trông như thế này:

Hãy nhớ cung cấp token Hugging Face của bạn thông qua biến môi trường HF_TOKEN. Bạn có thể tạo token mới tại đây.

Sau khi triển khai mô hình, việc sử dụng GPU trông như thế này:

Để thêm hành vi tác nhân lên trên một mô hình (sử dụng công cụ)

Tôi hiểu rõ yêu cầu của bạn. Tôi sẽ dịch đoạn văn bản tiếng Anh này sang tiếng Việt một cách chính xác, tự nhiên, giữ nguyên các thuật ngữ AI gốc và không dịch sang bất kỳ ngôn ngữ nào khác.

---

...ge, MCP servers, session management, v.v.) chúng ta phải kết nối nó với một harness.

Bạn có thể tìm hiểu thêm về thuật ngữ AI agents trong bài viết này.

Có một số lựa chọn: Về phía proprietary, Claude Code là một công cụ tuyệt vời cho phép bạn kết nối một model bạn chọn trong khi mang lại trải nghiệm người dùng gần như tương tự như với các model đóng của nó. Về phía open-source, Codex, OpenCode hoặc Pi là một trong những lựa chọn phổ biến nhất.

Một điều quan trọng cần lưu ý là mỗi harness có cách triển khai riêng và một số LLMs có thể hoạt động tốt hơn trên harness này so với harness khác. Ví dụ, các model Qwen được tối ưu hóa cho Qwen-Code. Tuy nhiên, hầu hết các model open-weights, như GLM-5.2-FP8 trong trường hợp này, có thể chạy liền mạch trên Codex, Claude Code, OpenCode, v.v.

Với mục đích của bản demo này, tôi đang sử dụng OpenCode. Chúng tôi cũng sẽ kết nối Hugging Face MCP Server để agent của chúng ta có thể tương tác với hệ sinh thái Hugging Face.

Tệp cấu hình OpenCode cuối cùng trông như thế này:

Để chứng minh khả năng của model này, tôi sẽ yêu cầu agent huấn luyện một vài small LMs do nó chọn, trên một dataset do nó chọn và báo cáo model nào hoạt động tốt nhất.

Đây là một tác vụ phức tạp. Để giải quyết nó, agent phải truy xuất thông tin về các model và dataset từ Hugging Face hub, viết một DPO training script sử dụng thư viện TRL, hiểu cách Hugging Face Jobs hoạt động, khởi chạy các training jobs, theo dõi tiến trình của chúng với track.io, lấy kết quả và viết một báo cáo tóm tắt các phát hiện.

Điều này chuyển thành các prompt sau:

Trước khi bắt đầu phiên làm việc, tôi cần đăng nhập vào tài khoản Hugging Face của mình bằng `hf auth login` và cài đặt kỹ năng HF bằng `hf skills add --global` để agent có thể sử dụng nó.

Tại đây bạn có thể thấy phần đầu của phiên làm việc với agent:

Khi được yêu cầu lấy hai base LLMs tốt nhất cho tác vụ, agent đã đề xuất `google/gemma-3-270m` và `Qwen/Qwen2.5-0.5B`, dựa trên mức độ phổ biến của chúng trên HF hub. Sau đó, nó tìm kiếm một preferences dataset phù hợp và đề xuất `trl-lib/Capybara-Preferences`, vì bộ sưu tập này được sử dụng trong các ví dụ TRL. Tiếp theo, nó đã viết một DPO training script với TRL dựa trên các đoạn mã từ tài liệu.

Agent sau đó đã lặp lại trên smoke-test job, điều chỉnh script, job instance và các tham số cho đến khi tìm thấy một cấu hình hoạt động (hoàn toàn tự động bằng cách truy xuất và phân tích các đầu ra của job). Tiếp theo, agent đã khởi chạy hai training jobs cho các model đã chọn. Training job cho model gemma thất bại với lỗi out-of-memory vì kích thước embedding của nó lớn hơn dự kiến, vì vậy agent đã giảm batch size và khởi chạy lại job.

Sau khi các jobs hoàn tất, tôi yêu cầu agent tải cả hai model lên tài khoản Hugging Face của tôi và tạo một model card cho mỗi model. Bạn có thể xem cả hai model trong bộ sưu tập này.

Đối với bài viết này, tôi đã thủ công tải tệp markdown của báo cáo lên ChatGPT và yêu cầu một infographic dễ đọc hơn.

Như chúng ta có thể thấy, các model không thực sự cải thiện nhiều theo training...

---

**Lưu ý:** Đoạn văn bản kết thúc với "...the models didn't really improve that much according to the traini" có vẻ bị cắt ngang. Tôi đã dịch phần còn lại là "the models didn't really improve that much according to the training" thành "các model không thực sự cải thiện nhiều theo training". Nếu bạn có phần tiếp theo, vui lòng cung cấp để tôi dịch đầy đủ.

các chỉ số. Thí nghiệm đơn giản này có thể được mở rộng thông qua một phiên tương tác nhiều hơn với agent, ví dụ như yêu cầu khám phá các tổ hợp siêu tham số khác nhau, hoặc thực hiện đánh giá chất lượng mạnh mẽ hơn trên các chuẩn đánh giá mục tiêu.

Xuyên suốt bài viết này, chúng ta đã thấy một mô hình nguồn mở tiên tiến có thể mạnh mẽ như các nhà cung cấp AI đóng mà chúng ta thường dựa vào. Mặc dù thiết lập cụ thể này không phải ai cũng có thể chi trả, tôi hy vọng bài viết đã mang lại cái nhìn hữu ích và một chút rõ ràng về việc làm việc với AI mở. Đối với tôi, việc sở hữu dữ liệu và mô hình của riêng bạn là xứng đáng với công sức bỏ ra.

Có những mô hình mở xuất sắc ngoài kia có thể giúp bạn bắt đầu. Hãy khám phá Hugging Face Hub và tìm mô hình phù hợp nhất với tác vụ và phần cứng của bạn.

📎 Nguồn gốc: Hugging Face Blog Xem bài gốc →