Hugging Face Blog

# VKUE: Không có GPU? Vẫn chạy được — Mô hình Reasoning 34,7 tỷ tham số trên Laptop và CPU thuần túy

🕐 20/07/2026 08:14 📰 Hugging Face Blog ✅ Đã dịch sang tiếng Việt

# GPU Trung Tâm Dữ Liệu Không Còn Là Điều Kiện Bắt Buộc

Bạn cần GPU trung tâm dữ liệu để chạy mô hình frontier — điều này phần lớn đúng. Nhưng giả định đó dựa trên một giả định khác: rằng mô hình đọc toàn bộ tham số ở mỗi token. Quá trình giải mã bị giới hạn bởi băng thông bộ nhớ, không phải năng lực tính toán. Nếu phải quét qua 34 tỷ tham số mỗi token, một card 8 GB sẽ chỉ xử lý được một đến hai token mỗi giây.

Giả định đó không phải lúc nào cũng đúng.

---

## Hai Nhánh Phục Vụ của VIDRAFT

Dòng phục vụ của VIDRAFT có hai nhánh.

**VKUE (VIDRAFT Kernel Ubiquitous Engine)** hướng đến **khả năng tiếp cận**, không phải tốc độ thuần túy: lấy một mô hình lớn, có năng lực và khiến nó **chạy được** trên phần cứng mà thông thường nó không thể — một máy CPU không có GPU, hoặc laptop 8 GB.

Bài viết này minh chứng điều đó bằng một mô hình duy nhất.

---

## Mô Hình: Ourbox-35B-JGOS

Mô hình là **Ourbox-35B-JGOS**, một bộ suy luận Mixture-of-Experts thưa từ dòng Qwen3.5-MoE / Qwen3-Next (tổng cộng 34,7B tham số, 256 chuyên gia top-8, linear attention Gated-DeltaNet xen kẽ với full attention).

Mô hình có 34,7B tham số, nhưng chỉ khoảng **3B được kích hoạt mỗi token**.

Vì giải mã bị giới hạn bởi băng thông bộ nhớ, điều quan trọng là số byte di chuyển mỗi token:

> Giữ các chuyên gia trong RAM hệ thống và chỉ đặt các lớp attention/router/shared lên GPU — một bộ suy luận cỡ 34,7B chạy ở tốc độ sử dụng được trên **laptop 8 GB**, hoặc **hoàn toàn không cần GPU**.

---

## Bảng Số Liệu Chính

**Một file duy nhất; chỉ phần cứng thay đổi.**

Mọi con số đều được đo thực tế. Từ B200 trung tâm dữ liệu xuống đến laptop gaming, một bộ trọng số bao phủ bốn bậc độ lớn của phần cứng.

---

## So Sánh Đầu-Đối-Đầu: Thưa vs. Dày Đặc

Để loại trừ khả năng "chỉ là mô hình nhỏ," chúng tôi chạy so sánh trực tiếp với mô hình dày đặc trên **cùng laptop, cùng engine, cùng lượng tử hóa (Q3\_K\_M)**, dung lượng gần như tương đương.

**→ Nhanh hơn 3,7× nhờ độ thưa.** Biến số duy nhất là tham số kích hoạt (3B so với 32,8B). Tốc độ 20 tok/s đó cũng **gấp ~2× kết quả tốt nhất được ghi nhận cho mô hình dày đặc 32B trên bất kỳ máy 8 GB nào** (~10,8 tok/s).

Và đây không phải mô hình đồ chơi — Ourbox-35B đạt **GPQA Diamond 86,4% (maj@8) / 70,7% (greedy)** (đo thực tế, điều kiện được ghi rõ).

---

## Demo Trực Tiếp

Con số trống rỗng nếu không có bằng chứng, vì vậy hãy **đo trực tiếp**. Nhập prompt và xem hai đường phần cứng sinh văn bản song song, tok/s tăng dần theo thời gian thực. Là mô hình suy luận, mỗi panel phát trực tiếp quá trình **suy nghĩ** riêng (hiển thị mờ) rồi đến câu trả lời.

---

## Ứng Dụng Thực Tế

Tính trung thực là mục tiêu cốt lõi của benchmark, vì vậy xin nói thẳng:

Các triển khai on-prem có chủ quyền, edge và khu vực công thường không thể dùng cloud hay H100. VKUE đưa **bộ suy luận cấp frontier** vào những môi trường đó — trên một card $1.600, laptop gaming, hoặc máy chủ CPU bạn đã sở hữu. Có card mạnh thì chạy nhanh; không có thì vẫn chạy được. **Ở bất cứ đâu.**

---

🔵 **Demo GPU vs CPU:** https://final-bench-ourbox-35b-vkue-demo.hf.space

🔵 **Demo chỉ CPU:** https://final-bench-ourbox-35b-vkue-cpu.hf.space

📊 **Bảng xếp hạng VKUE:** https://huggingface.co/spaces/FINAL-Bench/VKUE

🤗 **Mô hình:** https://huggingface.co/FINAL-Bench/Ourbox-35B-JGOS-GGUF

⚡ **VKAE (tốc độ):** https://huggingface.co/spaces/VIDraft/vkae

---

VKUE là một phần trong dòng phục vụ hiệu quả của VIDRAFT — cùng một bộ trọng số chạy từ GPU trung tâm dữ liệu đơn lẻ xuống đến laptop người dùng phổ thông. *"VKAE thì nhanh; VKUE thì ở khắp nơi."*

📎 Nguồn gốc: Hugging Face Blog Xem bài gốc →