Hugging Face Blog

# Công nghệ tiên tiến nhất trong AI mã nguồn mở cho các tác vụ pháp lý Thụy Sĩ

🕐 20/07/2026 08:14 📰 Hugging Face Blog ✅ Đã dịch sang tiếng Việt

Mô hình dẫn đầu tổng thể không phải là dịch thuật viên tốt nhất. Và dịch thuật viên tốt nhất lại là một trong những mô hình yếu nhất ở các câu hỏi trắc nghiệm về luật. Vì vậy, câu hỏi đúng đắn không phải là "mô hình mở nào tốt nhất" mà là "tốt nhất ở lĩnh vực gì."

Bài viết này dành cho những ai đang quyết định mô hình mở nào để chạy trên văn bản pháp lý tiếng Thụy Sĩ, và cho những ai muốn có số liệu thực tế thay vì cảm tính. Tất cả kết quả đến từ một lần chạy đầy đủ duy nhất: các đầu ra thô được lưu trong bucket Hugging Face công khai, và điểm vào `run.py` tái tạo mọi con số dưới đây.

**TL;DR:** Chọn GLM 5.2 cho dịch thuật, Nemotron hoặc một biến thể DeepSeek V4 cho tóm tắt và lập luận pháp lý mở, và Gemma 4 31B cho triển khai cục bộ. Gemma đạt 54,8 điểm tổng thể và dẫn đầu benchmark MCQ; nó phù hợp với phần cứng cục bộ trong khi mọi mô hình xếp trên nó đều là MoE lớn hơn nhiều được phục vụ trên đám mây.

NVIDIA's Nemotron 3 Ultra 550B dẫn đầu điểm tổng hợp với 59,0. Nhưng Kimi K2.6 (58,6), DeepSeek V4 Pro (58,3), DeepSeek V4 Flash (57,3) và MiniMax M3 (56,9) chỉ kém lần lượt 0,4; 0,7; 1,7 và 2,1 điểm.

**Top 5 về cơ bản ngang nhau.** Bootstrap theo cấp độ tác vụ trên cùng các tệp kết quả (10.000 lần lấy mẫu lại trong mỗi nhóm benchmark) cho khoảng tin cậy 95% với bán kính xấp xỉ 3,2 đến 3,6 điểm — rộng hơn khoảng cách 2,1 điểm giữa vị trí thứ nhất và thứ năm. Mức độ bất định này cũng nhất quán với các nghiên cứu LLM-as-judge gần đây: JudgeSense phát hiện rằng các cách diễn đạt lại prompt tương đương có thể đảo ngược quyết định của judge, và Li et al. chỉ ra rằng các judge dựa trên điểm số thay đổi khi rubric và câu trả lời tham chiếu bị nhiễu. Điểm tổng hợp lấy trung bình bốn nhóm tác vụ (tóm tắt SLDS, câu hỏi mở LEXam, dịch thuật và MCQ), mỗi nhóm trên thang điểm 0–100.

**Khoảng cách chỉ trở nên rõ ràng ở phía dưới, với một ngoại lệ.** Gemma 4 31B đạt 54,8 điểm tổng thể, xếp thứ bảy và chỉ kém GLM 5.2 (55,5) 0,7 điểm — điều đáng chú ý đối với một mô hình 31B đứng giữa các mô hình frontier cỡ 500B. Kích thước đơn thuần không giải thích được phần còn lại. Llama 3.3 70B (33,0) xếp dưới Qwen3.5 35B (42,8) — một mixture-of-experts chỉ kích hoạt 3B tham số mỗi token. OLMo 3.1 32B Think là mô hình dày đặc cùng kích thước với Gemma, nhưng chỉ đạt 26,0 điểm, kém hơn một nửa. Và LFM2.5 8B (24,8), mô hình thực sự nhỏ duy nhất ở đây, đứng cuối bảng. Cả bốn mô hình này chưa sẵn sàng cho công việc pháp lý Thụy Sĩ.

Luật Thụy Sĩ được viết bằng tiếng Đức, Pháp và Ý, và cả ba benchmark đều bao gồm trường hợp đa ngôn ngữ.

Chúng tôi chấm điểm các tác vụ sinh văn bản bằng các LLM judge từ chính các bài báo của benchmark, không dùng BLEU hay ROUGE. Các bài báo cho thấy độ trùng lặp từ vựng tương quan kém với đánh giá của con người trên văn bản pháp lý, vì vậy mô hình judge đọc đầu ra là thước đo trung thực hơn.

**Lấy trung bình thành một con số duy nhất che giấu sự khác biệt thực sự giữa các mô hình.** Góc nhìn theo từng nhóm mới là thứ bạn nên dùng để lựa chọn.

Nemotron dẫn đầu điểm tổng hợp nhờ dẫn đầu hai nhóm: tóm tắt SLDS với 55,1 (mô hình duy nhất vượt 53) và câu hỏi mở LEXam với 66,5.

GLM 5.2 là hình ảnh đối lập. Đây là dịch thuật viên tốt nhất với 66,2 điểm, nhưng lại yếu nhất trong nhóm này ở câu hỏi mở LEXam (58,8) và MCQ.

(44.6), đó là lý do tại sao nó tụt xuống vị trí thứ sáu tổng thể dù dẫn đầu về dịch thuật.

Nếu khối lượng công việc của bạn là dịch thuật, hãy chạy GLM 5.2. Nếu là tóm tắt hoặc suy luận pháp lý mở, hãy chạy Nemotron hoặc một biến thể DeepSeek V4. Và nếu bạn cần chạy trên phần cứng của riêng mình, Gemma 4 31B là lựa chọn nổi bật: đạt 54.8 tổng thể và dẫn đầu toàn bộ lĩnh vực về MCQ, ở kích thước phù hợp với phần cứng cục bộ trong khi mọi mô hình xếp trên nó đều là MoE lớn hơn nhiều được phục vụ trên đám mây.

Các mô hình hoạt động tốt nhất trong dịch thuật: mười trong số mười ba mô hình đạt ít nhất 57 trên 100. GLM 5.2 dẫn đầu với 66.2, vượt trước Kimi K2.6 (65.3) và DeepSeek V4 Pro (64.2).

Bất ngờ về hiệu quả là Hunyuan MT2 30B, một chuyên gia dịch thuật chỉ với 3B tham số hoạt động (chúng tôi chạy nó chỉ trên SwiLTra-Bench). Nó xếp thứ sáu với 61.9, chỉ cách 4.3 điểm so với mô hình dịch mã nguồn mở tốt nhất, GLM 5.2 (66.2). Năm mô hình xếp trên nó kích hoạt nhiều tham số hơn đáng kể mỗi token, từ 23B của MiniMax M3 đến 55B của Nemotron 3 Ultra, vì vậy một mô hình với ít tham số hoạt động hơn 8 đến 18 lần gần như ngang bằng với frontier về dịch thuật. Bài học rút ra có hai mặt: một chuyên gia không chiến thắng về chất lượng thuần túy, nhưng không có mô hình nào trên bảng xếp hạng mang lại nhiều hơn trên mỗi tham số hoạt động. Nếu bạn bị giới hạn về tính toán, Hunyuan MT2 là mô hình dịch thuật đáng chú ý. Nếu bạn chỉ muốn đầu ra tốt nhất, các MoE lớn vẫn chiến thắng.

SwiLTra-Bench chia thành ba loại tài liệu, và chúng không có độ khó như nhau.

Đối với các mô hình mạnh, thứ tự nhất quán: tóm tắt quyết định tòa án là dễ nhất, luật thành văn ở mức trung bình, và thông cáo báo chí là khó nhất. GLM 5.2 đạt 71.0 trên tóm tắt quyết định nhưng chỉ 60.5 trên thông cáo báo chí, và mọi mô hình trong top tám đều xếp hạng các tập con theo thứ tự đó. DeepSeek V4 Pro là mô hình vượt trội trên thông cáo báo chí (61.2, điểm duy nhất trên 61 ở tập con đó).

Quy luật này phá vỡ đối với các mô hình yếu hơn, và sự phá vỡ đó rất đáng chú ý. Gemma 4 31B duy trì gần frontier trên tóm tắt quyết định (63.5) và thông cáo báo chí (59.2) nhưng tụt xuống 48.9 trên luật thành văn, khoảng cách 14.6 điểm giữa tập con mạnh nhất và yếu nhất của nó. Qwen3.5 35B đảo ngược hoàn toàn thứ tự thông thường, với luật là tập con tệ nhất (30.6) và thông cáo báo chí là tốt nhất (51.5). OLMo 3.1 32B gần như thất bại hoàn toàn trên thông cáo báo chí với 9.6. Nếu khối lượng công việc của bạn là một loại tài liệu cụ thể, các điểm tập con này quan trọng hơn điểm trung bình dịch thuật.

Mọi mô hình đều suy giảm khi chuyển từ 4 sang 16 lựa chọn đáp án, và mức giảm rất dốc.

Kimi K2.6 giảm từ 67.9% ở bốn lựa chọn xuống 44.0% ở mười sáu lựa chọn. Nemotron giảm từ 63.1% xuống 41.7%.

Kích thước mô hình không bảo vệ được trước điều này. Gemma 4 31B đạt điểm trung bình MCQ tốt nhất trong toàn bộ lĩnh vực (56.0), vượt trước mọi mô hình cỡ 500B. Đối với các câu hỏi thi này, một mô hình dense nhỏ hơn đánh bại các MoE lớn hơn nhiều.

Điểm trad_score trong biểu đồ coi "Tôi không biết" là sai. Benchmark cũng báo cáo điểm hiệu chỉnh (idk_score) thưởng cho việc bỏ qua câu hỏi và phạt các câu trả lời sai tự tin, và nó trở thành âm đối với mọi mô hình ở 16 lựa chọn, từ -4.3 cho DeepSeek V4 Pro được hiệu chỉnh tốt nhất trở xuống

n xuống -61,3 đối với LFM2.5 8B. Với tập hợp lựa chọn rộng, các mô hình mã nguồn mở vẫn đoán sai nhiều hơn là thừa nhận sự không chắc chắn.

Tính trung bình mọi tác vụ tiếng Đức, Pháp và Ý mà một mô hình thực hiện (SLDS cộng với ba tập con dịch thuật, các benchmark bao phủ cả ba ngôn ngữ) cho thấy một khoảng cách nhỏ nhưng nhất quán.

Tiếng Pháp đạt điểm cao nhất tính trung bình (50,7 trên 12 mô hình có thể so sánh), tiếng Đức đứng ngay sau (49,9), và tiếng Ý đứng cuối (47,6). Khoảng cách là hơn ba điểm, và tiếng Ý là thấp nhất trong ba ngôn ngữ đối với 9 trong số 12 mô hình. Tiếng Đức và tiếng Pháp vẫn nằm trong khoảng cách một điểm so với nhau. Nguyên nhân có thể là do khối lượng dữ liệu, vì tiếng Ý là ngôn ngữ nhỏ nhất trong số ba ngôn ngữ trong kho ngữ liệu pháp lý Thụy Sĩ và trên web mở. LEXam bị loại khỏi phần phân tích này vì nó chỉ tồn tại bằng tiếng Đức và tiếng Anh, và việc đưa vào sẽ so sánh các ngôn ngữ trên một tập benchmark không đồng đều.

Hai con số quyết định chi phí triển khai một mô hình. Tổng số tham số xác định lượng bộ nhớ mà các trọng số chiếm dụng, và số tham số hoạt động xác định lượng tính toán mà mỗi token tiêu tốn. Các mô hình mã nguồn mở ở đây có tổng số tham số từ 8,5 tỷ đến 1,6 nghìn tỷ, và độ chính xác gốc quan trọng không kém số lượng tham số.

Trọng số bằng tổng số tham số nhân với số byte trên mỗi tham số (BF16 = 2, FP8 = 1, INT4/FP4 = 0,5), trước khi tính đến KV cache mà ngữ cảnh dài bổ sung thêm; số lượng GPU giả định các card 80 GB (H100) hoặc 141 GB (H200). Chúng tôi chạy các mô hình vLLM cục bộ trên 4 H100 mỗi mô hình để đạt thông lượng ngữ cảnh 64k, cao hơn nhiều so với mức tối thiểu chỉ tính trọng số này.

Độ chính xác thay đổi bức tranh nhiều không kém kích thước. Kimi K2.6 có nhiều tham số hơn GLM 5.2 (1 nghìn tỷ so với 753 tỷ), nhưng nó được phát hành dưới dạng INT4, do đó trọng số của nó (0,5 TB) chỉ bằng một phần ba so với dung lượng BF16 của GLM (1,5 TB). Bảy trong số mười ba mô hình cần một máy chủ đa GPU; sáu mô hình còn lại vừa với một bộ tăng tốc, và năm trong số đó chạy trên một H100 80 GB duy nhất. Đó là trường hợp của Gemma 4 31B: chất lượng gần đỉnh (54,8 tổng thể) chỉ từ một GPU, trong khi mọi mô hình xếp hạng cao hơn đều cần nhiều GPU.

Hãy coi điểm tổng hợp là chỉ số tham khảo hơn là

📎 Nguồn gốc: Hugging Face Blog Xem bài gốc →