**NVIDIA Nemotron 3 Embed Xếp Hạng #1 Tổng Thể Trên RTEB, Thúc Đẩy Truy Xuất Tác Nhân**
Hôm nay, chúng tôi phát hành **NVIDIA Nemotron 3 Embed**, một bộ sưu tập các mô hình nhúng mã nguồn mở và thương mại, được thiết kế để cải thiện chất lượng truy xuất, đồng thời cung cấp cho các nhà phát triển các tùy chọn triển khai thực tế cho RAG quy mô sản xuất, truy xuất tác nhân, truy xuất mã và bộ nhớ tác nhân.
Bộ sưu tập bao gồm ba mô hình mã nguồn mở đạt được khả năng truy xuất tiên tiến nhất trên đường cong chính xác-hiệu quả, dẫn đầu bởi mô hình 8B đứng đầu bảng xếp hạng RTEB và các biến thể 1B hiệu quả được xây dựng cho triển khai quy mô sản xuất:
**Bảng 1.** Ma trận khả năng sử dụng và triển khai của Mô hình Nemotron 3 Embed.
**Hình 1.** Ảnh chụp màn hình Bảng xếp hạng Đa ngôn ngữ RTEB (ngày 15 tháng 7 năm 2026) cho thấy Nemotron-3-Embed-8B-BF16 xếp hạng #1.
Ngoài kết quả RTEB, Nemotron 3 Embed giới thiệu một bộ tính năng sẵn sàng cho sản xuất dành cho các triển khai truy xuất doanh nghiệp:
Chúng tôi đánh giá Nemotron 3 Embed trên ba khía cạnh: chất lượng truy xuất, hiệu quả tác nhân hạ nguồn và sự đánh đổi khi triển khai. Mô hình 8B thiết lập mức trần chất lượng của bộ sưu tập mô hình, trong khi các biến thể 1B BF16 và NVFP4 mang thiết kế tập trung vào truy xuất tương tự đến các môi trường triển khai chi phí thấp hơn và thông lượng cao hơn.
Đầu tiên, chúng tôi đánh giá các mô hình trên **RTEB**, nơi Nemotron-3-Embed-8B-BF16 xếp hạng #1. Chúng tôi cũng kiểm tra các mô hình này trên **ViDoRe V3 Text**, **MMTEB Retrieval** và **LongEmbed** bằng cách sử dụng NDCG@10 trung bình.
**Hình 2.** Độ chính xác truy xuất sử dụng NDCG@10 trung bình trên RTEB, ViDoRe V3 Text, MMTEB Retrieval và LongEmbed, so sánh các mô hình Nemotron 3 Embed với các đường cơ sở Nemotron thế hệ trước.
Để đánh giá khả năng truy xuất trong môi trường tác nhân, chúng tôi sử dụng một **tác nhân tìm kiếm** được hỗ trợ bởi **Nemotron 3 Ultra** và thay đổi mô hình nhúng được hệ thống truy xuất sử dụng. Truy xuất tốt hơn có thể trả về bằng chứng liên quan sớm hơn, giúp tác nhân tránh các tìm kiếm lặp lại, các bước suy luận không cần thiết và kiểm tra ngữ cảnh thừa. Chúng tôi so sánh độ chính xác truy xuất trung bình với chi phí token tác nhân hạ nguồn ước tính trên mỗi truy vấn trên ViDoRe V3, **BRIGHT** và **BrowseComp-Plus**.
**Hình 3.** Độ chính xác truy xuất trung bình so với chi phí token tác nhân hạ nguồn trên mỗi truy vấn trên ViDoRe V3, BRIGHT và BrowseComp-Plus.
*Ghi chú đánh giá:* Tác nhân tìm kiếm sử dụng Nemotron 3 Ultra. Chi phí token hạ nguồn được ước tính từ số lượng token đầu vào/đầu ra của Nemotron 3 Ultra bằng công thức định giá GPT-5.5.
Hình 3 cho thấy truy xuất mạnh hơn làm giảm chi phí token tác nhân hạ nguồn. Các bộ truy xuất chính xác hơn trả về bằng chứng liên quan sớm hơn, giúp tác nhân hoàn thành nhiệm vụ với ít tìm kiếm lặp lại và ít bước suy luận hơn. Trong các đánh giá này, các mô hình Nemotron 3 Embed cải thiện ranh giới truy xuất tác nhân, với mô hình 8B mang lại cả độ chính xác truy xuất trung bình cao nhất và chi phí token hạ nguồn ước tính thấp nhất trên ViDoRe V3, BRIGHT và BrowseComp-Plus.
Đối với các triển khai thông lượng cao, các nhóm thường chọn các mô hình nhúng nhỏ hơn để đáp ứng các mục tiêu về độ trễ và chi phí. **Nemotron-3-Embed-1B-NVFP4** được thiết kế để thu hẹp khoảng cách giữa hiệu quả phục vụ và chất lượng truy xuất bằng cách sử dụng khả năng tăng tốc NVFP4 gốc trên **kiến trúc NVIDIA Blackwell**. Mô hình lượng tử hóa trọng số và kích hoạt của các lớp tuyến tính thành NVFP4 để suy luận hiệu quả, đồng thời sử dụng Phương pháp Chưng cất Nhận thức Lượng tử hóa (QAD) để giúp phục hồi độ chính xác cho các chuỗi đầu vào dài.
**Hình 4.** Độ chính xác truy xuất ViDoRe V3 so với hiệu quả phục vụ, so sánh Nemotron-3-Embed-1B-NVFP4 với các đường cơ sở nhúng mở nhỏ hơn được chọn, bao gồm Qwen3-Embedding-0.6B và EmbeddingGemma-300M.
Đối với các hệ thống truy xuất quy mô sản xuất, dịch vụ
Ngăn xếp cũng cần duy trì hiệu suất đó dưới tải yêu cầu thực tế, trên các độ dài chuỗi đầu vào và mục tiêu phần cứng khác nhau. Để làm cho Nemotron 3 Embed hoạt động hiệu quả ở quy mô doanh nghiệp ngày nay, chúng tôi cũng đang phát hành một dịch vụ vi mô NVIDIA NIM được tối ưu hóa cho mô hình 1B. Như thể hiện trong Hình 5, Nemotron 3 Embed NIM dựa trên Rust đạt hoặc vượt hiệu suất của điểm kiểm tra vLLM trên GPU NVIDIA GB200 và RTX PRO 6000 trên các ISL 256 & 1024.
Hình 5. Hiệu suất phục vụ của Nemotron 3 Embed NIM so với điểm kiểm tra vLLM trên GPU NVIDIA GB200 và RTX PRO 6000.
Nemotron-3-Embed-8B-BF16 điều chỉnh bộ xương Ministral-3-8B-Instruct-2512 bằng cách chuyển đổi bộ giải mã nhân quả của nó thành bộ mã hóa hai chiều để truy xuất toàn bộ chuỗi. Mô hình được huấn luyện với tiền huấn luyện đối lập trên hỗn hợp các cặp văn bản từ web và tổng hợp, sau đó tinh chỉnh trên các bộ dữ liệu truy xuất đa ngôn ngữ được tuyển chọn trong các lĩnh vực như pháp lý, tài chính, y tế, kinh doanh và giáo dục. Mô hình 8B này đóng vai trò là mô hình nhúng chủ lực, trong khi các điểm kiểm tra giáo viên 8B trước đó từ cùng dòng phát triển đã được sử dụng để chưng cất các biến thể 1B hiệu quả.
Mô hình 1B không phải là một bộ truy xuất nhỏ được huấn luyện từ đầu. Đầu tiên, chúng tôi áp dụng công thức điều chỉnh hai chiều cho bộ xương Ministral-3-3B-Instruct-2512 để thiết lập một cơ sở bộ truy xuất 3B, sau đó nén nó qua hai vòng cắt tỉa có cấu trúc và chưng cất.
Đầu tiên, mô hình cha 3B được nén xuống kích thước trung gian 2B bằng công cụ Tìm kiếm Kiến trúc Thần kinh mcore_minitron của NVIDIA ModelOpt. Đường ống NAS đã tìm kiếm trên chiều rộng ẩn, kích thước FFN, đầu chú ý và độ sâu dưới một ngân sách tham số nghiêm ngặt để xác định một kiến trúc hiệu quả cho khối lượng công việc truy xuất.
Mô hình trung gian 2B kết quả sau đó được chưng cất từ một điểm kiểm tra giáo viên 8B để phục hồi độ chính xác xếp hạng. Chúng tôi đã sử dụng tổn thất khoảng cách cosine kết hợp và tổn thất sai số bình phương trung bình trên hỗn hợp dữ liệu truy xuất trong miền đa ngôn ngữ để căn chỉnh các nhúng của học sinh với giáo viên.
Hình 6. Đường ống cắt tỉa và chưng cất nén bộ truy xuất từ cơ sở 3B xuống mô hình sản xuất 1B cuối cùng.
Cùng một trình tự này, cắt tỉa có cấu trúc ModelOpt tiếp theo là chưng cất giáo viên 8B, được lặp lại lần thứ hai để nén mô hình trung gian 2B xuống mô hình nhúng 1.14B cuối cùng. Huấn luyện cuối cùng sử dụng một lịch trình mở rộng ngữ cảnh hai giai đoạn tiến bộ:
Bảng sau đây tóm tắt các thông số kỹ thuật cốt lõi và mục tiêu triển khai cho các mô hình Nemotron 3 Embed:
Bảng 2. Thông số kiến trúc và cấu hình suy luận cốt lõi cho các mô hình Nemotron 3 Embed.
Các ISV doanh nghiệp, công ty AI gốc và nhà cung cấp bộ nhớ đã đang đánh giá Nemotron 3 Embed trên các quy trình làm việc truy xuất tác nhân, bộ nhớ tác nhân, truy xuất mã và suy luận sản xuất.
NVIDIA Nemotron 3 Embed được phát hành với trọng số mở và công thức huấn luyện mã nguồn mở, cho phép các tổ chức kiểm soát hoàn toàn cách các mô hình truy xuất được tùy chỉnh và triển khai cho các ứng dụng AI sản xuất.
Các nhà phát triển có thể bắt đầu sử dụng tùy chọn triển khai phù hợp nhất với quy trình làm việc của họ:
Đối với khối lượng công việc yêu cầu thích ứng miền hoặc giảm kích thước, chúng tôi cũng đã mã nguồn mở các công thức huấn luyện NVIDIA NeMo AutoModel:
Ví dụ, trên đánh giá NV Docs, tinh chỉnh Nemotron-3-Embed-1B-BF16 đã cải thiện NDCG@10 từ 56,7% lên 63,3% (+11,6%) và Recall@5 từ 56,1% lên 62,8% (+11,9%).
Cho dù bạn đang xây dựng tìm kiếm doanh nghiệp, RAG sản xuất, bộ nhớ tác nhân hay truy xuất mã,
Các hệ thống AI dạng val, hay tác nhân AI, NVIDIA Nemotron 3 Embed cung cấp các tùy chọn triển khai linh hoạt—từ các mô hình mã nguồn mở trên Hugging Face đến các nền tảng AI Cloud được quản lý hoàn toàn và các dịch vụ vi mô NVIDIA NIM.
Khám phá các mô hình, triển khai chúng trên nền tảng bạn ưa thích và cho chúng tôi biết bạn đang xây dựng điều gì.
Xin chúc mừng về thành tích LMEB SOTA! 🎉
Các kết quả đã được hợp nhất tại https://github.com/embeddings-benchmark/results/pull/617 cho thấy hiệu suất LMEB vượt trội:
Nemotron-3-Embed-8B-BF16: 64.4, một SOTA tổng thể mới. Nemotron-3-Embed-1B-BF16: 61.5, một SOTA mới ở quy mô ~1B.
Bảng xếp hạng LMEB dường như đang chờ đồng bộ hóa.
Hiện tại nó đã hoạt động! Cảm ơn bạn đã đánh giá các mô hình của chúng tôi tại đó!


