# Dữ liệu cho Agents
# Bản Atlas Prompt Nemotron Post-Training v3
## Xây dựng AI agent thực sự là thách thức, vì thế giới thực không vận hành như một benchmark.
Một agent không thể phục hồi sau một lệnh gọi API bị lỗi, hay một workflow chưa từng gặp, thực ra không phải là agent thực sự. Đó chỉ là một bộ tự động hoàn thành văn bản được trang bị thêm công cụ. Để vượt qua khoảng cách đó là một bài toán về dữ liệu: các trace kỹ thuật phần mềm, lỗi sử dụng công cụ, suy luận đa bước, retrieval, an toàn, mô phỏng người dùng, thực thi workflow, và cuối cùng là tương tác với thế giới vật lý. Đó chính là nơi các sản phẩm dữ liệu mở của NVIDIA Nemotron tồn tại.
NVIDIA gần đây đã nhấn mạnh cách các mô hình mã nguồn mở đang thúc đẩy nghiên cứu AI và xuất hiện xuyên suốt tại Hội nghị Quốc tế về Học máy (ICML) nổi tiếng, với gần 145 bài báo trích dẫn các mô hình và bộ dữ liệu Nemotron. Dữ liệu tổng hợp đóng vai trò quan trọng trong toàn bộ hệ sinh thái đó.
Một phần lý do NVIDIA phát hành các bộ dữ liệu mở là để cùng cộng đồng học hỏi và mở rộng các ứng dụng đa dạng này.
**Trọng số mở quan trọng. Nhưng với agent, trọng số chỉ là một phần của câu chuyện.** Khả năng tái tạo còn phụ thuộc vào các bộ dữ liệu, lựa chọn curation, công thức huấn luyện và phương pháp đánh giá đằng sau mô hình.
**Hành vi của agent cần có thể kiểm tra được.** Nếu một mô hình gọi công cụ, thực thi workflow, truy xuất thông tin và hành động xuyên suốt các hệ thống, các nhà phát triển cần hiểu dữ liệu đã định hình những hành vi đó. Dữ liệu mở giúp hành vi agent có thể kiểm tra và giải thích được. Dữ liệu tổng hợp là mảnh ghép quan trọng để hiện thực hóa điều đó.
Phó Chủ tịch Nghiên cứu Học sâu Ứng dụng của NVIDIA, Bryan Catanzaro, gần đây đã nhận xét: **"mỗi công ty được xây dựng xung quanh một bí mật"** — một workflow, kho ngữ liệu, hay mô hình khách hàng mà đối thủ cạnh tranh không có. Những bí mật đó làm cho AI trở nên hữu ích, nhưng các công ty không nên tùy tiện để lộ chúng. Dữ liệu tổng hợp cho phép các nhóm bảo tồn các tín hiệu hữu ích mà không cần phơi bày các nguồn gốc bên dưới.
Bryan cũng nói về việc nuôi dưỡng một hệ sinh thái AI đa dạng và có sự tham gia rộng rãi, nơi nhiều loại công ty, nhà nghiên cứu, chính phủ và cộng đồng có thể đóng góp. Đây không chỉ là một tuyên bố về giá trị. Đó là một tuyên bố về dữ liệu.
Nếu mọi mô hình đều học từ cùng một nguồn dữ liệu hẹp, chúng ta không nên ngạc nhiên khi các mô hình bắt đầu có cảm giác giống nhau. Điều khó khăn là dữ liệu hữu ích nhất thường nằm bên trong các tổ chức không thể hoặc không muốn công bố trực tiếp. Tất cả mọi người đều được hưởng lợi từ một lớp dữ liệu chung phong phú hơn. Nhưng không ai muốn là người đầu tiên từ bỏ thứ tạo nên sự đặc biệt của mình.
**Dữ liệu tổng hợp, được phát hành công khai, là một cách để thay đổi phép tính đó.**
Là một phần của dữ liệu mở Nemotron, chúng tôi đã phát hành hơn 10 nghìn tỷ token pre-training và hàng triệu mẫu post-training trải rộng nhiều lĩnh vực và dạng dữ liệu. Đó là một khối lượng khổng lồ cần nắm bắt — và các bảng dữ liệu thô không giúp ích được nhiều.
Để dễ dàng khám phá những gì thực sự có trong dữ liệu post-training của Nemotron, chúng tôi đã xây dựng **Nemotron Post-Training v3 Prompt Atlas**: một bản đồ trực quan tương tác, trong đó mỗi điểm là một mẫu prompt, được lấy từ bộ sưu tập post-training Nemotron v3 và được lấy mẫu theo khối lượng để phản ánh...
tỷ lệ trung thực của hỗn hợp dữ liệu.
Các lớp phủ màu và bộ lọc cho phép bạn tổ chức lại bản đồ theo tập dữ liệu, giai đoạn pipeline, lĩnh vực, hoặc việc sử dụng công cụ. Vì các prompt có ngữ nghĩa tương tự sẽ cụm lại với nhau, bạn có thể phóng to vào một vùng — thuật toán lập trình, an toàn, toán học, hành vi agentic — kiểm tra các ví dụ đại diện, và sử dụng tín hiệu đó để tuyển chọn dữ liệu, xây dựng bộ đánh giá, hoặc hiểu lý do tại sao một mô hình hoạt động theo cách nó đang làm.
Các agent cũng cần hiểu những người mà chúng được xây dựng để hỗ trợ, và đây là nơi "chất lượng dữ liệu" trở nên mang tính cục bộ, chứ không phải phổ quát. Một bộ phân loại độc hại được huấn luyện trên dữ liệu internet tiếng Anh có thể bỏ sót các tin nhắn thù địch bằng tiếng Hàn hay tiếng Nhật, nơi sự hung hăng thường được mã hóa qua các cấp độ lịch sự thay vì từ vựng rõ ràng. Cùng một tín hiệu, nhưng ngữ cảnh khác nhau. Các nhóm đang định vị các agent theo cách này.
Nemotron-Personas là một nỗ lực nhằm giải quyết vấn đề đó: các persona tổng hợp được định vị theo địa phương, nắm bắt sự đa dạng và phức tạp của các cộng đồng dân cư. Được xây dựng bằng NeMo Data Designer — công cụ AI kết hợp tiên tiến nhất của NVIDIA dành cho việc tạo dữ liệu tổng hợp — Nemotron-Personas phản ánh các thống kê nhân khẩu học và địa lý chính thức theo từng khu vực. Mục tiêu không phải là tái tạo lại những người thực. Theo một nghĩa nào đó, mục tiêu là giúp các nhà phát triển kiểm tra xem hệ thống của họ có thực sự phản ánh được người dùng, ngôn ngữ, khu vực và nghề nghiệp mà họ tuyên bố phục vụ hay không. Privasis, một tập dữ liệu phái sinh được xây dựng trên Nemotron-Personas-USA, cho thấy một hướng đi có thể xảy ra, khi bổ sung thêm các bản ghi tổng hợp bảo vệ quyền riêng tư trải rộng qua các ngữ cảnh y tế, tài chính, pháp lý và xã hội.
Tháng trước tại VivaTech ở Paris, chúng tôi đã ra mắt quốc gia thứ mười trong bộ sưu tập, hiện đại diện cho hơn 2,4 tỷ người.
Khi chất lượng mang tính cục bộ, chỉ những người hiểu rõ địa phương đó mới có thể xây dựng nó — các nhà nghiên cứu khu vực, người bản ngữ, chuyên gia lĩnh vực, các bên liên quan có thể kiểm tra và hiệu chỉnh cùng bạn. Đó là học tập công khai: không phải phát hành dữ liệu một cách đơn độc, mà xây dựng nó một cách cộng tác.
Dữ liệu tổng hợp cần được tích hợp như một phần của hệ thống các nguồn dữ liệu. Có những sự đánh đổi. Nó có thể giảm thiểu rủi ro, nhưng không loại bỏ nhu cầu về định vị thực tế, truy xuất nguồn gốc, tuyển chọn, đánh giá và phán đoán của con người.
Một cách hữu ích để suy nghĩ về điều này là thông qua khái niệm "ngưỡng tổng hợp": những điểm mà tại đó dữ liệu không còn có thể được coi là hoàn toàn thực nữa. Ranh giới đó không phải lúc nào cũng rõ ràng. Các quy trình làm việc thực tế, phản hồi của con người, dấu vết do mô hình tạo ra, người dùng được mô phỏng và nhãn tổng hợp đều có thể đan xen vào nhau. Câu trả lời không phải là giả vờ rằng dữ liệu tổng hợp là giả mạo hay vô hại. Mà là ghi lại những gì đã được tạo ra, những gì đã được định vị thực tế, những gì đã được xem xét, và dữ liệu đó nhằm mục đích kiểm tra điều gì. Khi ngày càng nhiều hệ thống AI được huấn luyện trên thông tin nhân tạo, chúng ta cần những thói quen chung tốt hơn để kiểm tra, ghi lại và tranh luận công khai về các công nghệ này.
Chất lượng cũng có ý nghĩa khác nhau trong các ngữ cảnh khác nhau. Dữ liệu suy luận cần các bài toán khó hơn và dấu vết sạch hơn. Dữ liệu persona cần độ trung thực phân phối và đánh giá cục bộ. Các quy trình agentic cần sự đa dạng về nhiệm vụ, phạm vi bao phủ lỗi,
và các con đường phục hồi. Lĩnh vực này vẫn còn mang tính nghề thủ công nhiều hơn là công thức cố định.
Đó là lý do tại sao các phương pháp mở lại quan trọng. Dữ liệu tổng hợp không chỉ đơn thuần là tạo ra thêm nhiều ví dụ. Đó là việc đặt ra những câu hỏi tốt hơn, và tạo điều kiện cho những bên mà lẽ thường không thể ngồi chung một bàn: các công ty mà không cần tiết lộ bí mật kinh doanh, các chính phủ mà không cần xâm phạm quyền riêng tư, và các nhà nghiên cứu mà không cần chờ đợi sự cho phép có thể chẳng bao giờ đến.
Nguồn tài nguyên khan hiếm trong AI không phải là token. Đó là sự tin tưởng giữa các tổ chức. Dữ liệu tổng hợp là một trong số ít công cụ chúng ta có để xây dựng điều đó.
Chúng tôi đã tổ chức một buổi livestream vào thứ Ba, ngày 7 tháng 7 năm 2026 về chủ đề **Tại Sao Dữ Liệu Mở Quan Trọng** với một panel khách mời xuất sắc. Buổi livestream này rất đáng xem, cùng với các bộ sưu tập dữ liệu Nemotron trên Hugging Face.
Hãy cập nhật thông tin về NVIDIA Nemotron bằng cách **đăng ký nhận tin tức NVIDIA** và theo dõi NVIDIA AI trên **LinkedIn**, **X**, **YouTube**, và **kênh Nemotron trên Discord**.
Truy cập các **Mô hình Nemotron mở trên Hugging Face** và bộ sưu tập **NIM microservices cùng các Ví dụ dành cho Nhà phát triển** tại build.nvidia.com.


