MarkTechPost

NVIDIA phát hành DeepStream 9.1: Đưa Agentic AI vào Vision AI với 13 kỹ năng và theo dõi 3D đa góc nhìn

🕐 20/07/2026 09:32 📰 MarkTechPost ✅ Đã dịch sang tiếng Việt

NVIDIA vừa phát hành **DeepStream 9.1**. Bản cập nhật này giải quyết một vấn đề tồn tại lâu nay trong phân tích video. Theo dõi một đối tượng qua nhiều camera theo cách truyền thống đòi hỏi hiệu chỉnh camera thủ công và các phép tính phức tạp. DeepStream 9.1 giải quyết vấn đề này bằng hai tính năng bổ sung: **Theo dõi 3D Đa Góc nhìn (MV3DT)** và **AutoMagicCalib (AMC)**. Cả hai đều được đóng gói dưới dạng kỹ năng tác tử (agentic skills) cho các tác tử lập trình (coding agents). Nhờ đó, các nhà phát triển có thể chuyển từ ý tưởng sang một pipeline hoạt động nhanh hơn.

Để hiểu rõ bản cập nhật, hãy bắt đầu với nền tảng cơ sở. DeepStream là bộ công cụ phân tích luồng dữ liệu (streaming analytics) của NVIDIA dành cho hiểu biết video và hình ảnh dựa trên AI. Nó cung cấp một framework dựa trên GStreamer cho suy luận đa luồng, đa mô hình trên GPU NVIDIA. Các pipeline kết hợp giải mã và mã hóa tăng tốc phần cứng, suy luận TensorRT, theo dõi đối tượng và tích hợp message-broker.

Xây dựng trên nền tảng đó, phiên bản 9.1 bổ sung năm mục đáng chú ý:

Trong số các bổ sung đó, MV3DT là kỹ năng chính, vì vậy hãy xem xét cách nó hoạt động. Về cốt lõi, MV3DT chiếu các phát hiện (detections) từ nhiều camera đã được hiệu chỉnh vào một hệ tọa độ 3D chung. Sau đó, nó liên kết các quan sát của cùng một đối tượng trên các góc nhìn camera khác nhau. Cuối cùng, nó gán một ID đối tượng duy nhất trên toàn cục.

Cụ thể, luồng dữ liệu chạy qua bốn giai đoạn. Đối với phát hiện, mỗi luồng camera chạy một bộ phát hiện đối tượng (object detector). MV3DT hỗ trợ ba mô hình ngay khi cài đặt:

Tiếp theo, đối với nhận thức 3D một mắt (monocular 3D perception), mỗi camera sử dụng ma trận chiếu 3×4 được lưu trong tệp hiệu chỉnh YAML. Ma trận này chiếu ngược các hộp giới hạn 2D thành tọa độ không gian thế giới 3D bằng cách sử dụng giả định mặt phẳng mặt đất. Sau đó, đối với liên kết đa góc nhìn, bộ theo dõi chia sẻ các tracklet bằng cách sử dụng Message Queuing Telemetry Transport (MQTT). MQTT là một giao thức nhắn tin pub/sub nhẹ. Khi hai camera quan sát cùng một người, nó sẽ khớp các tracklet dựa trên khoảng cách trong không gian thế giới 3D.

Sau khi liên kết, kết quả được xuất ra dưới ba dạng. Màn hình hiển thị trên màn hình (OSD) hiển thị lưới xếp chồng với các hộp giới hạn 2D và 3D. Chế độ xem từ trên xuống (BEV) hiển thị bản đồ quỹ đạo từ trên xuống. Nhắn tin Kafka cung cấp siêu dữ liệu protobuf theo từng khung hình, bao gồm ID cảm biến, ID đối tượng và hộp giới hạn 3D.

MV3DT phụ thuộc vào các camera đã được hiệu chỉnh, theo cách truyền thống có nghĩa là sử dụng bảng caro và thời gian chết. Thay vào đó, AMC hiệu chỉnh một mạng lưới bằng cách phân tích các đối tượng được theo dõi trong các tệp hoặc luồng video hiện có. Nó ước tính các tham số nội tại của mỗi camera (tiêu cự, điểm chính, biến dạng ống kính). Nó cũng ước tính các tham số ngoại tại (xoay, tịnh tiến, vị trí thế giới).

Bên trong, pipeline chạy qua năm giai đoạn. Đó là trích xuất quỹ đạo từng camera, hiệu chỉnh một góc nhìn, khớp tracklet đa góc nhìn, điều chỉnh chùm (bundle adjustment) và tinh chỉnh VGGT tùy chọn. VGGT (Visual Geometry Grounded Transformer) giúp ích khi chuyển động của đối tượng bị hạn chế. AMC chạy như một microservice với REST APIs và giao diện web. Người dùng chỉ cần cung cấp một hình ảnh bố trí và một vài điểm căn chỉnh.

Với MV3DT và AMC đã được xác định, cơ chế phân phối chính là các kỹ năng (skills). Thay vì chỉnh sửa cấu hình

files, bạn mô tả ý định bằng ngôn ngữ tự nhiên. Các kỹ năng này hoạt động với Claude Code, Codex, Cursor và các agent tương tự. Thiết lập rất ngắn gọn:

Sau khi khởi chạy agent, một prompt duy nhất sẽ chạy ứng dụng tham chiếu:

Từ đó, kỹ năng MV3DT xác thực các điều kiện tiên quyết, kéo container và cài đặt các dịch vụ broker Kafka và Mosquitto. Nó cũng tải trọng số mô hình, tạo cấu hình pipeline và khởi chạy tính năng theo dõi. Đáng chú ý, nếu thiếu file hiệu chuẩn, nó sẽ tự động kích hoạt các kỹ năng AMC.

Để có bối cảnh, bảng dưới đây cho thấy những thay đổi giữa các phiên bản.

Với những khả năng này, các tính năng tương ứng với các triển khai cụ thể:

Để xem cơ chế hoạt động, bản demo nhúng bên dưới minh họa một người đi bộ giữa ba trường nhìn camera. Chuyển đổi giữa theo dõi 2D trên từng camera thông thường và kết hợp 3D MV3DT để thấy ID đối tượng luôn nhất quán.

XemRepo tại đây.Ngoài ra, hãy theo dõi chúng tôi trênTwittervà đừng quên tham gia150k+ML SubRedditvà Đăng kýnhận bản tin của chúng tôi. Chờ đã! Bạn đang dùng telegram? giờ bạn có thể tham gia cùng chúng tôi trên telegram.

Cần hợp tác với chúng tôi để quảng bá GitHub Repo hoặc Hugging Face Page hoặc Product Release hoặc Webinar?Kết nối với chúng tôi

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ Nhân tạo vì lợi ích xã hội. Dự án gần đây nhất của anh là ra mắt Nền tảng Truyền thông Trí tuệ Nhân tạo, Marktechpost, nổi bật với các bài viết chuyên sâu về học máy và học sâu vừa có tính kỹ thuật cao vừa dễ hiểu với nhiều đối tượng. Nền tảng này tự hào có hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó.

📎 Nguồn gốc: MarkTechPost Xem bài gốc →