MarkTechPost

Gặp gỡ LingBot-World-Infinity: Một Mô hình Thế giới Nhân quả Mở với Bộ điều khiển Tác nhân

🕐 20/07/2026 09:32 📰 MarkTechPost ✅ Đã dịch sang tiếng Việt

Robbyant, đơn vị trí tuệ nhúng của Ant Group, đã phát hành LingBot-World-Infinity (LingBot-World 2.0). Đây là mô hình sinh video nhân quả hoạt động như một bộ mô phỏng thế giới tương tác. Đây là cách nhóm nghiên cứu giải quyết hai chế độ thất bại: trôi dạt tầm xa và độ trễ tương tác.

Mô hình thế giới tương tác sinh video từng khung hình, dựa trên luồng hành động của người dùng. Mỗi trạng thái chỉ phụ thuộc vào các khung hình trước và đầu vào hiện tại. Nhóm nghiên cứu chính thức hóa điều này thành phân tích nhân quả:

Ở đây x_t là trạng thái hình ảnh tại thời điểm t. Hành động a_t kết hợp giữa tư thế camera và lời nhắc văn bản. Tư thế camera sử dụng nhúng Plücker, được đưa vào thông qua chuẩn hóa lớp thích ứng (AdaLN). Văn bản được đưa vào dưới dạng lời nhắc theo khối thông qua cross-attention.

Mô hình chính có 14B tham số. Một phiên bản nhẹ 1.3B được mô tả là có thể triển khai trên một GPU duy nhất.

Đóng góp cốt lõi là Mặt nạ Chú ý Hỗn hợp Hai chiều và Tự hồi quy (MoBA). Nó giải thích hiện tượng trôi dạt.

Huấn luyện video tự hồi quy tiêu chuẩn sử dụng mặt nạ ép buộc giáo viên. Mỗi khung hình nhiễu chú ý đến chính nó và bối cảnh sạch của nó. Nhóm nghiên cứu phát hiện ra một lỗi ở đây. Khi bối cảnh phát triển, mô hình dựa vào bối cảnh đó thay vì dự đoán các khung hình tương lai. Kết quả là quá khớp và suy giảm chất lượng hình ảnh.

MoBA thêm một khối chú ý hai chiều đầy đủ vào mặt nạ ép buộc giáo viên. Khối đó hoạt động như một bộ điều chỉnh. Nó cũng giúp mô hình xử lý việc sinh độ dài linh hoạt.

Mặt nạ cross-attention phản ánh sự phân chia. Thành phần tự hồi quy chú ý đến lời nhắc nền cùng với các lời nhắc theo khối theo mô hình tam giác dưới. Điều đó ngăn ngữ nghĩa tương lai rò rỉ ngược lại. Thành phần hai chiều chú ý đến một lời nhắc toàn cầu.

Tiền huấn luyện tối ưu hóa mục tiêu khớp dòng có điều kiện với nội suy dòng chỉnh lưu. Sau đó, hậu huấn luyện nén giáo viên nhiều bước thành học sinh ít bước:

Chi tiết quan trọng nằm ở DMD. Nhóm nghiên cứu áp dụng nó trên các quỹ đạo tự chạy dài, không chỉ các trạng thái ép buộc giáo viên. Do đó, học sinh được tối ưu hóa trên phân phối trạng thái mà các dự đoán của chính nó tạo ra. Đó là cơ chế được nêu ra đằng sau chống trôi dạt.

Một bộ dự đoán khung hình không tự chơi. Nhóm nghiên cứu Robbyant bọc bộ sinh trong Khung mô phỏng đồng điều hành Đạo diễn-Pilot.

Như được mô tả trong bài báo nghiên cứu, Mô hình Ngôn ngữ-Thị giác là Đạo diễn. Nó quản lý các quy tắc ngữ nghĩa vĩ mô và suy luận nhân quả. Bộ sinh video Biến đổi Khuếch tán là Pilot. Nó mô phỏng động lực vật lý cấp thấp và kết xuất các chuyển tiếp.

Chế độ A: Tương tác Ngữ nghĩa Trực tiếp. VLM đọc khung hình hiện tại và tạo thẻ sự kiện. Không yêu cầu mặt nạ đối tượng.

Chế độ B: Tương tác Đối tượng Hỗ trợ Theo dõi. Một vòng lặp đề xuất hành động dựa trên SAM (Mô hình Phân đoạn Bất kỳ) theo dõi các đối tượng qua các khối. Người dùng chọn một đối tượng được theo dõi và kích hoạt hành động. Bài báo nghiên cứu cho thấy các quỹ đạo mở cửa và xoay bóng.

Người dùng cũng có thể can thiệp bằng văn bản. Thay đổi trạng thái toàn cầu thay đổi thời gian trong ngày hoặc thời tiết. Chèn thực thể cục bộ sinh ra sinh vật, và VLM chọn các điểm vào khả thi.

Giao diện tuân theo quy ước trò chơi. WASD điều khiển di chuyển, IJKL điều khiển góc nhìn. Space kích hoạt nhảy; P kích hoạt lượn cánh. Phím U và O thực hiện các hành động nhân vật do VLM đề xuất. Phím F và G thực hiện các sự kiện môi trường. Các phím số là các khe sự kiện do người dùng đăng ký.

Kỳ vọng cần được hiệu chỉnh ở đây.

Cơ sở mã được xây dựng trên Wan2.2. Chỉ có lingbot-world-v2-14b-causal-fast.

Có thể tải xuống ngay hôm nay. Các biến thể 14B được tiền huấn luyện nhân quả, 14B hai chiều và cả hai biến thể 1.3B được đánh dấu TODO.

Tệp `generate.py` được cung cấp chạy suy luận nhân quả với bộ nhớ đệm KV. Nó xử lý các khung hình theo từng đoạn thay vì xử lý tất cả cùng lúc. Lệnh tham chiếu là tám GPU và 480P:

Script tham chiếu được phát hành là 480×832 trên tám GPU. Con số 60 fps mô tả luồng đã triển khai, luồng này đi qua một bộ tinh chỉnh không gian-thời gian. Bộ tinh chỉnh đó tăng mẫu các khung hình đã giải mã, sau đó tổng hợp các khung hình trung gian để đạt tốc độ khung hình cao hơn. Cả hai giai đoạn đều được biên dịch thành các engine TensorRT.

Một checkpoint Diffusers cũng tồn tại:

Đối với một đường dẫn được lưu trữ, Reactor phục vụ mô hình dưới dạng `reactor/lingbot-world-2`. Tài liệu của nó liệt kê 48 fps ở 1664×960. Các phiên làm việc được điều khiển bằng lệnh và có trạng thái:

Chuyển động là trạng thái liên tục, không phải xung. `set_move_longitudinal: “forward”` điều khiển cho đến khi bạn gửi “idle”. Các lệnh sẽ đến tại ranh giới đoạn tiếp theo.

So sánh trong bài báo nghiên cứu là định tính. Mọi tuyên bố về tính ưu việt đều dựa trên các lưới khung hình song song.

Hãy xem Bài báo, Kho lưu trữ GitHub, Trang dự án và Trọng số mô hình. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi và Đăng ký Bản tin của chúng tôi. Chờ đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Cần hợp tác với chúng tôi để quảng bá Kho lưu trữ GitHub hoặc Trang Hugging Face hoặc Phát hành sản phẩm hoặc Hội thảo trực tuyến, v.v.? Kết nối với chúng tôi

Lưu ý: Cảm ơn nhóm Nghiên cứu Ant vì tư duy lãnh đạo/Tài nguyên cho bài viết này. Nhóm Nghiên cứu Ant đã hỗ trợ nội dung/bài viết này để quảng bá.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Dự án gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ Nhân tạo, Marktechpost, nổi bật với các bài đưa tin chuyên sâu về học máy và học sâu, vừa có tính kỹ thuật vừa dễ hiểu đối với nhiều đối tượng. Nền tảng này tự hào có hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với khán giả.

📎 Nguồn gốc: MarkTechPost Xem bài gốc →