MarkTechPost

Xây dựng Hệ thống Đa tác tử theo Phong cách VideoAgent: Phân tích Ý định, Lập kế hoạch Đồ thị và Định tuyến Công cụ cho các Tác vụ Chỉnh sửa Video

🕐 20/07/2026 09:32 📰 MarkTechPost ✅ Đã dịch sang tiếng Việt

Trong hướng dẫn này, chúng tôi xây dựng một bản tái hiện có thể chạy được của quy trình VideoAgent, tập trung vào pipeline tác nhân cốt lõi đằng sau việc hiểu video, truy xuất, chỉnh sửa và tái tạo. Chúng tôi bắt đầu bằng cách cấu hình một môi trường nhẹ hoạt động mà không cần khóa API. Chúng tôi định nghĩa một trình phân tích ý định, một thư viện tác nhân, một bộ định tuyến công cụ, một bộ lập kế hoạch đồ thị và một bộ tối ưu hóa gradient văn bản để sửa các phụ thuộc bị thiếu trong đồ thị thực thi. Chúng tôi cũng kết nối các thành phần lập kế hoạch này với các công cụ xử lý video thực tế, bao gồm FFmpeg, phiên âm dựa trên Whisper, phát hiện cảnh, lấy mẫu khung hình chính, chú thích, lập chỉ mục đa phương thức, truy xuất, cắt, chỉnh sửa đồng bộ nhịp và kết xuất cuối cùng. Vào cuối hướng dẫn, chúng tôi có một hệ thống video đa tác nhân hoàn chỉnh có thể trả lời các câu hỏi về video, tóm tắt nội dung của nó, tạo tổng quan theo phong cách tin tức và tạo ra các sản phẩm video đã chỉnh sửa từ các hướng dẫn ngôn ngữ tự nhiên.

Chúng tôi bắt đầu bằng cách cấu hình thời gian chạy VideoAgent, backend LLM tùy chọn, thư mục làm việc, luồng cài đặt gói và các dự phòng phụ thuộc nhẹ. Chúng tôi tạo một lớp trợ giúp dùng chung cho các lệnh shell, cài đặt pip, đường dẫn tệp và phát hiện môi trường để notebook chạy mượt mà trong Colab hoặc cục bộ. Chúng tôi cũng định nghĩa một trình bao bọc LLM thống nhất hỗ trợ OpenAI, DeepSeek, Anthropic và Gemini, đồng thời dự phòng an toàn sang thực thi xác định khi không có khóa API.

Chúng tôi định nghĩa không gian ý định đầy đủ, đầu vào người dùng, sổ đăng ký tác nhân chuyên biệt, tác nhân đầu cuối và bộ tạo đầu ra tạo nên từ vựng lập kế hoạch cốt lõi của hệ thống. Chúng tôi phân tích từng hướng dẫn ngôn ngữ tự nhiên thành các khả năng video cần thiết như phiên âm, tóm tắt, truy xuất, kết xuất hoặc chỉnh sửa đồng bộ nhịp. Sau đó, chúng tôi định tuyến các công cụ và xây dựng một đồ thị tác nhân ban đầu, thông qua kế hoạch do LLM tạo hoặc kế hoạch chỉ dành cho đầu cuối xác định mà bộ tối ưu hóa sau đó sửa chữa.

Chúng tôi triển khai logic phân tích và tối ưu hóa đồ thị để kiểm tra các cạnh, thứ tự tô pô, các thành phần kết nối, đầu vào bị thiếu, phạm vi ý định và khả năng tương thích. Chúng tôi tính toán các tổn thất cấu trúc và căn chỉnh bằng cách sử dụng τ, κ và χ để hệ thống có thể đo lường liệu đồ thị hiện tại có thể thực thi và hoàn chỉnh về mặt ngữ nghĩa hay không. Sau đó, chúng tôi áp dụng các sửa chữa kiểu gradient văn bản bằng cách chèn các tác nhân tạo bị thiếu và cuối cùng thực thi đồ thị đã tối ưu hóa thông qua một bảng đen dùng chung của các đầu ra trung gian.

Chúng tôi xây dựng các công cụ xử lý video và đa phương thức cấp thấp hơn để trích xuất âm thanh, phiên âm giọng nói, phát hiện nhịp điệu, xác định cảnh, lấy mẫu khung hình chính và tạo chú thích. Chúng tôi sử dụng FFmpeg, Whisper, các nhúng kiểu CLIP, phát hiện cảnh dựa trên biểu đồ và logic dự phòng mạnh mẽ để pipeline vẫn có thể chạy được ngay cả khi các mô hình nặng hơn không khả dụng. Chúng tôi cũng tạo một chỉ mục đa phương thức căn chỉnh các chú thích, khung hình chính, đoạn phiên âm và nhúng để chỉnh sửa video dựa trên truy xuất sau này.

Chúng tôi triển khai các tác nhân cấp cao hơn để biến nội dung video đã lập chỉ mục thành các truy vấn storyboard, cảnh được truy xuất, clip đã cắt, video đã chỉnh sửa, tóm tắt, câu trả lời, tổng quan và đầu ra kết xuất cuối cùng. Chúng tôi kết hợp truy xuất, độ tương tự cosine, cắt FFmpeg, nối clip, lắp ráp montage nhận biết nhịp, tóm tắt phiên âm và VideoQA thành một lớp công cụ phối hợp duy nhất. Sau đó, chúng tôi liên kết mọi triển khai trở lại sổ đăng ký tác nhân và bao bọc toàn bộ quy trình bên trong lớp VideoAgent để thực thi từ đầu đến cuối.

Chúng tôi tạo một video demo khép kín với tổng hợp v

Hình ảnh, tường thuật, thời gian phụ đề dự phòng và hướng dẫn ví dụ được xác định trước cho QA, tạo tổng quan, chỉnh sửa điểm nhấn và chỉnh sửa đồng bộ nhịp. Chúng tôi cung cấp một công cụ hỗ trợ xem trước để các tệp MP4 được tạo có thể hiển thị trực tiếp trong Colab hoặc Jupyter khi được hỗ trợ. Chúng tôi kết thúc bằng hàm main() để xây dựng video demo, chạy các bản demo VideoAgent đã chọn, in các tạo phẩm được tạo và trình bày cách chuyển sang video của riêng chúng tôi hoặc backend do LLM điều khiển.

Tóm lại, chúng tôi đã tái tạo thành công các ý tưởng chính của VideoAgent dưới dạng một hướng dẫn Colab nhỏ gọn, có thể thực thi, minh họa cách lập kế hoạch dựa trên tác nhân có thể phối hợp nhiều công cụ hiểu và chỉnh sửa video. Chúng tôi đã chuyển từ hướng dẫn người dùng sang phân tích ý định, định tuyến các công cụ cần thiết, xây dựng và tối ưu hóa đồ thị tác nhân, và thực thi từng nút thông qua một bảng đen chia sẻ các đầu ra trung gian. Điều này cho chúng tôi cái nhìn rõ ràng về cách các tác vụ video phức tạp có thể được phân rã thành các tác nhân chuyên biệt trong khi vẫn đủ thực tế để chạy trong môi trường notebook nhẹ. Chúng tôi kết thúc với một hệ thống hoạt động không chỉ giải thích và tóm tắt nội dung video mà còn tạo ra các chỉnh sửa điểm nhấn và đồng bộ nhịp, cho thấy thiết kế đa tác nhân có cấu trúc có thể biến đầu vào video thô thành các đầu ra đa phương thức hữu ích như thế nào.

Xem toàn bộ mã nguồn tại đây. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit hơn 150k+ ML của chúng tôi và Đăng ký Nhận bản tin. Chờ đã! Bạn có dùng Telegram không? Bây giờ bạn có thể tham gia cùng chúng tôi trên Telegram.

Cần hợp tác với chúng tôi để quảng bá GitHub Repo, Hugging Face Page, Phát hành Sản phẩm, Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Sana Hassan, thực tập sinh tư vấn tại Marktechpost và sinh viên chương trình kép tại IIT Madras, đam mê ứng dụng công nghệ và AI để giải quyết các thách thức thực tế. Với sự quan tâm sâu sắc đến việc giải quyết các vấn đề thực tiễn, anh mang đến một góc nhìn mới mẻ về sự giao thoa giữa AI và các giải pháp thực tế.

📎 Nguồn gốc: MarkTechPost Xem bài gốc →