XPENG phát hành TuringViT cho lái xe thông minh và robot hình người
XPENG đã công bố TuringViT, một bộ mã hóa thị giác dành cho các mô hình ngôn ngữ-thị giác và ngôn ngữ-thị giác-hành động được sử dụng trong hệ thống lái thông minh, hệ thống cabin thông minh và chương trình robot hình người IRON của hãng.
XPENG cung cấp hai phiên bản TuringViT-18L và TuringViT-24L. Ở độ phân giải 1536×1536, công ty cho biết TuringViT-18L đạt thông lượng gấp 3,04 lần Seed1.5-ViT và gấp 2,16 lần SigLIP2-ViT-L.
XPENG cho biết mô hình này được huấn luyện trên 850 triệu cặp văn bản-hình ảnh và đạt điểm trung bình 83,6% trên sáu bài kiểm tra zero-shot, vượt qua các mô hình nguồn mở cơ sở được huấn luyện trên 10 tỷ mẫu. [IT Home, bằng tiếng Trung]
📎 Nguồn gốc: TechNode
Xem bài gốc →


