Google DeepMind phát hành Gemma 4 12B: Mô hình đa phương thức không mã hóa với âm thanh gốc chạy trên laptop 16 GB
Google DeepMind vừa phát hành Gemma 4 12B, một mô hình đa phương thức dạng dense, loại bỏ hoàn toàn các bộ mã hóa truyền thống. Hình ảnh và âm thanh được đưa trực tiếp vào backbone của LLM. Kết quả là một mô hình có thể chạy các quy trình tác nhân trên laptop tiêu dùng với 16 GB RAM. Mô hình được phát hành dưới giấy phép Apache 2.0.
Gemma 4 12B là một transformer chỉ có bộ giải mã với 12 tỷ tham số. Nó xử lý văn bản, hình ảnh, âm thanh và video một cách tự nhiên. Không có bộ mã hóa hình ảnh hay âm thanh riêng biệt. Bộ giải mã sử dụng cấu trúc giống với mô hình Gemma 4 31B Dense. Nó lấp đầy khoảng cách giữa E4B thân thiện với thiết bị biên và biến thể MoE 26B lớn hơn.
Một mô hình phác thảo Multi-Token Prediction (MTP) chuyên dụng cũng được phát hành. Nó giảm độ trễ suy luận trên phần cứng cục bộ.
Mọi mô hình Gemma cỡ trung trước đây đều sử dụng bộ mã hóa Transformer riêng cho hình ảnh và âm thanh. Các bộ mã hóa đó làm tăng độ trễ và chi phí tham số. Các mô hình Gemma 4 cỡ trung mang một bộ mã hóa hình ảnh 550M tham số. Các mô hình E2B và E4B bao gồm một bộ mã hóa âm thanh 300M tham số. Tất cả điều đó đã biến mất trong phiên bản 12B.
Bộ nhúng hình ảnh (35M tham số): Hình ảnh thô được chia thành các mảnh 48×48 pixel. Mỗi mảnh được chiếu vào chiều ẩn của LLM bằng một phép nhân ma trận duy nhất. Không có lớp chú ý; mỗi mảnh được xử lý độc lập. Vị trí không gian được chèn bằng cách sử dụng tra cứu tọa độ phân tích: một ma trận X đã học và một ma trận Y đã học. Đối với một mảnh tại (x, y), mô hình tra cứu hai nhúng đã học và thêm chúng để tạo thành một vector vị trí. Vector này được thêm vào nhúng mảnh, sau đó chuẩn hóa. Đó là toàn bộ pipeline hình ảnh.
Chiếu sóng âm thanh: Âm thanh 16 kHz thô được cắt thành các khung 40 ms. Mỗi khung chứa 640 giá trị. Các giá trị đó được chiếu tuyến tính vào cùng không gian nhúng với các token văn bản. Không có trích xuất đặc trưng và không có lớp conformer. Rotary Position Embedding (RoPE) hiện có của LLM xử lý chuỗi thời gian 1-D. Bộ mã hóa âm thanh trong E2B và E4B đã sử dụng 12 lớp conformer. Tất cả điều đó đã bị loại bỏ.
Tầm quan trọng: Không gian trọng số thống nhất có nghĩa là bạn không còn đồng tinh chỉnh các bộ mã hóa đông lạnh riêng biệt nữa. Tinh chỉnh hạ nguồn với LoRA hoặc tinh chỉnh đầy đủ cập nhật xử lý hình ảnh, âm thanh và văn bản trong một lần duy nhất. Hugging Face Transformers và Unsloth đã hỗ trợ điều này.
Thiết kế không có bộ mã hóa giảm độ trễ đa phương thức. Backbone của LLM bắt đầu xử lý ngay lập tức. Không cần bộ mã hóa nào phải hoàn thành trước.
Nhóm Google DeepMind chưa công bố kết quả benchmark đầy đủ trong tài liệu ra mắt ban đầu. Ghi chú phát hành chính thức cho biết mô hình 12B hoạt động gần với mô hình MoE 26B trên các benchmark tiêu chuẩn, với ít hơn một nửa tổng bộ nhớ.
Các khả năng đã được chứng minh của mô hình bao gồm:
Trong ứng dụng Google AI Edge Eloquent của chính Google, việc chuyển sang Gemma 4 12B đã tạo ra bước nhảy vọt hơn 60% về chất lượng tổng thể, với cải thiện về khả năng tuân theo hướng dẫn và phạm vi.
Một transformer chỉ có bộ giải mã với 12 tỷ tham số, loại bỏ các bộ mã hóa hình ảnh và âm thanh riêng biệt. Hình ảnh và âm thanh được đưa trực tiếp vào backbone của LLM. Nó chạy cục bộ trên laptop 16 GB dưới giấy phép Apache 2.0.
Xem Trọng số Mô hình và Chi tiết Kỹ thuật. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi và Đăng ký Nhận bản tin của chúng tôi. Chờ đã! Bạn có trên telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo hoặc Hugging Face Page hoặc Product Release hoặc Webinar của bạn? Kết nối với chúng tôi
Asif Razzaq là t
Giám đốc điều hành của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ Nhân tạo vì lợi ích xã hội. Dự án gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ Nhân tạo, Marktechpost, nổi bật với các bài tin tức chuyên sâu về học máy và học sâu, vừa có tính kỹ thuật vững chắc vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào có hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó trong cộng đồng người dùng.


