AI Vẫn Chưa Thông Minh Hơn Một Em Bé—Ít Nhất Là Hiện Tại
Nếu bạn cho rằng một mô hình trí tuệ nhân tạo chạy trên hàng nghìn con chip máy tính tiên tiến là thông minh, hãy để tôi giới thiệu cho bạn khái niệm về một đứa trẻ 1 tuổi.
Đúng vậy, trẻ sơ sinh có thể không viết được chương trình máy tính, giải được các bài toán cao cấp hay tranh luận về các ý tưởng triết học. Nhưng không giống như các mô hình AI ngày nay, tiêu thụ một lượng dữ liệu huấn luyện khổng lồ như đại dương và năng lượng nhiều như một quốc gia nhỏ, trẻ em học cách hiểu thế giới với hiệu quả đáng kinh ngạc. Chúng nhận diện các vật thể mới sau khi nhìn thấy chúng một hoặc hai lần, và học thông qua quan sát thoáng qua cùng tương tác vật lý.
Khi nói đến việc cải thiện AI, trẻ em—và cấu trúc bộ não của chúng—có thể nắm giữ những hiểu biết quan trọng. Xây dựng một phiên bản AI giống trẻ em hơn có thể làm giảm chi phí và mức tiêu thụ năng lượng của các mô hình tiên tiến, và cũng có thể hữu ích nếu robot hỗ trợ AI học về môi trường của chúng một cách tự nhiên hơn.
Để khám phá ranh giới mới đầy táo bạo này, các nhà nghiên cứu tại Meta, Đại học Stanford, Đại học Tokyo và École Normale Supérieure của Pháp đã phát triển một bài kiểm tra mới nhằm làm nổi bật kỹ năng học tập của trẻ em và thúc đẩy các nhà nghiên cứu AI thiết kế các thuật toán tương xứng.
Thử thách EgoBabyVLM đánh giá mức độ hiệu quả của các mô hình ngôn ngữ thị giác (VLM), vốn học từ cả văn bản và hình ảnh, trong việc hiểu thế giới như cách một đứa trẻ nhìn thấy. Nó yêu cầu một mô hình mô tả thế giới sau khi tiếp nhận khoảng một nghìn giờ video thu thập từ các camera gắn trên đầu của trẻ sơ sinh và trẻ mới biết đi. (Vâng, thực sự là như vậy.)
Hóa ra, các mô hình tiên tiến thất bại thảm hại khi được cung cấp đoạn video thực tế và lộn xộn này, điều này gợi ý rằng có thể có điều gì đó khác biệt trong thiết kế của bộ não trẻ em, cho phép nó học nhanh chóng từ rất ít thông tin.
Thay vì các bộ dữ liệu được tuyển chọn, trẻ em học từ một góc nhìn vạn hoa về mọi thứ: cha mẹ nói về các vật thể không còn hiện hữu, chỉ vào thứ gì đó bằng ánh mắt hoặc cử chỉ, hoặc thảo luận về các sự kiện trong quá khứ hay tương lai thay vì những gì đang xảy ra ngay lúc đó. Trẻ em không chỉ học từ ngôn ngữ mà còn từ trải nghiệm đa phương thức và xúc giác phong phú, theo Michael Frank, một nhà khoa học nhận thức tại Đại học Stanford chuyên về học ngôn ngữ và tham gia vào quá trình phát triển EgoBabyVLM.
Bài kiểm tra cho thấy rằng khi nói đến AI, "rõ ràng là cần nhiều hơn [chỉ ngôn ngữ]", Frank nói.
EgoBabyVLM chỉ là ví dụ mới nhất về cách các nhà khoa học sử dụng AI để khám phá trí thông minh con người. Một thử thách có tên BabyLM, được giới thiệu vào năm 2023, yêu cầu các mô hình AI học cú pháp ngôn ngữ bằng cách sử dụng lượng dữ liệu tương đương với những gì một đứa trẻ 10 tuổi tiếp nhận—hàng chục triệu từ, so với hàng nghìn tỷ từ đối với các mô hình AI. Đáng chú ý, hóa ra các mô hình AI dựa trên transformer—vốn xử lý ngôn ngữ bằng cách chú ý đến mối quan hệ giữa các từ trong các câu khác nhau—có thể làm điều này khá tốt, một phát hiện thách thức các ý tưởng của Noam Chomsky về cách cú pháp có thể được hình thành.
được kết nối trực tiếp vào não người.
Ryan Cotterell, một nhà ngôn ngữ học tại ETH Zurich, người đầu tiên phát triển BabyLM, cho biết tình hình lại khác khi nói đến việc hiểu thế giới vật lý. "Sẽ không có một kho dữ liệu lớn về các tương tác của con người—không có internet cho các tương tác của con người," ông nói.
Joshua Tenenbaum, một nhà khoa học nhận thức tại Viện Công nghệ Massachusetts, lưu ý rằng BabyLM cho thấy các mô hình không tiếp thu được "kiến thức thông thường" về thế giới vật lý, động lực xã hội, hay lý thuyết về tâm trí.
"Transformers rất giỏi trong việc tìm ra các mẫu hình trong dữ liệu," Tenenbaum nói. "Nhưng có vẻ như các hệ thống học thuần túy dựa trên mẫu hình không thể tiếp nhận loại dữ liệu mà một em bé hoặc một đứa trẻ nhận được và học được tất cả những điều chúng làm."
Một câu hỏi dai dẳng là liệu quá trình tiến hóa có tìm ra cách tối ưu hóa các kỹ năng học tập nhất định ở con người và các loài động vật khác, hay liệu các thuật toán học tập đơn giản có thể làm được mọi thứ chúng ta làm hay không. "Có rất nhiều tranh luận trong khoa học nhận thức và khoa học thần kinh về việc có bao nhiêu thứ được xây dựng sẵn trong não bộ từ góc độ tiến hóa," Tenenbaum nói. "Bộ não cực kỳ phức tạp, và có rất nhiều cấu trúc và kiến trúc được xây dựng sẵn."
Vào năm 2024, các nhà nghiên cứu đã chỉ ra rằng một VLM cơ bản có thể học những thứ đơn giản, chẳng hạn như quả bóng là gì, chỉ bằng cách tiêu thụ dữ liệu được ghi lại từ đầu của một em bé duy nhất. Nhưng điều này còn xa mới đạt được khả năng suy luận về thế giới theo những cách tinh vi. "Bí ẩn là làm thế nào trẻ em đạt được những khả năng đầy đủ mà chúng có, ngay cả ở tuổi lên 2," Brendan Lake, một nhà khoa học nhận thức tại Đại học Princeton, người tham gia dự án, cho biết.
Các tác giả của bài báo EgoBabyVLM gợi ý rằng việc vay mượn các ý tưởng khác nhau từ khoa học nhận thức và khoa học thần kinh có thể thúc đẩy tiến bộ hướng tới các thuật toán học tập giống con người hơn. Điều này bao gồm việc thiết kế các mô hình có thể chú ý trong thời gian dài hơn và có thể diễn giải các tín hiệu xã hội.
Frank từ Stanford đã chỉ ra rằng các phương pháp tiếp cận mới có thể đưa chúng ta đến gần hơn với AI giống em bé. Đầu năm nay, ông và các đồng nghiệp đã thử nghiệm một loại mô hình mới, thành thạo trong việc học quan hệ nhân quả, thị giác và thời gian—hay cách các vật thể ảnh hưởng lẫn nhau theo thời gian—sử dụng cùng dữ liệu video từ đầu em bé. Họ phát hiện ra rằng mô hình mới có thể học về động lực của các vật thể khác nhau, một nền tảng cho suy luận vật lý, hiệu quả hơn nhiều.
Đó là một khả năng hấp dẫn: Có lẽ các mô hình có xu hướng học nhanh hơn về những thứ như vật lý và các mối quan hệ xã hội có thể là những người học hiệu quả hơn về tổng thể.
"EgoBabyVLM là một thử thách tuyệt vời," Lake nói. "Tôi rất hào hứng để xem những loại kiến trúc, phương pháp tiếp cận và thành phần mới nào mà các nhà nghiên cứu sẽ nghĩ ra."
Đây là một số bài của bản tin AI Lab của Will Knight. Đọc các bài trước đó tại đây.


