Perplexity AI phát hành WANDR: Một chuẩn đánh giá mở dành cho các tác tử nghiên cứu phải tìm kiếm rộng và sâu
Các tác nhân nghiên cứu (research agents) hiện đã đảm nhận các công việc tri thức thực tế. Các nhóm ủy thác cho chúng việc lập bản đồ cạnh tranh, thẩm định và tổng quan tài liệu. Tuy nhiên, hầu hết các chuẩn đánh giá (benchmark) chỉ kiểm tra một câu trả lời duy nhất, chứ không phải các bộ sưu tập lớn dựa trên bằng chứng. Perplexity nhắm vào khoảng trống đó với một chuẩn đánh giá mở mới.
Perplexity đã phát hành **WANDR** (Wide ANd Deep Research - Nghiên cứu Rộng và Sâu). Đây là một chuẩn đánh giá mở và bộ công cụ đánh giá (evaluation harness). Nó được xây dựng dựa trên 500 nhiệm vụ thu thập dữ liệu thực tế, đầy thách thức cho công việc tri thức. WANDR là phiên bản "rộng" của chuẩn đánh giá DRACO dành cho nghiên cứu sâu của Perplexity. DRACO kiểm tra xem một tác nhân có tạo ra một báo cáo dài, chính xác, đầy đủ và khách quan hay không. WANDR thay vào đó kiểm tra xem nó có thể xây dựng một bộ sưu tập lớn kèm bằng chứng hay không.
Cốt lõi của WANDR là kiểm tra đồng thời hai yêu cầu. **Rộng** có nghĩa là khám phá một tập hợp lớn, thường là mở, các thực thể đủ điều kiện. **Sâu** có nghĩa là điều tra từng thực thể đủ để hỗ trợ mỗi tuyên bố bằng bằng chứng. Kết hợp cả hai thay đổi bài toán đối với các tác nhân. Một vài ví dụ hấp dẫn là chưa đủ ở đây. Một câu chuyện được trau chuốt dựa trên nghiên cứu không đầy đủ cũng không đạt yêu cầu.
Để nắm bắt điều này, WANDR sử dụng một **hệ thống phân cấp khóa đủ điều kiện** (qualification key hierarchy) có thể kết hợp. Một nhiệm vụ có thể yêu cầu `company(n) -> employee(m) -> url(k)`. Điều này có nghĩa là n công ty đủ điều kiện, m nhân viên mỗi công ty và k trang hỗ trợ mỗi nhân viên. Mọi đường dẫn hoàn chỉnh trong cây đều được xác thực độc lập. Cấu trúc tương tự có thể đại diện cho một danh sách phẳng, tìm kiếm lồng nhau hoặc ma trận.
Để minh họa cho hệ thống phân cấp đó, hãy xem xét nhiệm vụ `ceo_cfo_appointments` đã được công bố. Nhiệm vụ này yêu cầu ít nhất 70 công ty có trụ sở tại Mỹ. Mỗi công ty phải có một cuộc bổ nhiệm CEO hoặc CFO được công bố lần đầu tiên trong khoảng thời gian từ ngày 1 tháng 3 đến ngày 30 tháng 4 năm 2026. Đối với mỗi công ty, tác nhân cung cấp một trang thông báo bổ nhiệm có thẩm quyền. Một nhiệm vụ phụ bổ sung thêm một trang cơ quan niêm yết (listing-authority page) cho mỗi công ty. Tổng cộng, nhiệm vụ yêu cầu 140 bản ghi có nguồn gốc bằng chứng.
Cụ thể, hai hệ thống phân cấp và một bản ghi đã nộp trông như sau:
Ngoài các ví dụ đơn lẻ, WANDR xây dựng các nhiệm vụ từ việc sử dụng thực tế. Nó bắt đầu từ các mẫu đã được ẩn danh (de-identified patterns) quan sát được trong quá trình sản xuất, chứ không phải từ các lời nhắc tổng hợp (synthetic prompts). Một quy trình bán tự động sau đó biến các mẫu đó thành các nhiệm vụ. Quy trình này trải qua bốn giai đoạn: gieo mầm (seeding), biên soạn (authoring), tiếp nhận (admission) và quản lý (curation). Nó sử dụng một vòng lặp tác giả-phê bình (author-critic loop) xen kẽ với kiểm tra cơ học (mechanical linting).
Kết quả là, nhiệm vụ trung bình yêu cầu 50 thành viên và tổng cộng 245 bản ghi. Trên tất cả 500 nhiệm vụ, WANDR yêu cầu 170.495 bản ghi có nguồn gốc bằng chứng. Các nhiệm vụ được chia thành 167 nhiệm vụ khó thấp, 166 nhiệm vụ khó trung bình và 167 nhiệm vụ khó cao. Độ khó phụ thuộc vào công việc trên mỗi bản ghi, không chỉ riêng quy mô.
Không giống như các đáp án cố định, WANDR chấm điểm từng tuyên bố dựa trên bằng chứng được trích dẫn. Mỗi bản ghi chứa một mục (item), URL, các đoạn trích đã chọn (selected excerpts) và câu trả lời. Bộ chấm điểm (grader) sẽ tìm nạp lại trang trong quá trình đánh giá. Nó kiểm tra xem trang có thể sử dụng được và nằm trong phạm vi yêu cầu hay không. Sau đó, nó xác minh rằng các đoạn trích thực sự xuất hiện và hỗ trợ mọi yêu cầu.
Các phán quyết nhị phân này cho từng bản ghi sau đó được tổng hợp lên qua hệ thống phân cấp. **Độ chính xác (Precision)** đo lường chất lượng của những gì hệ thống đã nộp. **Độ thu hồi (Recall)** đo lường mức độ hoàn thành đã được điều chỉnh theo chất lượng, lấp đầy mọi thiếu hụt.
tất cả đều bằng 0. Softscore cho điểm một phần đối với các thành viên không hoàn chỉnh. Hardscores chỉ tính các thành viên có toàn bộ cây con chính xác.
Sử dụng phương pháp đó, Perplexity đã chạy sáu hệ thống sản xuất trên tất cả 500 tác vụ. Hệ thống Search as Code (SaC) của riêng họ dẫn đầu. Tuy nhiên, không có hệ thống nào tiến gần đến việc giải quyết benchmark.
Với nhiều nỗ lực hơn, Perplexity đạt 0,447 soft F1 ở cài đặt `xhigh`. Chi phí trên các cài đặt trải rộng hơn bốn bậc độ lớn. Nó dao động từ 0,03 đô la mỗi tác vụ lên đến 324,83 đô la mỗi tác vụ.
Ngoài bảng xếp hạng, bốn phát hiện nổi bật. Thứ nhất, tiến bộ một phần là phổ biến, nhưng phủ sóng hoàn toàn thì không. Mọi hệ thống đều cho thấy soft recall thấp hơn soft precision. Thứ hai, quy mô làm trầm trọng thêm vấn đề một cách rõ rệt. Các hệ thống phân cấp sâu hơn gây hại nhiều nhất, vì mỗi nhánh thêm một điểm thất bại. Thứ ba, khám phá là nút thắt cấu trúc đầu tiên. Mức độ hoàn thành khám phá cấp cao nhất dao động từ 0,611 đến 0,951 trên các hệ thống. Việc cung cấp thiếu, chứ không phải hợp nhất trùng lặp, giải thích cho hầu hết khối lượng bị thiếu. Thứ tư, tìm một trang có thể sử dụng thường dễ dàng. Biến nó thành bằng chứng hoàn chỉnh mới là phần khó. Đối với Perplexity, 41,4% trang bỏ lỡ một yêu cầu quan trọng. Ngoài ra, 57,5% đoạn trích không hỗ trợ đầy đủ tuyên bố. Soft F1 của nó giảm từ 0,531 dưới kiểm tra chỉ truy xuất xuống 0,363 dưới phán quyết đầy đủ.
Đáng chú ý, Search as Code phù hợp với hình dạng tác vụ này. Một agent có thể thể hiện logic truy xuất, lọc, phân nhánh, kết nối, khử trùng lặp và dừng dưới dạng một chương trình. Tính toán xác định sau đó xử lý các thao tác lặp đi lặp lại bên ngoài ngữ cảnh mô hình.
Trong thực tế, WANDR ánh xạ tới các công việc mà các nhóm đã tự động hóa. Một nhà phân tích thị trường cần mọi đối thủ cạnh tranh đủ điều kiện, với bằng chứng phù hợp cho từng đối thủ. Một nhóm thẩm định cần hàng chục công ty, sau đó là quyền sở hữu, giám đốc điều hành và tài chính. Tìm kiếm nhân tài cần nhiều ứng viên, mỗi ứng viên có các trang hồ sơ hỗ trợ. WANDR kiểm tra chính xác các mẫu thu thập rộng và sâu này ở quy mô chuyên nghiệp.
Bởi vì chấm điểm dựa trên từng bản ghi, các nhóm có thể xác định chính xác các lỗi. Cây điểm số cô lập tổn thất đến khám phá, làm giàu hoặc trích xuất bằng chứng. Chẩn đoán này giúp các kỹ sư cải thiện từng giai đoạn yếu một lúc.
Xem thêm Chi tiết kỹ thuật và Kho lưu trữ tại đây. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi và Đăng ký Nhận bản tin của chúng tôi. Chờ đã! Bạn đang dùng telegram? bây giờ bạn có thể tham gia cùng chúng tôi trên telegram.
Cần hợp tác với chúng tôi để quảng bá Kho lưu trữ GitHub hoặc Trang Hugging Face hoặc Phát hành Sản phẩm hoặc Hội thảo trực tuyến, v.v.? Kết nối với chúng tôi
Asif Razzaq là CEO của Marktechpost Media Inc. Với tư cách là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ Nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của anh ấy là ra mắt Nền tảng Truyền thông Trí tuệ Nhân tạo, Marktechpost, nổi bật với các bài đưa tin chuyên sâu về học máy và học sâu vừa có tính kỹ thuật vừa dễ hiểu đối với nhiều đối tượng. Nền tảng này tự hào có hơn 2 triệu lượt xem hàng tháng, minh họa cho sự phổ biến
tính phổ biến trong khán giả.


