Sakana AI thương mại hóa AB-MCTS trong Sakana Marlin, một tác nhân doanh nghiệp có khả năng tạo ra các báo cáo nghiên cứu dài tới 100 trang kèm slide thuyết trình.
Sakana AI có trụ sở tại Tokyo đã ra mắt sản phẩm thương mại đầu tiên 'Sakana Marlin' trong tuần này. Nhóm Sakana định vị nó như một CSO (Giám đốc Chiến lược) ảo. Đây là một tác nhân nghiên cứu tự động B2B được xây dựng cho doanh nghiệp.
Marlin không trả lời trong vài giây như chatbot. Bạn đưa cho nó một chủ đề nghiên cứu. Sau đó, nó tự động chạy trong tối đa khoảng tám giờ. Mỗi lần chạy trả về một báo cáo dài cùng với một bộ slide thuyết trình. Sakana cho biết một phiên duy nhất thực hiện hàng trăm đến hàng nghìn truy vấn LLM.
Marlin là một tác nhân nghiên cứu doanh nghiệp, không phải trợ lý trò chuyện. Bạn đưa cho nó một chủ đề hoặc câu hỏi. Sau đó, nó tự lập kế hoạch giả thuyết, duyệt nguồn và xác minh kết quả. Nó nén hàng tuần công việc chiến lược thành vài giờ.
Kết quả đầu ra được cấu trúc cho người ra quyết định. Thông báo bằng tiếng Nhật mô tả các báo cáo dài hàng chục trang. Thông báo bằng tiếng Anh đề cập đến các báo cáo dài tới khoảng 100 trang. Tại một buổi trải nghiệm thực tế, các báo cáo dài 60–100 trang và trích dẫn 60–80 nguồn. Mỗi báo cáo bao gồm phần nội dung chính, tài liệu tham khảo và phụ lục. Các slide thuyết trình được tạo bằng AI tạo hình ảnh.
Nhóm Sakana đã tinh chỉnh Marlin thông qua bản beta kín vào tháng 4 năm 2026. Khoảng 300 chuyên gia đã thử nghiệm nó trên các nhiệm vụ thực tế trong bản beta đó. Các nhiệm vụ này bao gồm xây dựng chiến lược, nghiên cứu thị trường, phân tích rủi ro và phân tích cạnh tranh. Sakana cũng đã hợp tác với MUFG và nhận đầu tư chiến lược từ Citigroup.
Xương sống của Marlin là AB-MCTS, hay Tìm kiếm Cây Monte Carlo Phân nhánh Thích ứng. Nó đến từ nghiên cứu trước đây của Sakana 'Rộng hơn hay Sâu hơn? Mở rộng Tính toán Thời gian Suy luận LLM với Tìm kiếm Cây Phân nhánh Thích ứng.'
AB-MCTS coi suy luận như một bài toán tìm kiếm cây. Tại mỗi bước, thuật toán đưa ra một quyết định. Nó có thể mở rộng bằng cách tạo ra một câu trả lời ứng viên mới. Hoặc nó có thể đi sâu hơn bằng cách tinh chỉnh một câu trả lời hiện có đầy hứa hẹn. Lấy mẫu lặp lại tiêu chuẩn chỉ mở rộng song song, sau đó hy vọng một câu trả lời đúng.
Một biến thể đa LLM thêm một lựa chọn thứ hai. Nó có thể chuyển hướng một bước sang một mô hình khác hoàn toàn. Trong các thí nghiệm ARC-AGI-2 được báo cáo của Sakana, sự hợp tác này đã giúp ích. Kết hợp o4-mini, Gemini 2.5 Pro và DeepSeek-R1 đã giải quyết được khoảng 27,5% nhiệm vụ. Riêng mô hình o4-mini giải quyết được khoảng 23%. Marlin áp dụng cùng một tìm kiếm thích ứng cho nghiên cứu dài hạn.
Thành phần chính thứ hai cho Marlin là tự động hóa quy trình làm việc từ dự án AI Scientist của Sakana. Dự án đó đã chứng minh khám phá khoa học tự động và được công bố trên Nature.
Bản demo tương tác: Widget nhúng (marlin-abmcts-demo.html) hiển thị quyết định 'rộng hơn hay sâu hơn' trực tiếp. Nhấn Run và xem cây phát triển. Các nút xanh hơn mang điểm cao hơn, và đường dẫn tốt nhất được tô sáng. Bật 'Multi-LLM' để xem các bước được chuyển hướng qua các mô hình khác nhau.
Marlin cạnh tranh về chiều sâu, không phải tốc độ. Các công cụ nghiên cứu sâu thông thường trả lời trong vài phút đến vài chục phút. Marlin cố tình dành hàng giờ để nâng cao chất lượng đầu ra. Thời gian chạy của đối thủ cạnh tranh dưới đây là gần đúng và được báo cáo, không phải số liệu chính thức.
Sự đánh đổi là rõ ràng. Bạn chờ lâu hơn và trả tiền cho mỗi lần chạy. Đổi lại, bạn có được kiểm tra giả thuyết sâu hơn và một kết quả đầu ra hoàn chỉnh. Bạn có thể hủy một lần chạy bất kỳ lúc nào, nhưng tín dụng vẫn bị tiêu hao.
Sakana cung cấp gói trả theo nhu cầu cùng với các gói Pro, Team và Enterprise. Trả theo nhu cầu bắt đầu từ 100 tín dụng mỗi lần chạy, với giá ¥98 mỗi tín dụng. Pro là ¥150.000 mỗi tháng và bao gồm 2.000 tín dụng. Team là ¥400.000 mỗi tháng và bao gồm 6.000 tín dụng. Giá Enterprise là tùy chỉnh, với hỗ trợ riêng.
Marlin phù hợp với các nhiệm vụ nghiên cứu chiến lược có giá trị cao, nơi chiều sâu và độ chính xác quan trọng hơn tốc độ phản hồi nhanh.
Nhận các câu hỏi mà nghiên cứu là nút thắt cổ chai. Dưới đây là các ví dụ cụ thể lấy từ các tác vụ mục tiêu của nó.
Mỗi ví dụ khớp với một prompt và một lần chạy không giám sát. Một người vẫn xem xét đầu ra được trích dẫn trước khi đưa ra bất kỳ quyết định nào.
Bạn không thể tự lưu trữ Marlin. Nhưng bạn có thể chạy thuật toán cốt lõi của nó ngay hôm nay. Sakana đã mã nguồn mở AB-MCTS dưới tên TreeQuest theo giấy phép Apache 2.0. Cài đặt nó, định nghĩa một hàm generate, sau đó chạy với ngân sách tìm kiếm cố định.
Thay điểm số ngẫu nhiên bằng một LLM judge để tái tạo mẫu thực tế. TreeQuest cũng đi kèm tìm kiếm đa LLM và checkpointing cho các phiên chạy dài. Checkpointing quan trọng vì các phiên dài có thể gặp lỗi API giữa chừng.
Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ Nhân tạo vì lợi ích xã hội. Dự án gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ Nhân tạo, Marktechpost, nổi bật với các bài viết chuyên sâu về tin tức học máy và học sâu vừa có tính kỹ thuật vừa dễ hiểu đối với nhiều đối tượng. Nền tảng này tự hào có hơn 2 triệu lượt xem hàng tháng, cho thấy sự phổ biến của nó với khán giả.


