Feyn AI phát hành SQRL, một dòng mô hình Text-to-SQL có khả năng kiểm tra cơ sở dữ liệu trước khi viết truy vấn.
Hầu hết các hệ thống text-to-SQL xem nhiệm vụ này như một bản dịch. Feyn AI (startup được YC hậu thuẫn) đã tái định hình nó xoay quanh việc kiểm tra. Nhóm Feyn đã phát hành SQRL, một dòng mô hình chuyển đổi câu hỏi ngôn ngữ tự nhiên thành SQL. Thay vì tạo truy vấn ngay lập tức, SQRL có thể kiểm tra cơ sở dữ liệu trước. Điều này cho phép nó giải quyết sự mơ hồ và chỉ viết các truy vấn mà dữ liệu thực sự hỗ trợ.
Nhóm Feyn báo cáo rằng mô hình chủ lực SQRL-35B-A3B đạt độ chính xác thực thi 70,6% trên BIRD Dev. Con số này vượt qua Claude Opus 4.6 ở mức 68,77% trong cùng một đánh giá. Ba điểm kiểm tra được phát hành công khai trên Hugging Face: SQRL-4B, SQRL-9B và SQRL-35B-A3B.
Text-to-SQL thường được mô tả như một bài toán dịch thuật, nhưng cách đóng khung đó bỏ qua phần khó nhất. Một truy vấn có thể là SQL hoàn toàn hợp lệ nhưng vẫn trả về kết quả sai. Nó có thể kết nối sai bảng, đọc sai cột mơ hồ, hoặc lọc các giá trị không tồn tại. Không lỗi nào trong số này gây ra lỗi cú pháp, vì vậy không lỗi nào bị phát hiện chỉ bằng cách thực thi.
Thông tin lược đồ không ngăn được chúng. Một lược đồ liệt kê các bảng, cột, kiểu dữ liệu và đôi khi là các mối quan hệ. Nó không tiết lộ liệu một quận được lưu trữ là Alameda, Alameda County hay ALAMEDA. Nó không thể cho bạn biết phép kết nối nào tạo ra các hàng trùng lặp.
Điểm chuẩn BIRD làm cho những thất bại này có thể đo lường được. Cơ sở dữ liệu của nó bao gồm các lĩnh vực thực tế và chứa các giá trị không hoàn hảo, các cột mơ hồ và các mối quan hệ phức tạp. Một hệ thống được chấm điểm bằng cách thực thi SQL của nó và so sánh các hàng trả về với kết quả tham chiếu. Đối với ngôn ngữ truy vấn, tính đúng đắn về cú pháp là chưa đủ. Cái nhìn cốt lõi của Feyn là thông tin còn thiếu đã tồn tại bên trong cơ sở dữ liệu. Mô hình chỉ cần được phép yêu cầu nó.
SQRL nhận một câu hỏi, lược đồ của nó và bằng chứng tùy chọn về cơ sở dữ liệu. Nếu ngữ cảnh đó đủ, nó trả về một truy vấn ngay lập tức. Nếu điều gì đó vẫn còn mơ hồ, nó chạy các truy vấn chỉ đọc và sử dụng các hàng trả về để soạn câu trả lời cuối cùng. Quyết định kiểm tra là tùy theo tình huống. Đếm hàng trong một bảng duy nhất không cần tra cứu, vì vậy SQRL trả lời trực tiếp.
Tương tác sử dụng hai hành động riêng biệt. Một khối <sql> yêu cầu một quan sát từ cơ sở dữ liệu. Một khối <answer> cam kết với truy vấn cuối cùng. Bộ khung thực thi các truy vấn khám phá ở chế độ chỉ đọc và trả về các hàng của chúng bên trong các thẻ <observation>. SQRL có thể kiểm tra tối đa năm lần, mặc dù hầu hết các câu hỏi hoàn thành trong ít bước hơn.
Phần giải thích dưới đây đi qua cả hai hành vi trên các ví dụ thực tế, sau đó so sánh dòng mô hình với các mô hình tiên tiến trên BIRD Dev.
Text-to-SQL trong lịch sử đã theo hai cách tiếp cận, và mỗi cách đánh đổi điều gì đó quan trọng.
Các mô hình một lần tạo toàn bộ truy vấn trong một lượt. Chúng rẻ để phục vụ, nhưng phải suy luận mọi thứ từ lược đồ, điều này có thể tạo ra các truy vấn sai về mặt logic. Các pipeline tiên tiến thay vào đó truy xuất ngữ cảnh, tạo ứng viên, phê bình chúng, và sau đó chọn câu trả lời. Điều này có thể tối đa hóa độ chính xác, nhưng mỗi câu hỏi yêu cầu nhiều cuộc gọi tiên tiến đắt đỏ và nhiều lượt truy cập cơ sở dữ liệu. Chi phí đó làm cho các pipeline như vậy khó đặt trên đường dẫn nóng.
SQRL kết hợp cả hai trong một mô hình duy nhất. Các câu hỏi dễ vẫn ngắn, trong khi các câu hỏi mơ hồ được kiểm tra. Mô hình trả chi phí tra cứu chỉ khi câu hỏi cần nó.
Cho một mô hình quyền truy cập cơ sở dữ liệu không dạy nó khi nào hoặc làm thế nào để tra cứu. Hành vi đó phải được huấn luyện, và huấn luyện dựa trên thực thi là khó khăn. Nếu một truy vấn tham chiếu tự nó sai, một câu trả lời đúng của mô hình nhận được phần thưởng sai.
Trước tiên, họ đã làm sạch tập huấn luyện. Bắt đầu từ BIRD và Spider, họ loại bỏ các mẫu mà SQL tham chiếu không trả về kết quả khả dụng. Ba mô hình giám định sau đó xem xét các cặp còn lại và loại bỏ bất kỳ truy vấn nào không trả lời đúng câu hỏi như đã viết. Tập kiểm tra kết hợp một phần Spider được giữ lại với BIRD dev, phần còn lại của dữ liệu được đưa vào huấn luyện.
Mô hình giáo viên 35B-A3B được huấn luyện trực tiếp với CISPO, một phương pháp học tăng cường từ công trình M1 của MiniMax. CISPO cắt tỉa trọng số lấy mẫu quan trọng thay vì tỷ lệ chính sách, giúp bảo toàn tín hiệu gradient từ các token hiếm nhưng quyết định. Với mỗi câu hỏi, mô hình tạo ra tám quỹ đạo hoàn chỉnh. Feyn thực thi mọi truy vấn cuối cùng và thưởng cho kết quả khớp với tham chiếu, một tín hiệu nhị phân bỏ qua cách diễn đạt và chỉ kiểm tra các hàng trả về.
Huấn luyện theo nhóm cần sự đa dạng trong mỗi nhóm. Tám lần đúng hoặc tám lần thất bại không mang lại tín hiệu nào về quyết định nào hữu ích. Do đó, Feyn huấn luyện trên 'vùng hỗn hợp', nơi chỉ một số trong tám lần thử thành công, để mỗi nhóm có thể củng cố các lựa chọn phân biệt quỹ đạo đúng với quỹ đạo sai. Đó là cách giáo viên học được khi nào cần kiểm tra.
Để hành vi có thể triển khai, nhóm Feyn đã lấy mẫu các quỹ đạo giáo viên hoàn chỉnh và chỉ giữ lại các lần chạy mà SQL cuối cùng trả về kết quả đúng. Điều này tạo ra khoảng 10.200 mẫu, mỗi mẫu bảo toàn suy luận, truy vấn khám phá, quan sát và câu trả lời cuối cùng. Các mô hình học sinh 4B và 9B được tinh chỉnh trên các quỹ đạo này, sau đó cải thiện với cùng phần thưởng thực thi CISPO. SQRL được xây dựng trên các dòng mô hình Qwen3.5 và Qwen3.6.
Feyn đánh giá SQRL trên BIRD Dev, tính điểm truy vấn đúng khi nó trả về cùng kết quả với tham chiếu. SQRL-35B-A3B đạt 70,60% và kích hoạt khoảng 3B tham số mỗi token. Mô hình học sinh 9B giữ gần như toàn bộ hiệu suất đó ở mức 69,80%. SQRL-4B đạt 68,80%, ngang bằng Claude Opus 4.6 trong đánh giá này, với kích thước đủ nhỏ để lưu trữ ở bất kỳ đâu, giúp lược đồ, truy vấn và quan sát của bạn nằm trên cơ sở hạ tầng bạn kiểm soát.
Trong so sánh được báo cáo của Feyn, các mô hình tiên phong xếp sau: Claude 4.5 Sonnet ở 67,34%, Qwen3-Coder-480B-A35B ở 66,17%, GLM-4.7 ở 63,82%, DeepSeek-R1 ở 61,67% và Kimi-K2-Thinking ở 60,63%.
Feyn khuyến nghị SQRL-9B làm điểm kiểm tra mặc định, SQRL-4B cho ngân sách hạn hẹp nhất và SQRL-35B-A3B cho độ chính xác cao nhất. Mô hình 9B phục vụ với vLLM:
Vòng lặp ứng dụng nhỏ. Giữ thực thi cơ sở dữ liệu ở chế độ chỉ đọc và trả lại mỗi quan sát cho mô hình cho đến khi nó đưa ra câu trả lời. Một lưu ý quan trọng: Không bật trình phân tích suy luận ở lớp phục vụ. Giao thức hành động xuất hiện trong nội dung sau thẻ đóng </think>, vì vậy việc loại bỏ nội dung đó sẽ làm mất hành động <sql> hoặc <answer> của mô hình. Hãy phân tích nội dung thô và giữ lại mọi thứ sau thẻ think cuối cùng. Các thẻ mô hình chứa prompt hệ thống hoàn chỉnh và một khung tham chiếu.
Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ Nhân tạo vì lợi ích xã hội. Dự án gần đây nhất của ông là ra mắt Nền tảng Truyền thông Trí tuệ Nhân tạo, Marktechpost, nổi bật với các bài viết chuyên sâu về học máy và học sâu, vừa có tính kỹ thuật cao vừa dễ hiểu với nhiều đối tượng. Nền tảng này tự hào có hơn 2 triệu lượt xem hàng tháng, cho thấy sự phổ biến của nó.


