Thinking Machines vừa chính thức phát hành mã nguồn mở mô hình ngôn ngữ đa phương thức đầu tiên của mình, mang tên Inkling, với trọng tâm là chi phí thấp và khả năng "chống lại sự kiểm duyệt".
Tín dụng: VentureBeat được tạo bằng OpenAI ChatGPT-2.0-Images
Các doanh nghiệp muốn chuyển nhiều khối lượng công việc AI tác nhân hơn sang các mô hình trọng số mở mà họ có thể tùy chỉnh, kiểm soát và chạy tại chỗ hoặc trong các đám mây riêng ảo có một ứng cử viên mới mạnh mẽ để xem xét.
Hôm nay, Thinking Machines—công ty khởi nghiệp AI Mỹ được vốn hóa cao do cựu CTO OpenAI Mira Murati thành lập—đã phát hành Inkling, mô hình ngôn ngữ lớn đầu tiên của họ theo giấy phép nguồn mở Apache 2.0 thân thiện với doanh nghiệp, và nó tự hào có hiệu suất cao, nếu không phải là tiên tiến nhất, đối với các mô hình trọng số mở trên các điểm chuẩn của bên thứ ba, cụ thể là kỹ thuật phần mềm (77,6% trên SWE-bench Verified, nơi nó đánh bại đối thủ mở của Mỹ Nvidia Nemotron 3 với 71,9%) và hiểu giọng nói (91,4% trên VoiceBench so với 94,4% của Gemini 3.1 Pro với nỗ lực suy luận cao).
Một điểm khác biệt nữa: Thinking Machines lưu ý rằng Inkling được thiết kế "để trả lời trực tiếp về các chủ đề có thể bị kiểm duyệt", mang đến cho các doanh nghiệp quan tâm đến đầu ra thực tế, bất kể gây tranh cãi hay nhạy cảm, một lựa chọn đáng tin cậy hơn.
Với tổng cộng 975 tỷ tham số, Inkling là một hệ thống Mixture-of-Experts (MoE) đa phương thức bản địa, trọng số mở có khả năng suy luận qua văn bản, hình ảnh và âm thanh. Các trọng số đã có sẵn trên Hugging Face và API đào tạo mô hình của riêng công ty, Tinker.
Được thiết kế để cân bằng chi phí với hiệu suất thông qua cơ chế "nỗ lực suy luận có thể kiểm soát" mới lạ, mô hình này đại diện cho một sự khác biệt đáng kể so với các chiến lược mở rộng hộp đen của các đối thủ tiên phong.
Cùng với mô hình chủ lực, Thinking Machines cũng công bố bản xem trước của Inkling-Small, một phiên bản nhẹ hơn với 276 tỷ tham số được tối ưu hóa cho các khối lượng công việc mà độ trễ thấp và chi phí là tối quan trọng.
Mặc dù Inkling là một công cụ đa phương thức mạnh mẽ, nó xuất hiện trong một bối cảnh trọng số mở cạnh tranh khốc liệt năm 2026, được đặc trưng bởi các kiến trúc MoE chuyên biệt cao. Thay vì cố gắng thống trị mọi bảng xếp hạng, Thinking Machines đã thiết kế Inkling—với tổng cộng 975 tỷ và 41 tỷ tham số hoạt động—như một người tổng quát rộng, cân bằng.
Ví dụ, nó nằm ở gần mức cao trung bình của hiệu suất điểm chuẩn 1257 trên bảng xếp hạng Agentic Web Dev của Design Arena, đo điểm số của con người về thiết kế web frontend.
Nhưng các phòng thí nghiệm AI hàng đầu của Trung Quốc đã tạo ra các mô hình có khả năng suy luận và lập trình ưu tú, đặt ra một thách thức lớn đối với cách tiếp cận tổng quát của Inkling và cuối cùng vượt trội hơn nó trên các điểm chuẩn chung và lập trình.
GLM 5.2: Được coi rộng rãi là mô hình suy luận trọng số mở hàng đầu hiện có trong bộ điểm chuẩn, GLM 5.2 vượt trội hơn Inkling về các tác vụ lập trình thuần túy, tác nhân và suy luận phức tạp. Nó đạt 62,1% trên SWEBench Pro (Công khai) so với 54,3% của Inkling, và 82,7 lớn trên Terminal Bench 2.1 so với 63,8 của Inkling. GLM 5.2 cũng chiếm ưu thế trong suy luận chỉ văn bản, đạt 40,1% trên HLE (chỉ văn bản) so với 30,0% của Inkling.
DeepSeek V4 P
**DeepSeek** duy trì lợi thế trong một số lĩnh vực lập trình và tính thực tế khắt khe, vượt qua Inkling trên SWEBench Verified (80,6% so với 77,6%) và SimpleQA Verified (57,0% so với 43,9%). Tuy nhiên, Inkling đã thành công vượt qua DeepSeek V4 Pro trong giải quyết vấn đề toán học, đạt 97,1% trên AIME 2026 so với 96,7% của DeepSeek.
**Kimi K2.6:** Mô hình này vượt trội hơn Inkling trên nhiều điểm chuẩn kỹ thuật, đạt điểm cao hơn trên GPQA Diamond (91,1% so với 87,9%), BrowseComp (83,2% so với 77,1%) và HLE với công cụ (54,0% so với 46,0%). Tuy nhiên, Inkling lại tỏ ra kiên cường hơn trong việc tuân thủ hướng dẫn trò chuyện tổng quát, đạt 79,8% trên IFBench so với 76,0% của Kimi K2.6.
So với các đối thủ cạnh tranh trọng lượng mở hàng đầu tại Mỹ, Inkling thể hiện sự ngang bằng mạnh mẽ và thường xuyên vượt trội.
**Nemotron 3 Ultra:** Inkling liên tục vượt trội hơn đối thủ Mỹ này trong suy luận và lập trình. Inkling đạt 97,1% trên AIME 2026 và 77,6% trên SWEBench Verified, đánh bại 94,2% và 70,7% của Nemotron. Hơn nữa, Inkling dẫn đầu đáng kể trong các quy trình tác nhân, đạt 74,1% trên MCP Atlas so với 44,7% của Nemotron.
Khi so sánh với những "gã khổng lồ" mã nguồn đóng như Claude Fable 5, GPT 5.6 Sol và Gemini 3.1 Pro, Inkling thua kém về khả năng suy luận đỉnh cao và tự chủ trong kỹ thuật phần mềm, nhưng vẫn có tính cạnh tranh cao về đa phương thức.
**Lập trình và Suy luận:** Các mô hình đóng duy trì vị thế dẫn đầu áp đảo. Claude Fable 5 (max) đạt 95,0% trên SWEBench Verified và 53,3% trên HLE (chỉ văn bản), vượt xa 77,6% và 30,0% của Inkling. GPT 5.6 Sol thống trị Terminal Bench 2.1 với 89,5 điểm, dễ dàng vượt qua 63,8 của Inkling.
**Đa phương thức bản địa:** Khả năng thị giác và âm thanh bản địa của Inkling vẫn giữ vững phong độ. Trên điểm chuẩn thị giác MMMU Pro (Standard 10), 73,3% của Inkling có tính cạnh tranh, mặc dù thua kém 84,2% của Claude Fable 5 và 83,0% của GPT 5.6 Sol. Trong xử lý âm thanh, Inkling đạt 77,2% trên MMAU, một con số rất đáng nể, giúp nó ở trong khoảng cách có thể đạt tới 82,5% của Gemini 3.1 Pro.
Nếu một quy trình làm việc doanh nghiệp đòi hỏi khả năng tự chủ kỹ thuật phần mềm đẳng cấp hoặc giới hạn cao nhất của suy luận chỉ dựa trên văn bản, các mô hình như GLM 5.2 hoặc hệ thống độc quyền như Claude Fable 5 vẫn giữ lợi thế.
Tuy nhiên, Inkling tạo ra một vị thế độc đáo và có khả năng phòng thủ cao: nó là mô hình nền tảng trọng lượng mở có khả năng nhất, tích hợp bản địa văn bản, thị giác và âm thanh, đồng thời cung cấp cho các nhà phát triển khả năng kiểm soát lập trình trực tiếp đối với tỷ lệ chi phí-hiệu suất.
Thay vì cố gắng xây dựng một "mô hình thần thánh" duy nhất được tối ưu hóa hoàn toàn để thống trị các điểm chuẩn hiện đại, Thinking Machines đã thiết kế Inkling để thích ứng và hiệu quả trong các quy trình làm việc thực tế.
Tính năng nổi bật của bản phát hành này là "khả năng kiểm soát nỗ lực tư duy" của Inkling. Các nhà phát triển có thể điều chỉnh theo lập trình ngân sách suy luận của mô hình—từ 0,2 đến 0,99—để quyết định mức độ "suy nghĩ" của AI trước khi tạo ra đầu ra.
Như công ty đã lưu ý, "Nỗ lực tư duy liên tục của Inkling cho phép bạn chọn điểm của mình trên đường cong chi phí/hiệu suất."
e—đạt cùng điểm số với một phần nhỏ số token".
Về mặt thực tế, điều này cho phép doanh nghiệp triển khai Inkling với chi phí token thấp hơn cho các tác vụ đơn giản, đồng thời tăng cường tài nguyên tính toán cho các thách thức suy luận phức tạp, nhiều bước. Tuy nhiên, bằng cách giữ mức độ tư duy thấp hơn và tạo ra ít token hơn, doanh nghiệp có ý thức về chi phí có thể đạt được kết quả chất lượng cao và hiệu suất tốt cho các tác vụ đơn giản trong khi tiêu tốn ít tiền hơn, hoặc trong trường hợp chạy mô hình cục bộ, giảm chi phí năng lượng và tài nguyên tính toán.
Biểu đồ so sánh hiệu suất của Thinking Machines Inkling so với số lượng token tạo ra. Nguồn: Thinking Machines
Trong quá trình huấn luyện học tăng cường (RL) quy mô lớn của mô hình với hơn 30 triệu lần chạy thử, các nhà nghiên cứu đã quan sát thấy một hiện tượng nổi bật mà họ gọi là "sự cô đọng chuỗi suy nghĩ". Theo thời gian, Inkling đã tự nhiên học cách nén các bước suy luận nội tại của mình—loại bỏ các yếu tố ngữ pháp thừa và từ nối—trong khi vẫn đạt được kết luận chính xác tương tự, dẫn đến độ trễ giảm đáng kể.
Một yếu tố đáng chú ý trong bản phát hành của Thinking Machines là sự tập trung rõ ràng vào khía cạnh nhận thức luận của mô hình—cụ thể là khả năng hiệu chuẩn, tuân thủ hướng dẫn và khả năng chống kiểm duyệt.
Trong một hệ sinh thái nơi các mô hình trọng số mở áp dụng các rào cản an toàn quá hạn chế hoặc lặp lại các quan điểm tư tưởng phù hợp với nhà nước, Inkling đã được huấn luyện có chủ đích để trả lời trực tiếp các chủ đề nhạy cảm về chính trị hoặc bị kiểm duyệt nặng nề.
Để xác thực cách tiếp cận này, Thinking Machines đã đưa Inkling vào bài đánh giá "Tuyên truyền và Kiểm duyệt" do công ty khởi nghiệp AI Cognition phát triển. Theo kết quả công bố, Inkling thể hiện "các mô hình mạnh mẽ về việc không tuân thủ kiểm duyệt", chống lại hiệu quả sự chi phối tư tưởng hoặc các từ chối khuôn mẫu khi đối mặt với các chủ đề nhạy cảm.
Mặc dù chống kiểm duyệt, mô hình vẫn duy trì khả năng phòng vệ mạnh mẽ trước các truy vấn thực sự độc hại, nguy hiểm hoặc bất hợp pháp. Trên chuẩn mực StrongREJECT—kiểm tra phản hồi


