MarkTechPost

Anthropic triển khai lại Claude Fable 5 vào ngày 1 tháng 7 sau khi Mỹ dỡ bỏ các biện pháp kiểm soát xuất khẩu, bổ sung thêm bộ phân loại an ninh mạng mới

🕐 20/07/2026 09:32 📰 MarkTechPost ✅ Đã dịch sang tiếng Việt

Anthropic đang triển khai lại Claude Fable 5, mô hình có khả năng mạnh nhất hiện có. Vào ngày 30 tháng 6, họ thông báo rằng các hạn chế xuất khẩu của Mỹ đã được dỡ bỏ. Các hạn chế này trước đây áp dụng cho Claude Fable 5 và Claude Mythos 5. Fable 5 đã quay trở lại với người dùng toàn cầu vào thứ Tư, ngày 1 tháng 7. Quyền truy cập Mythos 5 được khôi phục cho một nhóm tổ chức tại Mỹ.

Các mô hình đã bị rút lại vào ngày 12 tháng 6. Một chỉ thị của chính phủ Mỹ giới hạn chúng chỉ dành cho người không phải công dân nước ngoài. Anthropic không thể xác minh quốc tịch theo thời gian thực. Vì vậy, họ đã tạm ngưng cả hai mô hình cho tất cả mọi người.

Bài viết này giải thích nguyên nhân gây ra việc chặn. Nó đề cập đến biện pháp bảo vệ mới và khung jailbreak được đề xuất. Nó cũng cho thấy cách Fable 5 so sánh với các đối thủ như GLM-5.2.

Anthropic đã ra mắt Fable 5 và Mythos 5 vào ngày 9 tháng 6. Cả hai đều chia sẻ cùng một mô hình nền tảng. Fable 5 đi kèm với các biện pháp bảo vệ mạnh mẽ cho sử dụng chung. Mythos 5 có một số biện pháp bảo vệ được nới lỏng cho các đối tác an ninh mạng phòng thủ.

Vào ngày 12 tháng 6, chính phủ Mỹ áp dụng các hạn chế xuất khẩu. Lệnh có hiệu lực ngay lập tức. Anthropic tạm ngưng quyền truy cập thay vì chấp nhận rủi ro không tuân thủ.

Nguyên nhân là một báo cáo từ các nhà nghiên cứu Amazon. Họ tìm ra phương pháp vượt qua các biện pháp bảo vệ của Fable 5. Prompt khiến mô hình xác định một số lỗ hổng phần mềm. Trong một trường hợp, nó tạo ra mã cho thấy cách khai thác một lỗ hổng.

Đến ngày 26 tháng 6, chính phủ chấp thuận khôi phục Mythos 5 cho một số tổ chức Mỹ. Vào ngày 30 tháng 6, các hạn chế được dỡ bỏ hoàn toàn.

Anthropic đã kiểm tra xem phát hiện này có duy nhất với Fable 5 không. Kết quả là không.

Các mô hình kém khả năng hơn cũng xác định cùng các lỗ hổng. Danh sách đó bao gồm Claude Opus 4.8, GPT-5.5 và Kimi K2.7.

Đối với việc trình diễn khai thác đơn lẻ, mọi mô hình được kiểm tra đều tái tạo nó. Tập hợp đó bao gồm Haiku 4.5, Sonnet 4.6, Opus 4.6 và Opus 4.7. Nó cũng bao gồm Opus 4.8, GPT-5.4, GPT-5.5 và Kimi K2.7.

Nhóm Anthropic tuyên bố kỹ thuật này không tiết lộ khả năng an ninh mạng cấp Mythos độc đáo nào. Họ gọi trường hợp này là một trường hợp ranh giới đối với các biện pháp bảo vệ của Fable 5. Hành vi bị chặn chỉ liên quan đến công việc an ninh mạng phòng thủ thông thường.

Anthropic vẫn hành động để thu hẹp khoảng cách. Họ đã huấn luyện một bộ phân loại an toàn cải tiến cho hành vi được báo cáo.

Bộ phân loại chặn kỹ thuật cụ thể trong hơn 99% trường hợp. Các yêu cầu bị chặn không bị từ chối hoàn toàn. Chúng được chuyển hướng đến Claude Opus 4.8 thay thế. Người dùng được thông báo khi sự chuyển hướng này xảy ra.

Các nhà nghiên cứu từ CAISI của Bộ Thương mại đã kiểm tra cả biện pháp bảo vệ cũ và mới. Họ đồng ý rằng các biện pháp bảo vệ cực kỳ mạnh mẽ. Sự đánh đổi là nhiều kết quả dương tính giả hơn trong quá trình viết mã và gỡ lỗi thông thường.

Điều này phản ánh thiết kế 'phòng thủ theo chiều sâu' của Anthropic. Bộ phân loại là các hệ thống AI nhỏ hơn phát hiện các tác vụ an ninh mạng có hại. Một 'biên an toàn' có chủ ý cũng chặn một số yêu cầu vô hại. Fable 5 sử dụng biên an toàn lớn hơn nhiều so với các mô hình trước.

Sự kiện này đã phơi bày một khoảng trống. Ngành công nghiệp không có tiêu chuẩn chung để đánh giá một 'jailbreak', một kỹ thuật vượt qua các biện pháp bảo vệ của mô hình.

Anthropic đang soạn thảo một tiêu chuẩn với Amazon, Microsoft, Google và các đối tác Glasswing khác. Bản dự thảo đánh giá jailbreak dựa trên bốn tiêu chí:

Đối với lớp nghiêm trọng nhất, Anthropic sẽ triển khai các biện pháp giảm thiểu sơ bộ ngay lập tức. Họ cũng đang thiết lập giám sát 24/7 các kênh gửi jailbreak.

Hãy thử công cụ chấm điểm tương tác nhúng này để xem bốn tiêu chí này kết hợp như thế nào.

Fable 5 nhắm đến công việc tác nhân dài hạn. Đây là nơi các kỹ sư ban đầu có thể áp dụng nó.

Việc tạm ngưng đã tạo cơ hội cho các đối thủ. Vài ngày sau khi đình chỉ, Zhipu AI đã

GLM-5.2 được phát hành dưới dạng trọng số mở. Những người kiểm thử độc lập đánh giá đây là mô hình mạnh nhất hiện có công khai.

GLM-5.2 sử dụng thiết kế Mixture-of-Experts. Mô hình có tổng cộng khoảng 750 tỷ tham số. Chỉ khoảng 40 tỷ tham số được kích hoạt cho mỗi token. Trong bài kiểm tra IDOR của Semgrep, mô hình đạt F1 39%, vượt qua Claude Code với 32% trên cùng một prompt.

Khoảng cách thu hẹp về chi phí. Trên AA-Briefcase, Fable 5 trung bình 31 USD mỗi tác vụ. GLM-5.2 trung bình 2,40 USD.

Đối với các gói Pro, Max, Team và một số gói Enterprise, Fable 5 được bao gồm đến hết ngày 7 tháng 7. Nó chiếm tới 50% giới hạn sử dụng hàng tuần. Sau đó, quyền truy cập chuyển sang tín dụng sử dụng. Anthropic cũng đang kích hoạt lại Fable 5 trên AWS, Google Cloud và Microsoft Foundry.

Các nhà phát triển gọi mô hình bằng chuỗi `claude-fable-5`:

Nếu bộ phân loại kích hoạt, phản hồi sẽ đến từ Opus 4.8. Luồng mã của bạn vẫn giữ nguyên.

Hãy xem phần Chi tiết kỹ thuật. Ngoài ra, đừng quên theo dõi chúng tôi trên Twitter và tham gia SubReddit ML với hơn 150k thành viên cũng như Đăng ký Nhận bản tin của chúng tôi. Chờ đã! Bạn có dùng Telegram không? Giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Cần hợp tác với chúng tôi để quảng bá Kho lưu trữ GitHub, Trang Hugging Face, Phát hành Sản phẩm, Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Michal Sutter là chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc biến đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động.

📎 Nguồn gốc: MarkTechPost Xem bài gốc →