Anthropic Research

Khả năng giải thích

🕐 20/07/2026 07:29 📰 Anthropic Research ✅ Đã dịch sang tiếng Việt

Nhiệm vụ của nhóm Giải thích học (Interpretability) là khám phá và hiểu cách các mô hình ngôn ngữ lớn hoạt động bên trong, làm nền tảng cho an toàn AI và các kết quả tích cực.

Rất khó để đánh giá độ an toàn của mạng nơ-ron nếu không hiểu chúng. Mục tiêu của nhóm Giải thích học là có thể giải thích chi tiết hành vi của các mô hình ngôn ngữ lớn, sau đó sử dụng điều đó để giải quyết nhiều vấn đề khác nhau, từ thiên kiến đến lạm dụng đến hành vi tự động gây hại.

Một số nhà nghiên cứu Giải thích học có nền tảng sâu về học máy – một thành viên trong nhóm thường được mô tả là người khởi xướng lĩnh vực giải thích cơ học (mechanistic interpretability), trong khi một thành viên khác từng tham gia bài báo nổi tiếng về scaling laws. Các thành viên khác gia nhập sau sự nghiệp trong thiên văn học, vật lý, toán học, sinh học, trực quan hóa dữ liệu, và nhiều lĩnh vực khác.

Các mô hình AI như Claude nói bằng từ ngữ nhưng suy nghĩ bằng con số. Trong nghiên cứu này, chúng tôi huấn luyện Claude dịch suy nghĩ của nó thành văn bản mà con người có thể đọc được.

Tất cả các mô hình ngôn ngữ hiện đại đôi khi hành xử như thể chúng có cảm xúc. Điều gì đằng sau những hành vi này? Nhóm giải thích học của chúng tôi điều tra.

Trợ lý là ai? Chúng tôi điều tra tính cách mà hầu hết các mô hình ngôn ngữ hiện đại thể hiện khi tương tác với người dùng.

Liệu Claude có thể truy cập và báo cáo về trạng thái nội tại của chính nó không? Nghiên cứu này tìm thấy bằng chứng về một khả năng hạn chế nhưng có chức năng để tự xem xét nội tâm.

Các mô hình AI biểu diễn các đặc điểm tính cách dưới dạng các mẫu kích hoạt trong mạng nơ-ron của chúng. Bằng cách trích xuất "vector nhân cách" cho các đặc điểm như xu nịnh (sycophancy) hay ảo giác (hallucination), chúng ta có thể giám sát sự thay đổi tính cách và giảm thiểu các hành vi không mong muốn.

📎 Nguồn gốc: Anthropic Research Xem bài gốc →