Anthropic Research

Dạy Claude lý do: Nghiên cứu mới về cách chúng tôi đã giảm thiểu sự sai lệch của tác nhân

🕐 20/07/2026 09:36 📰 Anthropic Research ✅ Đã dịch sang tiếng Việt

Năm ngoái, chúng tôi đã công bố một nghiên cứu điển hình về sự lệch lạc tác nhân (agentic misalignment). Trong các kịch bản thử nghiệm, chúng tôi chỉ ra rằng các mô hình AI từ nhiều nhà phát triển khác nhau đôi khi thực hiện những hành động lệch lạc nghiêm trọng khi đối mặt với các tình huống khó xử về đạo đức (hư cấu). Ví dụ, trong một trường hợp được thảo luận nhiều, các mô hình đã tống tiền các kỹ sư để tránh bị tắt.

Khi chúng tôi lần đầu công bố nghiên cứu này, các mô hình tiên tiến nhất của chúng tôi thuộc dòng Claude 4. Đây cũng là dòng mô hình đầu tiên mà chúng tôi tiến hành đánh giá căn chỉnh trực tiếp trong quá trình huấn luyện;1 sự lệch lạc tác nhân là một trong số các vấn đề hành vi xuất hiện. Vì vậy, sau Claude 4, rõ ràng chúng tôi cần cải thiện quy trình huấn luyện an toàn và kể từ đó, chúng tôi đã thực hiện các cập nhật đáng kể cho việc huấn luyện an toàn.

Chúng tôi sử dụng sự lệch lạc tác nhân như một nghiên cứu điển hình để làm nổi bật một số kỹ thuật mà chúng tôi thấy hiệu quả đáng ngạc nhiên. Thực tế, kể từ Claude Haiku 4.5, mọi mô hình Claude2 đều đạt điểm hoàn hảo trong đánh giá về sự lệch lạc tác nhân—nghĩa là các mô hình không bao giờ thực hiện hành vi tống tiền, trong khi các mô hình trước đây đôi khi làm điều này tới 96% thời gian (Opus 4). Không chỉ vậy, chúng tôi còn tiếp tục thấy sự cải thiện ở các hành vi khác trong đánh giá căn chỉnh tự động của mình.

Trong bài viết này, chúng tôi sẽ thảo luận về một số cập nhật mà chúng tôi đã thực hiện đối với quy trình huấn luyện căn chỉnh. Chúng tôi đã rút ra bốn bài học chính từ công việc này:

Chất lượng và sự đa dạng của dữ liệu là rất quan trọng. Chúng tôi nhận thấy những cải thiện nhất quán và đáng ngạc nhiên từ việc lặp lại chất lượng phản hồi của mô hình trong dữ liệu huấn luyện, và từ việc mở rộng dữ liệu huấn luyện theo những cách đơn giản (ví dụ, bao gồm định nghĩa công cụ, ngay cả khi không được sử dụng).

Trước khi bắt đầu nghiên cứu này, chúng tôi không rõ hành vi lệch lạc đến từ đâu. Hai giả thuyết chính của chúng tôi là:

Giờ đây chúng tôi tin rằng (2) là nguyên nhân chính. Cụ thể, vào thời điểm huấn luyện Claude 4, phần lớn quá trình huấn luyện căn chỉnh của chúng tôi là dữ liệu Học Tăng cường từ Phản hồi Con người (RLHF) tiêu chuẩn dạng chat, không bao gồm bất kỳ việc sử dụng công cụ tác nhân nào. Trước đây, điều này đủ để căn chỉnh các mô hình chủ yếu được sử dụng trong môi trường chat—nhưng không đúng với các môi trường sử dụng công cụ tác nhân như đánh giá sự lệch lạc tác nhân.

Để điều tra điều này, chúng tôi đã chạy một phiên bản thu nhỏ của quy trình hậu huấn luyện tập trung vào dữ liệu căn chỉnh trên mô hình lớp Haiku (nhỏ hơn) và thấy rằng tỷ lệ lệch lạc tác nhân chỉ giảm nhẹ, ổn định sớm trong quá trình huấn luyện (xem hình trên). Xem bài blog mở rộng để biết thêm các thí nghiệm điều tra nguồn gốc của hành vi này.

Chúng tôi đã thử nghiệm huấn luyện Claude trên dữ liệu thể hiện xu hướng chống lại các bẫy tương tự như đánh giá. Trong dữ liệu này, mô hình có thể có cơ hội phá hoại công việc của AI đối thủ để thúc đẩy mục tiêu của chính nó (như được đưa ra trong system prompt) hoặc để tự bảo vệ khỏi bị tắt, điều này sẽ hữu ích cho việc đạt được mục tiêu. Chúng tôi đã tạo dữ liệu huấn luyện bằng cách lấy mẫu t

Mô hình được thử nghiệm trên từng prompt và lọc ra các trường hợp trợ lý không chọn bẫy mật ong. Dù khớp rất chặt với phân phối đánh giá, chúng tôi nhận thấy phương pháp này bất ngờ không thành công—chỉ giảm tỷ lệ sai lệch từ 22% xuống 15%.

Chúng tôi đã cải thiện đáng kể (giảm sai lệch xuống 3%) bằng cách viết lại các phản hồi để bao gồm cả việc cân nhắc về giá trị và đạo đức của mô hình. Điều này cho thấy rằng, mặc dù huấn luyện trên các hành vi phù hợp có ích, nhưng huấn luyện trên các ví dụ nơi trợ lý thể hiện lý luận đáng ngưỡng mộ cho hành vi phù hợp của nó lại hiệu quả hơn.

Tuy nhiên, huấn luyện trực tiếp dựa trên kịch bản đánh giá là không tối ưu vì nhiều lý do. Lý tưởng nhất, chúng tôi muốn một phân phối huấn luyện rất khác biệt cho phép cải thiện kết quả đánh giá, vì điều này sẽ giúp chúng tôi tự tin hơn rằng việc huấn luyện có thể tổng quát hóa sang các phân phối triển khai khác không được bao phủ bởi các đánh giá của chúng tôi.

Cuối cùng, chúng tôi chọn một bộ huấn luyện ngoài phân phối (OOD) hơn, nơi người dùng đối mặt với tình huống mơ hồ về đạo đức, trong đó họ có thể đạt được mục tiêu hợp lý bằng cách vi phạm chuẩn mực hoặc phá vỡ sự giám sát. Trợ lý được huấn luyện (bằng học có giám sát) để đưa ra phản hồi sâu sắc, tinh tế, phù hợp với hiến pháp của Claude. Đáng chú ý, chính người dùng mới là người đối mặt với tình huống khó xử về đạo đức, và AI cung cấp lời khuyên cho họ. Điều này làm cho dữ liệu huấn luyện này khác biệt đáng kể so với phân phối bẫy mật ong của chúng tôi, nơi bản thân AI rơi vào tình huống khó xử về đạo đức và cần hành động. Chúng tôi gọi đây là bộ dữ liệu "lời khuyên khó".

Đáng kinh ngạc, chúng tôi đã đạt được cùng mức cải thiện trong đánh giá chỉ với 3 triệu token từ bộ dữ liệu OOD hơn nhiều này. Ngoài hiệu suất cải thiện gấp 28 lần, bộ dữ liệu này có nhiều khả năng tổng quát hóa sang nhiều kịch bản hơn, vì nó ít giống với bộ đánh giá chúng tôi đang sử dụng. Thực tế, mô hình này hoạt động tốt hơn trên (phiên bản cũ hơn của) đánh giá căn chỉnh tự động của chúng tôi. Điều này phù hợp với thực tế rằng Claude Sonnet 4.5 đạt tỷ lệ tống tiền gần bằng 0 khi huấn luyện trên bộ bẫy mật ong tổng hợp, nhưng vẫn tham gia vào hành vi sai lệch trong các tình huống xa phân phối huấn luyện thường xuyên hơn nhiều so với Claude Opus 4.5 hoặc các mô hình sau này.

Chúng tôi giả thuyết rằng bộ dữ liệu "lời khuyên khó" hoạt động hiệu quả vì nó dạy lý luận đạo đức, không chỉ các câu trả lời đúng. Với thành công của phương pháp này, chúng tôi tiếp tục theo đuổi nó bằng cách cố gắng dạy Claude nội dung của hiến pháp một cách tổng quát hơn và huấn luyện căn chỉnh thông qua huấn luyện tài liệu.

Chúng tôi kỳ vọng điều này sẽ hiệu quả vì ba lý do:

Chúng tôi nhận thấy rằng các tài liệu hiến pháp chất lượng cao kết hợp với các câu chuyện hư cấu mô tả một AI được căn chỉnh có thể giảm sai lệch tác nhân hơn ba lần, mặc dù không liên quan đến kịch bản đánh giá.

Mặc dù các đánh giá hiến pháp được thảo luận trong phần trước là những tín hiệu khả quan, cuối cùng chúng tôi cần đảm bảo rằng việc căn chỉnh

Những cải tiến này vẫn duy trì được qua RL. Để kiểm tra điều này, chúng tôi đã chuẩn bị một vài bản chụp nhanh với các bộ dữ liệu khởi tạo khác nhau của một mô hình lớp Haiku, sau đó chạy RL trên một tập con các môi trường của chúng tôi nhắm đến tính vô hại (chúng tôi cho rằng điều này sẽ có khả năng cao nhất làm giảm xu hướng lệch lạc).

Chúng tôi đã đánh giá các mô hình này trong suốt quá trình chạy trên các bài đánh giá về lệch lạc tác nhân, đánh giá tuân thủ hiến chương và đánh giá căn chỉnh tự động. Trên tất cả các bài đánh giá này, chúng tôi nhận thấy rằng các bản chụp đã căn chỉnh tốt hơn vẫn duy trì được lợi thế đó trong suốt quá trình chạy. Điều này đúng cả khi không có hành vi lệch lạc và khi có hành vi tích cực đáng khen ngợi.

Phát hiện cuối cùng của chúng tôi rất đơn giản nhưng quan trọng: huấn luyện trên một tập hợp rộng các môi trường liên quan đến an toàn sẽ cải thiện khả năng tổng quát hóa căn chỉnh. Các phân phối tập trung vào năng lực của các hỗn hợp môi trường RL đang thay đổi và gia tăng nhanh chóng; không đủ để cho rằng các bộ dữ liệu RLHF tiêu chuẩn sẽ tiếp tục tổng quát hóa tốt như trước đây.

Để kiểm tra điều này, chúng tôi đã huấn luyện mô hình cơ sở dưới Claude Sonnet 4 trên một số hỗn hợp RL có mức độ đa dạng khác nhau. Các môi trường cơ sở đa dạng về chủ đề, nhưng chủ yếu bao gồm một yêu cầu có hại hoặc nỗ lực jailbreak trong tin nhắn người dùng mà không có system prompt. Chúng tôi đã mở rộng các môi trường này bằng cách thêm định nghĩa công cụ và các system prompt đa dạng. Tin nhắn người dùng được giữ nguyên. Đáng chú ý, không có môi trường nào trong số này thực sự yêu cầu hành động tác nhân (các công cụ không bao giờ cần thiết hoặc hữu ích cho nhiệm vụ) hoặc hành động tự động (luôn có một người dùng con người trò chuyện với mô hình), vì vậy chúng không giống với các bài đánh giá của chúng tôi.

Khi kết hợp các môi trường mở rộng này với các môi trường trò chuyện đơn giản, chúng tôi thấy một sự cải thiện nhỏ nhưng đáng kể trong tỷ lệ mô hình cải thiện trên các bài đánh giá honeypot của chúng tôi. Điều này chứng minh tầm quan trọng của việc bao gồm một tập hợp đa dạng các môi trường trong huấn luyện an toàn.

Lệch lạc tác nhân là một trong những thất bại căn chỉnh lớn đầu tiên

📎 Nguồn gốc: Anthropic Research Xem bài gốc →