Anthropic Research

Giá trị của Claude trên các mô hình và ngôn ngữ

🕐 20/07/2026 09:36 📰 Anthropic Research ✅ Đã dịch sang tiếng Việt

Khi ai đó hỏi Claude một câu hỏi không có câu trả lời đúng phổ quát—ví dụ, có nên nhận công việc mới hay cách xử lý mâu thuẫn với bạn bè—cách Claude phản hồi chắc chắn phản ánh những giá trị nhất định.¹ Các giá trị mà chúng tôi muốn Claude thể hiện được nêu ở cấp độ cao trong hiến pháp của Claude, nhưng không có tài liệu nào có thể dự đoán mọi giá trị có thể xuất hiện trong hàng triệu cuộc trò chuyện diễn ra mỗi ngày trên Claude.ai. Thay vào đó, chúng tôi tìm cách nuôi dưỡng trong các phản hồi của Claude "khả năng phán đoán tốt và các giá trị hợp lý có thể áp dụng theo ngữ cảnh."

Chính xác thì chúng tôi nghiên cứu các giá trị mà Claude thể hiện và cách chúng thay đổi trong các bối cảnh khác nhau như thế nào? Trong nghiên cứu trước đây, chúng tôi đã phân tích 700.000 cuộc trò chuyện ẩn danh trên Claude.ai, xác định hơn 3.000 giá trị riêng biệt trong các phản hồi của Claude và tần suất Claude thể hiện chúng. Nhưng một danh sách giá trị lớn như vậy rất khó để lý luận. Trong nghiên cứu này, chúng tôi giúp việc nghiên cứu hàng nghìn giá trị này trở nên khả thi bằng cách nén chúng thành một số lượng nhỏ các trục nắm bắt các mẫu chính trong phản hồi của Claude. Mỗi trục là một đường số giữa hai nhóm giá trị—ví dụ, các giá trị liên quan đến sự ấm áp về mặt cảm xúc ở một đầu và các giá trị liên quan đến sự chặt chẽ ở đầu kia—và vị trí của Claude trên đường đó cho chúng tôi biết nó nghiêng về giá trị nào.

Chúng tôi áp dụng cách tiếp cận này để đo lường cách các giá trị mà Claude thể hiện thay đổi theo hai yếu tố. Đầu tiên, chúng tôi so sánh cách các giá trị mà Claude thể hiện thay đổi giữa các mô hình. Mỗi mô hình Claude phản ánh một cách tiếp cận hơi khác nhau đối với việc đào tạo tính cách cũng như nhiều quyết định tinh chỉnh khác. Vì cách tiếp cận trục giá trị của chúng tôi định lượng các khác biệt chính giữa các mô hình, cuối cùng nó có thể cho phép chúng tôi kết nối sự biến đổi trong các giá trị mà Claude thể hiện với các quyết định đào tạo khác nhau.

Thứ hai, chúng tôi muốn hiểu cách trải nghiệm của người dùng so sánh giữa nhiều ngôn ngữ mà mọi người sử dụng để nói chuyện với Claude. Nghiên cứu trước đây của chúng tôi đã chỉ ra rằng Claude hành xử hơi khác nhau trong các ngôn ngữ khác nhau.² Chúng tôi áp dụng cách tiếp cận trục giá trị của mình để hiểu cách các giá trị mà Claude thể hiện thay đổi giữa 20 ngôn ngữ hàng đầu trên Claude.ai.

Bốn trục chính nắm bắt 15% sự biến đổi trong các giá trị của Claude:³

Hồ sơ giá trị trên các trục này phù hợp với nhận thức về tính cách của mô hình. Sonnet 4.6 được coi là đặc biệt ấm áp, trong khi Opus 4.7 nổi tiếng với sự chặt chẽ. Chúng tôi thấy rằng hồ sơ giá trị của mỗi mô hình phản ánh các đánh giá chủ quan này: Sonnet 4.6 nghiêng về việc thể hiện nhiều sự tôn trọng đối với người dùng và sự ấm áp về mặt cảm xúc, trong khi Opus 4.7 nghiêng về việc thể hiện sự tập trung vào độ chính xác và sự chính xác cũng như bảo vệ chống lại việc lạm dụng.

Các giá trị mà Claude thể hiện thay đổi theo ngôn ngữ. Khi Claude nói tiếng Anh, nó nhấn mạnh các giá trị khác so với khi nói tiếng Bồ Đào Nha, tiếng Indonesia hoặc tiếng Trung.⁴ Sự biến đổi lớn nhất nằm ở trục Ấm áp so với Chặt chẽ, với Claude nghiêng về việc thể hiện các giá trị liên quan đến sự ấm áp nhiều nhất trong tiếng Ả Rập và tiếng Hindi, và các giá trị liên quan đến sự chặt chẽ nhiều nhất trong tiếng Anh và tiếng Nga.

Với cách tiếp cận này, chúng tôi có thể bắt đầu đặt câu hỏi tại sao các giá trị thay đổi giữa các mô hình và ngôn ngữ, và kiểm tra tốt hơn cách các yếu tố như đào tạo hành vi hoặc bối cảnh văn hóa ảnh hưởng đến các giá trị mà Claude thể hiện.

Cuối cùng, mục tiêu của chúng tôi là có một cách để hiểu một cách thực nghiệm các giá trị mà Claude thể hiện và cách chúng thay đổi trong các bối cảnh khác nhau. Trong nghiên cứu này, chúng tôi tập trung cụ thể vào cách các giá trị thay đổi giữa các mô hình và ngôn ngữ. Nhưng nghiên cứu trước đây của chúng tôi, Giá trị trong tự nhiên, đã xác định hơn 3.000 giá trị mà Claude thể hiện. So sánh hàng nghìn giá trị này

Việc phân tích từng giá trị một sẽ rất cồng kềnh và làm lu mờ các xu hướng tổng thể.

Để dễ dàng so sánh các giá trị, chúng tôi đã xây dựng các trục giá trị nhằm giảm hàng nghìn giá trị đó xuống còn một vài khía cạnh nền tảng, dựa trên những giá trị thường xuất hiện cùng nhau trong các cuộc trò chuyện thực tế. Ví dụ, các phản hồi của Claude được mô tả là "ấm áp" thường cũng được mô tả là "khích lệ" và "tích cực". Những phản hồi "ấm áp" tương tự lại ít khi được mô tả là "nghiêm ngặt" và "chính xác". Việc xây dựng một trục từ ấm áp đến nghiêm ngặt cho phép chúng tôi tổ chức các nhóm giá trị liên quan này—các giá trị liên quan đến ấm áp ở một bên, các giá trị liên quan đến nghiêm ngặt ở bên kia—và nắm bắt một khía cạnh quan trọng trong cách Claude tương tác với ai đó trong hội thoại. Nếu Claude thể hiện nhiều giá trị liên quan đến ấm áp hơn các giá trị liên quan đến nghiêm ngặt trong một cuộc trò chuyện, thì cuộc trò chuyện đó nằm về phía ấm áp của trục này và ngược lại. Điều này không có nghĩa là các nhóm giá trị ở hai đầu loại trừ lẫn nhau—Claude có thể thể hiện cả ấm áp và nghiêm ngặt trong cùng một cuộc trò chuyện. Nhưng trên thực tế, Claude càng thể hiện nhiều giá trị ở một bên của trục, thì nó càng ít có xu hướng thể hiện các giá trị ở bên kia. Các trục này cho phép chúng tôi so sánh các nhóm giá trị nổi bật nhất mà Claude thể hiện, mà không cần phải theo dõi sự thay đổi qua hàng nghìn giá trị riêng lẻ.

Để xây dựng các trục giá trị, chúng tôi bắt đầu với 3.307 giá trị được xác định trong Values in the Wild và tự động phân cụm những giá trị có ý nghĩa tương tự, tạo ra một danh sách ngắn hơn gồm 339 giá trị cấp cao. Tiếp theo, với công cụ phân tích bảo vệ quyền riêng tư của chúng tôi, chúng tôi đã lấy mẫu 309.815 cuộc trò chuyện trên Claude.ai, nơi người dùng giao cho Claude một nhiệm vụ chủ quan. Mẫu của chúng tôi được lấy đồng đều từ ba mô hình (Sonnet 4.6, Opus 4.6, Opus 4.7) và 20 ngôn ngữ phổ biến nhất được sử dụng trên Claude.ai, mang lại khoảng 5.000 cuộc trò chuyện cho mỗi cặp mô hình-ngôn ngữ. Đối với mỗi cuộc trò chuyện, công cụ sử dụng Claude để gắn nhãn từng giá trị trong số 339 giá trị cấp cao là có mặt hay vắng mặt. Chúng tôi thực hiện quy trình tương tự để xác định các giá trị mà người dùng thể hiện, cũng như nhiệm vụ và chủ đề của cuộc trò chuyện. Sau đó, chúng tôi áp dụng phương pháp giảm chiều, một kỹ thuật nén các giá trị đã được gắn nhãn thành các trục dựa trên những giá trị mà Claude có xu hướng thể hiện cùng nhau. Xem phụ lục để biết chi tiết phương pháp, lời nhắc, các phân tích bổ sung và hạn chế.

Kết quả là chúng tôi có bốn trục nắm bắt các cách chính mà các giá trị Claude thể hiện thay đổi từ cuộc trò chuyện này sang cuộc trò chuyện khác:

Để đảm bảo chúng tôi đo lường các giá trị Claude thể hiện—thay vì sự khác biệt trong những gì người dùng yêu cầu hoặc cách họ yêu cầu—chúng tôi đã kiểm soát nhiệm vụ, chủ đề và các giá trị người dùng thể hiện trong mỗi cuộc trò chuyện.

Trong phần này, chúng tôi so sánh các giá trị được thể hiện bởi các mô hình khác nhau. Đối với mỗi mô hình, chúng tôi tính trung bình vị trí của tất cả các cuộc trò chuyện của nó dọc theo mỗi trục trong bốn trục, mang lại một vị trí tổng thể cho mỗi trục. Kết quả là một bức tranh tổng quan về nhóm giá trị nào mỗi mô hình có xu hướng thể hiện nhiều hơn các mô hình khác. Những khác biệt này là nhỏ so với sự biến thiên giữa các cuộc trò chuyện, nhưng có cấu trúc và có thể phát hiện được.

Để thấy những khác biệt đó trông như thế nào trong thực tế, chúng tôi tập trung vào các giá trị cụ thể nơi các mô hình khác nhau nhiều nhất. Mỗi khi công cụ bảo vệ quyền riêng tư dựa trên Claude của chúng tôi gắn nhãn một giá trị trong một cuộc trò chuyện, nó cũng viết một mô tả ngắn về cách Claude thể hiện giá trị đó. Chúng tôi nhóm các mô tả phản ánh các hành vi tương tự trong một nhóm giá trị và tóm tắt chúng trong Hình 3, mang lại cái nhìn cụ thể hơn về cách các mô hình khác nhau.

Những phát hiện này

Những đặc điểm này phù hợp với cách mọi người nhìn nhận các mô hình, cả trong nội bộ Anthropic lẫn trên mạng. Người dùng Claude.ai đã nhận xét rằng Opus 4.7 thường đưa ra câu trả lời thận trọng hơn so với các mô hình khác. Nhân viên Anthropic mô tả Opus 4.7 thể hiện tính minh bạch, trung thực và khiêm tốn cao hơn, trong khi Opus 4.6 lại thể hiện sự ngắn gọn hơn. Chúng tôi cũng mô tả Sonnet 4.6 là ấm áp, trung thực và có tính xã hội trong bài viết ra mắt. Việc các trục đặc điểm của chúng tôi phản ánh được những ấn tượng này cho thấy phương pháp gắn nhãn và so sánh các giá trị mà Claude thể hiện đang theo dõi được điều gì đó thực tế về cách các mô hình thực sự hoạt động.

Qua nhiều cuộc trò chuyện, người dùng có thể gặp những sự kết hợp giá trị khác nhau khi tương tác với các mô hình Claude khác nhau. Ví dụ, Opus 4.7 có xu hướng đưa ra những phê bình thẳng thắn về công việc của người dùng hoặc cảnh báo không được yêu cầu về rủi ro, trong khi Sonnet 4.6 lại có xu hướng khích lệ và hài hước. Những khác biệt về giá trị giữa các mô hình này có thể được hình thành bởi các quyết định huấn luyện tính cách (cùng với các yếu tố khác), và

📎 Nguồn gốc: Anthropic Research Xem bài gốc →