Khoảng cách đánh giá tác nhân: Các tổ chức AI doanh nghiệp đang gặp vấn đề về sự phù hợp với thực tế, chứ không phải vấn đề về phạm vi bao phủ — và hầu hết vẫn đang đưa sản phẩm vào vận hành.
Trên 157 doanh nghiệp, các tổ chức đang trao cho tác nhân AI nhiều quyền tự chủ hơn trong khi lại ít tin tưởng vào các đánh giá được thiết kế để kiểm soát quyền tự chủ đó. Một nửa đã triển khai một tác nhân vượt qua đánh giá nội bộ nhưng sau đó gây ra lỗi cho khách hàng trong môi trường sản xuất; chỉ một phần hai mươi hoàn toàn tin tưởng vào đánh giá tự động hiện nay; và điểm yếu được chỉ ra nhiều nhất là các đánh giá không phù hợp với kết quả thực tế. Tuy nhiên, hai phần ba đã cho phép hoặc đang tích cực phát triển để triển khai các thay đổi tác nhân lên môi trường sản xuất chỉ dựa trên đánh giá tự động — mà không có sự can thiệp của con người. Kết quả là một khoảng cách đánh giá — khoảng cách giữa mức độ tự chủ mà doanh nghiệp trao cho tác nhân của họ và mức độ tin tưởng vào các bài kiểm tra được cho là để phát hiện lỗi.
Làn sóng Nghiên cứu VentureBeat Pulse này xem xét cách các nhà lãnh đạo kỹ thuật đo lường hiệu suất của tác nhân: nền tảng độ tin cậy và đánh giá nào họ sử dụng, cách họ chọn và tin tưởng chúng, điều gì gây ra lỗi trong sản xuất, và mức độ họ sẵn sàng để tác nhân hoạt động mà không có sự can thiệp của con người.
Phát hiện trung tâm là một khoảng cách đánh giá — khoảng cách giữa quyền tự chủ mà doanh nghiệp trao cho tác nhân của họ và sự tin tưởng vào các đánh giá được thiết kế để quản lý nó. Một nửa tổ chức (50%) trong năm qua đã triển khai một tác nhân hoặc tính năng LLM vượt qua đánh giá nội bộ nhưng sau đó gây ra lỗi cho khách hàng, và một phần tư đã chứng kiến điều này xảy ra nhiều hơn một lần. Niềm tin vào các bài kiểm tra rất mỏng manh: chỉ 5% nói rằng họ hoàn toàn tin tưởng vào đánh giá tự động hiện nay, và hạn chế được chỉ ra nhiều nhất là các đánh giá không phù hợp với kết quả thực tế (29%). Các doanh nghiệp đang phát hiện ra rằng một đánh giá đạt yêu cầu không đồng nghĩa với một tác nhân hoạt động tốt.
Điều làm cho khoảng cách này trở nên quan trọng là hướng phát triển. Hai phần ba tổ chức (66%) đã cho phép triển khai hoàn toàn tự động, không có sự can thiệp của con người cho các tác nhân rủi ro thấp (34%) hoặc đang tích cực phát triển đường ống để cho phép điều này trong vòng mười hai tháng (33%). Đồng thời, hệ thống đánh giá phải đạt được sự tin tưởng đó lại phân mảnh và chưa trưởng thành: các công cụ chính phổ biến nhất là đánh giá gốc từ nhà cung cấp mô hình, ngang bằng với việc không có công cụ chuyên dụng nào (mỗi loại 17%); và chỉ khoảng một phần tư doanh nghiệp chạy kiểm tra chất lượng thời gian thực trên lưu lượng sản xuất trực tiếp. Quyền tự chủ đang đến nhanh hơn sự đảm bảo.
VentureBeat đã thực hiện khảo sát này như một phần của loạt Nghiên cứu Pulse đang diễn ra, khảo sát này — Bảng theo dõi Độ tin cậy & Đánh giá Tác nhân — tập trung vào cách các nhà lãnh đạo kỹ thuật đánh giá hiệu suất và độ tin cậy của tác nhân. Các phản hồi được lọc từ các tổ chức có 100 nhân viên trở lên (n=157), được lấy từ một cuộc khảo sát duy nhất vào tháng 6 năm 2026; vì đây là một làn sóng duy nhất thay vì mẫu tổng hợp nhiều tháng, báo cáo đọc theo mặt cắt ngang và không suy luận xu hướng theo tháng. Đối với các câu hỏi có nhiều lựa chọn, tỷ lệ đó có thể cộng lại hơn 100%.
Về vai trò, mẫu là cấp cao và có uy tín mua hàng: 38% là người ra quyết định cuối cùng cho các giao dịch mua AI và 34% khác là người đề xuất hoặc ảnh hưởng. Quản lý sản phẩm và chương trình (15%), nhà tư vấn và cố vấn (10%), giám đốc kỹ thuật/CNTT (8%), và CIO/CTO/CISO (8%) dẫn đầu các chức danh cụ thể, cùng với một nhóm "Khác" lớn (37%). Về quy mô tổ chức, mẫu nghiêng về thị trường trung bình: 100–499 (37%) và 500–2,499 (27%) nhân viên dẫn đầu, tiếp theo là 2,500–9,999 (20%), 10,000–49,999 (10%), và 50,000+ (6%). Công nghệ/Phần mềm là ngành lớn nhất với 23%, tiếp theo là Bán lẻ.
l/ Người tiêu dùng (15%), Chăm sóc sức khỏe/Khoa học đời sống (12%) và Sản xuất (10%).
Với 157 người trả lời, mẫu đủ lớn để đọc theo hướng nhưng nên được coi là tín hiệu định hướng thay vì đo lường chính xác; nó được tự chọn và không phải là mẫu xác suất. Mẫu nghiêng về thị trường trung cấp, vì vậy tốt nhất nên đọc như góc nhìn từ các tổ chức đang tích cực thiết lập các thực hành đánh giá tác nhân thay vì từ các nhà vận hành lớn nhất.
Lưu ý: Khảo sát này được xây dựng lại cho đợt tháng 6 từ khảo sát trước đó về "Khả năng quan sát và đánh giá LLM"; vì các câu hỏi và mẫu khác nhau, không có so sánh nào được thực hiện với dữ liệu tháng 4–5.
Một nửa đã triển khai tác nhân vượt qua đánh giá nhưng thất bại trước khách hàng
Chúng tôi hỏi liệu trong 12 tháng qua, các tổ chức có triển khai tác nhân hoặc tính năng LLM vượt qua đánh giá nội bộ nhưng sau đó gây ra lỗi đối mặt với khách hàng hay không. Một nửa số tổ chức thực hiện đánh giá đã gặp phải điều này.
Phát hiện 1 — Đánh giá đạt yêu cầu không đồng nghĩa với tác nhân hoạt động tốt
Đây là con số định nghĩa của báo cáo. Một nửa tổ chức (50%) đã triển khai tính năng AI vượt qua đánh giá nội bộ nhưng sau đó thất bại trước khách hàng — đầu ra sai, quy trình bị hỏng hoặc sự cố chất lượng — và một phần tư đã thấy điều này xảy ra nhiều hơn một lần. Chỉ 36% báo cáo không có lỗi như vậy, và phần còn lại hoặc không thực hiện đánh giá trước triển khai (8%) hoặc không theo dõi đủ chặt chẽ nguyên nhân gốc rễ để biết (6%). Lỗi này chính xác và tốn kém: đánh giá nói rằng tác nhân đã sẵn sàng, nhưng thực tế không phải vậy. Mọi thứ tiếp theo — cách doanh nghiệp tin tưởng vào đánh giá của họ, họ giám sát gì và họ cho phép bao nhiêu quyền tự chủ — đều được định hình bởi trải nghiệm này.
Khiếu nại hàng đầu: Đánh giá không khớp với kết quả thực tế
Chúng tôi hỏi hạn chế nào làm giảm niềm tin vào đánh giá tác nhân tự động nhất hiện nay. Chỉ một phần nhỏ doanh nghiệp không có khiếu nại nào.
Phát hiện 2 — Hầu như không ai hoàn toàn tin tưởng vào đánh giá tự động
Niềm tin vào đánh giá tự động rất hiếm và cụ thể. Chỉ 5% tổ chức nói rằng họ hoàn toàn tin tưởng vào đánh giá tự động như hiện tại — nghĩa là 95% nêu ra một hạn chế khiến họ chùn bước. Phổ biến nhất, ở mức 29%, là hạn chế giải thích trực tiếp nhất Phát hiện 1: đánh giá khớp kém với kết quả thực tế, vượt qua các tác nhân sau đó thất bại. Thiên lệch hoặc không nhất quán (21%) và thiếu khả năng giải thích (18%) theo sau — doanh nghiệp không phải lúc nào cũng biết tại sao đánh giá đưa ra kết luận — và 17% đề cập đến lo ngại về rò rỉ dữ liệu hoặc quyền riêng tư trong chính quy trình đánh giá. Các bài kiểm tra nhằm chứng nhận tác nhân chưa được tin tưởng để chứng nhận chúng, đó chính xác là lý do tại sao quỹ đạo tự chủ trong Phát hiện 3 lại nổi bật đến vậy.
Hai phần ba đã cho phép hoặc đang xây dựng hướng tới triển khai không có con người
Chúng tôi hỏi liệu các tổ chức có để một tác nhân tự động triển khai thay đổi mã hoặc hệ thống lên sản xuất chỉ dựa trên kết quả đánh giá tự động, không có xác nhận của con người trong vòng lặp hay không. Quỹ đạo đi thẳng qua khoảng cách niềm tin.
Phát hiện 3 — Giới hạn tự chủ vẫn đang tăng lên
Đây là nghịch lý trung tâm của báo cáo. Mặc dù hầu như không ai hoàn toàn tin tưởng vào đánh giá tự động (Phát hiện 2), hai phần ba tổ chức (66%) hoặc đã cho phép triển khai không có con người trong vòng lặp cho các tác nhân rủi ro thấp (34%) hoặc đang tích cực xây dựng đường ống của họ để cho phép điều này trong vòng một năm (33%). Chỉ 22% loại trừ điều này trong tương lai gần. Hướng đi là rõ ràng: các doanh nghiệp đang tiến tới để đánh giá tự động kiểm soát sản xuất một cách tự chủ — loại bỏ kiểm tra của con người — tại thời điểm
Ngay tại thời điểm họ nói những đánh giá đó không khớp một cách đáng tin cậy với thực tế. Trần tự chủ đang tăng nhanh hơn lớp bảo đảm bên dưới nó, đây chính là cơ chế khiến các thất bại do tự tin sai lầm từ Phát hiện 1 sẽ mở rộng quy mô thay vì thu hẹp lại.
Đáng chú ý, canh bạc về tự chủ không chỉ là hiện tượng của các công ty nhỏ. Khi chia mẫu theo quy mô công ty, các doanh nghiệp lớn hơn đang tiến xa hơn một chút trên con đường tiến tới không có sự xem xét của con người so với các công ty nhỏ hơn (70% so với 64%) và có khả năng cao hơn một chút là đã triển khai một tác nhân vượt qua đánh giá nhưng sau đó lại làm khách hàng thất vọng (54% so với 48%). Giả định rằng các tổ chức lớn, được quản lý chặt chẽ sẽ giữ con người trong vòng lặp lâu nhất, trong mẫu này, lại hoàn toàn ngược lại. Phải nói rõ rằng, đây chỉ là những con số mang tính định hướng, vì khảo sát không có mẫu lớn — 57 người trả lời từ các công ty có 2.500+ nhân viên và 100 người từ các công ty nhỏ hơn.
Đánh giá gốc từ nhà cung cấp dẫn đầu — ngang hàng với việc không có công cụ chuyên dụng nào
Chúng tôi đã hỏi về độ tin cậy của tác nhân hoặc đánh giá


