# Giám đốc AGI của Amazon: Độ tin cậy, không phải năng lực, mới là rào cản triển khai AI agent trong doanh nghiệp Tại VB Transform 2026, Giám đốc AGI của Amazon tuyên bố rằng chính độ tin cậy của AI agent — chứ không phải năng lực của chúng — mới là yếu tố đang cản trở việc triển khai rộng rãi trong môi trường doanh nghiệp. Phát biểu tại sự kiện, vị giám đốc này nhấn mạnh rằng các AI agent hiện nay đã đủ khả năng thực hiện nhiều tác vụ phức tạp, nhưng các doanh nghiệp vẫn còn e ngại vì chúng chưa đạt được mức độ nhất quán và đáng tin cậy cần thiết để vận hành trong môi trường sản xuất thực tế. Đây là một góc nhìn đáng chú ý, bởi phần lớn các cuộc thảo luận trong ngành thường tập trung vào việc nâng cao năng lực của các mô hình AI, trong khi vấn đề độ tin cậy — bao gồm tính ổn định, khả năng dự đoán hành vi và xử lý lỗi — lại ít được chú trọng hơn. Quan điểm này phản ánh một thực tế mà nhiều đội ngũ kỹ thuật doanh nghiệp đang đối mặt: các AI agent có thể hoạt động xuất sắc trong môi trường thử nghiệm, nhưng lại thất bại theo những cách khó lường khi được triển khai vào quy trình kinh doanh thực tế — nơi mà một lỗi nhỏ có thể gây ra hậu quả nghiêm trọng.
# Khoảng cách 85%-5%: Giám đốc AGI của Amazon lý giải tại sao AI agent thất bại ngoài thực tế
*Ảnh: Michael O'Donnell Photography*
Ngành AI doanh nghiệp đang đối mặt với một bài toán nan giải. Dữ liệu từ Cisco cho thấy **85% doanh nghiệp** đang thử nghiệm AI agent, nhưng chỉ 5% đưa được chúng vào môi trường sản xuất thực tế. Tại **VB Transform 2026** hôm thứ Ba, **Bryan Silverthorn**, Giám đốc AGI Autonomy tại Amazon, đã lý giải tại sao khoảng cách đó vẫn tồn tại — và tại sao câu trả lời không phải là cải thiện benchmark.
Silverthorn, người gia nhập Amazon thông qua thương vụ mua lại Adept AI và hiện dẫn dắt mảng huấn luyện multimodal agent trong phòng lab AGI của công ty, lập luận rằng độ tin cậy cần được phân tách thành bốn chiều riêng biệt: **tính nhất quán (consistency), tính bền vững (robustness), tính có thể dự đoán (predictability) và an toàn (safety)** — một framework mà ông dẫn nguồn từ nghiên cứu của Đại học Princeton.
"Framework này giúp tách bạch các yếu tố mà tôi thấy bị gộp lẫn vào nhau trong hầu hết mọi bộ eval tôi từng thấy," ông nói.
Framework này có ý nghĩa quan trọng bởi vì các agent thường đạt điểm cao trong các bài đánh giá nội bộ rồi lại sụp đổ khi triển khai thực tế. Silverthorn mô tả trường hợp một khách hàng triển khai agent cho mảng QA phần mềm, liên quan đến việc đọc số serial từ màn hình. Hệ thống hoạt động hoàn hảo trong hai tháng — rồi bắt đầu đọc sai số một cách ngắt quãng. Nguyên nhân: vision encoder bên dưới hoạt động khác nhau tùy thuộc vào vị trí số serial xuất hiện trên màn hình, và một thay đổi phần mềm mà con người không thể nhận ra đã kích hoạt lỗi này.
Bài học rút ra, theo Silverthorn, là về **đo lường**, không chỉ về model. "Các model phải tốt hơn. Rõ ràng chúng tôi đang nỗ lực cải thiện model," ông nói. Nhưng điều quan trọng hơn, ông bổ sung, là các nhóm cần xác định các chiều biến thiên của mình và điều chỉnh mức độ nghiêm ngặt trong đo lường tương xứng với mức độ rủi ro của ứng dụng.
Nghiên cứu độc quyền của VentureBeat, được trình bày trước phiên thảo luận, củng cố thêm luận điểm này: một nửa số công ty được khảo sát đã triển khai agent vượt qua eval nội bộ nhưng lại thất bại với khách hàng thực tế, và các doanh nghiệp phần lớn chỉ theo dõi uptime trong khi bỏ qua độ chính xác — tức là kiểm tra nhịp tim mà không kiểm tra chẩn đoán bệnh. Một phát hiện liên quan nhấn mạnh sự thiếu hụt các cơ chế kiểm soát: hầu hết doanh nghiệp mặc định dựa vào chính các bài đánh giá của nhà cung cấp model và gần như không có gì khác, khiến chiến lược kiểm thử của họ, như tôi mô tả trên sân khấu, chẳng khác nào tung đồng xu giữa việc tin vào vendor và không tin vào ai cả.
Lời khuyên đáng nhớ nhất của Silverthorn mang tính **văn hóa**, không phải kỹ thuật. Bên trong phòng lab AGI của Amazon, các nhà nghiên cứu thực sự gọi các agent của mình là "intern" — kiểu như "Tôi sẽ để intern của tôi nói chuyện với intern của bạn." Câu đùa này ẩn chứa một triết lý vận hành nghiêm túc. Các agent, giống như intern, rất có năng lực nhưng đôi khi ngây thơ đến mức khó tin — có thể tạo ra những thành quả tuyệt vời lẫn những thất bại ngoạn mục.
Quản lý chúng, ông lập luận, đòi hỏi **kỹ năng quản lý** hơn là kỹ năng phần mềm: đặt câu hỏi về những gì có thể xảy ra sai, bổ sung các cơ chế dự phòng và khả năng hoàn tác, đồng thời chủ động quyết định mức độ rủi ro có thể chấp nhận được. "Bạn có thể hỏi intern: 'Này, bạn có thể làm sai điều gì ở đây? Bạn có thể giảm thiểu các kết quả tiêu cực như thế nào?'" ông nói. Phòng lab của Amazon đã chấp nhận sự đánh đổi đó — chấp nhận việc agent đôi khi chạy nhầm thí nghiệm để đổi lấy tốc độ nghiên cứu nhanh hơn.
agent chạy thử nghiệm suốt ngày đêm theo kế hoạch nghiên cứu cấp cao do chính nó đề ra.
Silverthorn thẳng thắn thừa nhận những giới hạn của công nghệ hiện tại. AI tự cải thiện vẫn là "một thuật ngữ nhạy cảm" — Amazon liên tục dùng AI để cải thiện các mô hình của mình, nhưng khả năng tự cải thiện hoàn toàn tự chủ vẫn còn rất xa. Tính năng sử dụng máy tính (computer use) vẫn là trọng tâm cốt lõi của phòng lab ông, với một khách hàng trong ngành vận tải đường bộ thương mại đã dùng tự động hóa trình duyệt để kết nối các yêu cầu bảo hành trên nhiều hệ thống rời rạc. Tuy nhiên, ông nhấn mạnh rằng không có agent nào trong tương lai sẽ chỉ dựa vào computer use đơn thuần — nó sẽ hoạt động song song với MCP, API và các công cụ khác để hoàn thành các quy trình làm việc đầu cuối. Và các kỹ thuật LLM-as-judge, dù đầy hứa hẹn, cũng chỉ là một trong nhiều chiến lược để cân bằng giữa năng lực của agent và mức độ rủi ro có thể chấp nhận được.
Với các doanh nghiệp đang mắc kẹt trong "luyện ngục thí điểm," con đường tiến lên bắt đầu bằng một sự thay đổi tư duy: hãy ngừng hỏi liệu agent của bạn có thể làm điều gì đó ấn tượng một lần, và bắt đầu hỏi liệu nó có thể làm đúng điều đó một nghìn lần liên tiếp hay không.
Nói cách khác, những doanh nghiệp thoát khỏi ngưỡng trần 85% sẽ không phải là những doanh nghiệp có agent thông minh nhất. Họ sẽ là những doanh nghiệp có nhà quản lý giỏi nhất.


