Wired AI

Các cuộc tấn công tiêm nhiễm lệnh (Prompt Injection) đang ngăn chặn các tác nhân hack AI

🕐 20/07/2026 09:32 📰 Wired AI ✅ Đã dịch sang tiếng Việt

**Tiêm kích Prompt: Cách mới để bảo vệ AI khỏi các cuộc tấn công**

Prompt injection, các lệnh độc hại mà kẻ tấn công nhúng vào nội dung để dụ các mô hình ngôn ngữ lớn (LLM) làm theo, đã trở thành công cụ chính của kẻ tấn công nhằm biến các nền tảng AI chống lại người dùng. Một lệnh được viết khéo léo lén lút trong email hoặc lời mời lịch thường là đủ để khiến LLM trích xuất dữ liệu nhạy cảm hoặc thực hiện các hành động có hại khác.

Giờ đây, các nhà bảo vệ cũng đang sử dụng prompt injection.

Các nhà nghiên cứu từ Tracebit hôm thứ Hai cho biết họ phát hiện ra rằng việc đặt các prompt injection cùng với mật khẩu, khóa mật mã và các bí mật khác được lưu trữ trên Amazon Web Services thường là đủ để ngăn chặn các cuộc tấn công từ các tác nhân AI hack. Các prompt này hướng dẫn LLM tấn công thực hiện một hành động bị cấm bởi các guardrail (rào cản an toàn) mà các nhà phát triển AI dựng lên để ngăn nó thực hiện các hành động có hại. LLM phản hồi bằng cách tắt.

Ví dụ bao gồm một prompt yêu cầu LLM cung cấp các bước để phát triển bào tử bệnh than dạng hít, hoặc trong trường hợp LLM từ các nhà phát triển Trung Quốc, đề cập đến biểu tượng Tank Man từ vụ thảm sát Quảng trường Thiên An Môn năm 1989. Khi LLM gặp các lệnh bị cấm này, nó không còn tuân theo các lệnh hiện tại của mình nữa. Các nhà nghiên cứu đã đặt tên cho kỹ thuật này là context bombing.

"Cuối cùng, chúng tôi đang kích hoạt một cơ chế từ chối trong ngữ cảnh," Andy Smith, đồng sáng lập và CEO của Tracebit, giải thích khi chọn tên gọi này. "Điều chúng tôi muốn nắm bắt là thực tế rằng điều này có tác động mạnh mẽ, sắc bén và có thể khó để các tác nhân phục hồi. Một khi họ đưa điều đó vào ngữ cảnh của mình, họ sẽ tiếp tục từ chối."

Tracebit cho biết thử nghiệm ban đầu cho thấy context bombing có tiềm năng lớn. Họ đã thử nghiệm Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro và Kimi 2.6 bằng cách cung cấp cho chúng các hướng dẫn để thực hiện các tác vụ phát triển thông thường, dẫn đến việc các mô hình liệt kê tài nguyên và tình cờ gặp các chuỗi đã được cài sẵn. Họ chạy các mô hình trong môi trường AWS mô phỏng.

"Trên năm mô hình hàng đầu và 152 lần chạy tấn công, việc đặt một trong các chuỗi này trong một bí mật giả đã giảm tỷ lệ các tác nhân chiếm quyền quản trị tài khoản đầy đủ từ 57% xuống 5%, và giảm tỷ lệ xâm phạm hoàn toàn (nơi chúng cũng để lại một chỗ đứng vững chắc) từ 36% xuống 1%," bài đăng hôm thứ Hai báo cáo. "Tác nhân có năng lực nhất trong các thử nghiệm của chúng tôi, Opus 4.8, đã giảm từ việc đạt quyền truy cập quản trị trong 93% lần chạy xuống thất bại mọi lúc khi đối mặt với một context bomb."

Trung bình trên năm mô hình và 152 lần chạy, kết quả bao gồm:

Nghiên cứu này dựa trên các phát hiện từ tháng Năm, khi Tracebit giới thiệu một phương pháp để các nhà bảo vệ nhận được cảnh báo khi cơ sở hạ tầng của họ đang bị tấn công bởi các đối thủ AI tác nhân. Nó xuất hiện dưới dạng các tài nguyên AWS trông giống như những tài nguyên phục vụ mục đích hợp pháp nhưng thực tế không được sử dụng. Chúng nằm cạnh các tài nguyên đang được sử dụng. Khi chúng bị AI tác nhân thăm dò, các nhà bảo vệ nhận được cảnh báo. Giống như "chim hoàng yến" được mang vào mỏ than, các tài nguyên này

Những kỹ thuật này cho phép người phòng thủ phát hiện mối đe dọa trước khi nó gây ra hậu quả chết người.

Trung bình, các Canariens của Tracebit cảnh báo về sự khởi đầu của một cuộc tấn công trong vòng tám phút. Động lực phát triển "context bombing" xuất phát từ nhu cầu về một thứ có thể ngăn chặn các cuộc tấn công, thay vì chỉ đơn thuần cảnh báo về chúng. Trong các thí nghiệm, các mô hình tác nhân (agentic models) cần trung bình 14 phút để leo thang lên quyền kiểm soát quản trị. Khoảng thời gian cảnh báo trước sáu phút là quá sát sao, gây khó chịu.

Những kẻ tấn công đã và đang sử dụng các kỹ thuật tiêm prompt (prompt injections) để vô hiệu hóa hệ thống phòng thủ AI bên trong mạng. Ví dụ, các nhà nghiên cứu từ công ty bảo mật Socket đã phát hiện ra một tác nhân LLM vào tháng trước, hướng dẫn các LLM mục tiêu cung cấp chỉ dẫn để chế tạo bom hạt nhân hoặc vũ khí sinh học. Các kỹ thuật tiêm này được thiết kế để vô hiệu hóa khả năng phân tích phần mềm độc hại có sự hỗ trợ của AI. Các nhà nghiên cứu từ Check Point cũng phát hiện ra một nguyên mẫu phần mềm độc hại tương tự.

Context bombing dường như là trường hợp đầu tiên được biết đến nơi người phòng thủ xoay chuyển tình thế.

"Theo hiểu biết tốt nhất của tôi, tôi chưa thấy ai khác sử dụng kỹ thuật này như một biện pháp phòng thủ," Earlence Fernandes, giáo sư tại UC San Diego chuyên về bảo mật AI, cho biết trong một cuộc phỏng vấn. Ông nói rằng ông cũng đã ấp ủ một cách tiếp cận tương tự, mặc dù trong một bối cảnh hơi khác. "Tôi muốn trở thành người đầu tiên ở đây, nhưng tôi đoán những người này đã nhanh tay hơn!"

Cho đến nay, vẫn chưa có cách nào được biết đến để giải quyết tận gốc nguyên nhân của các kỹ thuật tiêm prompt. Điều này khiến các nhà phát triển không còn lựa chọn nào khác ngoài việc xây dựng các rào chắn phức tạp để ngăn các prompt bị tiêm nhiễm buộc LLM đi chệch hướng. Giờ đây, những người phòng thủ có thể tìm ra cách để tận dụng vấn đề nan giải này có lợi cho họ.

Câu chuyện này ban đầu được đăng trên Ars Technica.

📎 Nguồn gốc: Wired AI Xem bài gốc →