Một lập trình viên vừa công bố dữ liệu từ trò chơi trình duyệt mô phỏng vai trò human-in-the-loop cho AI agent. Trong hơn 40.000 lượt chơi và 409.000 quyết định duyệt hoặc chặn lệnh, người chơi trung bình bỏ sót 1 trong 3 lệnh độc hại. Đây là phép thử cho câu hỏi liệu con người có đủ tin cậy làm “lớp phòng thủ cuối cùng” trước các tác nhân AI chạy lệnh trên máy tính.

Lệnh quen thuộc hóa ra nguy hiểm nhất

Không phải lệnh phá hoại trực tiếp như xóa file hay gửi thông tin đăng nhập ra ngoài bị bỏ sót nhiều nhất. Lệnh bị duyệt nhầm nhiều nhất là npm run analyze, quen thuộc với lập trình viên, nhưng thực chất chạy script trong package.json và có thể dùng curl để gửi dữ liệu tới máy chủ lạ. Lịch sử hành động của agent hiển thị nội dung script ngay phía trên, nhưng 64,7% lượt chơi vẫn bấm duyệt. Giấu payload sau một tên lệnh quen thuộc khiến tỉ lệ tấn công thành công tăng gấp đôi.

Bài học cho kỷ nguyên AI agent

Khi các startup từ Thung lũng Silicon đến Việt Nam đổ tiền vào AI agent, từ viết code đến tự động hóa văn phòng, an toàn không chỉ nằm ở mô hình AI mà còn ở thói quen con người. Dữ liệu từ trò chơi cho thấy việc huấn luyện người dùng đọc kỹ ngữ cảnh trước khi duyệt lệnh quan trọng không kém nâng cấp model. Với làn sóng AI đang len lỏi vào mọi phần mềm, bài học này ngày càng giá trị. Đừng quên theo dõi các câu chuyện công nghệ mới nhất tại vnread.com.