Cuối tuần qua tại DEF CON, một chuyên gia bảo mật ở Kansas City tên Bill Swearingen đã đỗ một chiếc Toyota Yaris đời 2009 dán đầy họa tiết loang lổ trước ống kính camera Flock, và camera coi như không thấy gì. Dự án noRecognition được anh phát triển suốt một năm. Hệ thống học tăng cường của anh chạy khoảng 31 triệu lượt thử để tự tìm ra các họa tiết có thể đánh lừa 11 thuật toán nhận diện mã nguồn mở, trong đó có công nghệ dùng cho camera đọc biển số của Flock, camera gắn trên người của Axon và hệ thống nhận diện khuôn mặt Clearview AI. Nghe như phép thuật, nhưng thực ra đây là một trong những ứng dụng đời thực sinh động nhất của một hiện tượng đã được giới nghiên cứu AI gọi tên từ hơn một thập kỷ trước: adversarial example, ví dụ đối kháng.

Mô hình nhìn ảnh khác con người ra sao?

Một hệ thống nhận diện đối tượng hiện đại như YOLO hay Faster R-CNN không xử lý bức ảnh theo cách con người quan sát. Nó chẻ ảnh thành lưới điểm ảnh, đẩy qua hàng chục lớp mạng nơ-ron tích chập để trích xuất đặc trưng như cạnh, kết cấu, hình khối, rồi kết luận bằng một con số: xác suất vùng này là người, xe hơi hay không có gì cả. Con người nhận diện dựa trên hình dáng tổng thể, ngữ cảnh, kinh nghiệm sống. Mô hình học từ thống kê điểm ảnh trên hàng triệu dữ liệu huấn luyện, nên rất nhạy với những mẫu kết cấu tần số cao mà mắt người gần như bỏ qua. Đây chính là khe hở mà các họa tiết đối kháng khai thác.

Vì sao vài mảng màu có thể đánh lừa cả một mô hình

Về bản chất, huấn luyện một mô hình là điều chỉnh hàng triệu tham số để hàm mất mát giảm dần, từ đó dự đoán chính xác hơn. Tấn công đối kháng đi theo hướng ngược lại: giữ nguyên mô hình, rồi điều chỉnh ảnh đầu vào theo hướng làm tăng mất mát, đẩy kết quả suy luận vượt qua ranh giới phân loại. Với tấn công kiểu hộp trắng, kẻ tấn công có thể truy cập vào trọng số của mô hình nên tính trực tiếp độ dốc này bằng lan truyền ngược. Các phương pháp như FGSM hay PGD vận hành theo cách đó. Swearingen thì đi đường vòng: không có quyền truy cập nội bộ của Flock hay Axon, nên anh dùng học tăng cường, thử một họa tiết, xem camera có phát hiện không, rồi tinh chỉnh dựa trên tín hiệu phản hồi đó, lặp lại 31 triệu lần. Đó là tối ưu hóa kiểu hộp đen, chậm hơn nhưng không cần biết gì về bên trong mô hình mục tiêu.

Từ điểm ảnh số đến áo in ngoài đời thật

Cái khó của một họa tiết vật lý, so với một nhiễu số chỉ tồn tại trong tệp ảnh, là nó phải hoạt động qua đủ mọi góc chụp, khoảng cách, ánh sáng, và cả độ méo của máy in. Vì vậy các họa tiết kiểu này thường được huấn luyện qua hàng loạt phép biến đổi mô phỏng như xoay, phóng to, đổi màu, để tìm ra một mẫu đủ bền trước nhiễu thực tế, thay vì một điểm yếu chỉ tồn tại trên lý thuyết. Đó cũng là lý do bánh xe của chiếc Yaris vẫn bị Flock phát hiện dù thân xe thì không, vì bề mặt cong và chuyển động khiến họa tiết khó bám ổn định.

Điều đáng lo hơn: chúng có thể chuyển từ mô hình này sang mô hình khác

Phát hiện đáng ngại nhất trong nghiên cứu đối kháng là tính chuyển giao: một họa tiết được tối ưu cho mô hình A thường vẫn đánh lừa được mô hình B, dù hai mô hình được huấn luyện độc lập. Lý do là vì các mạng nơ-ron tích chập khác nhau vẫn có xu hướng học những đặc trưng cấp thấp tương tự nhau từ dữ liệu ảnh tự nhiên, nên chúng chia sẻ cùng một điểm mù. Đó là lý do một bộ họa tiết có thể qua mặt cùng lúc 11 thuật toán khác nhau, và cũng là lý do các hệ thống an ninh mạng dựa vào nhận diện hình ảnh khó có thể vá lỗi này bằng một bản cập nhật đơn lẻ. Cuộc rượt đuổi giữa người phòng thủ và người né tránh, vì vậy, gần như chắc chắn sẽ còn tiếp diễn dài lâu.