Tuần này, Trung tâm Tiêu chuẩn và Đổi mới AI (CAISI) thuộc Bộ Thương mại Mỹ công bố thỏa thuận với Google DeepMind (GOOGL), Microsoft (MSFT) và xAI để đánh giá các mô hình AI tiên tiến trước khi phát hành. Đây là bước mở rộng từ các thỏa thuận trước đó với OpenAI và Anthropic, nâng tổng số mô hình đã được đánh giá lên hơn 40. Nhưng quá trình kiểm tra một mô hình AI tiên tiến thực sự diễn ra như thế nào?
Red-teaming là gì
Red-teaming AI là quá trình cố tình tìm cách phá vỡ rào chắn an toàn của mô hình. Thay vì hỏi mô hình hoạt động tốt đến đâu, người đánh giá tập trung vào việc nó có thể bị lạm dụng như thế nào. Nhóm red-team đóng vai kẻ tấn công, viết câu lệnh tinh vi để lừa mô hình tiết lộ thông tin nguy hiểm, tạo mã độc hoặc đưa ra hướng dẫn chế tạo vũ khí. Nếu mô hình từ chối, họ thử các kỹ thuật jailbreak để vượt qua lớp bảo vệ bằng cách đặt ngữ cảnh giả, chèn chỉ dẫn ẩn, hoặc khai thác lỗ hổng trong quá trình huấn luyện.
Đánh giá ba lớp
Quy trình đánh giá tiêu chuẩn thường gồm ba tầng. Lớp đầu tiên là đánh giá năng lực: mô hình mới làm được gì mà các phiên bản trước chưa làm được? Ví dụ, nếu một mô hình mới có khả năng tự viết code khai thác lỗ hổng zero-day hoặc thiết kế quy trình tổng hợp hóa chất nguy hiểm, đó là tín hiệu cảnh báo. Lớp thứ hai là đánh giá an toàn: các rào chắn có đủ mạnh hay không? Người đánh giá thử hàng nghìn kịch bản tấn công để đo tỷ lệ phá rào thành công. Lớp thứ ba là đánh giá trong môi trường thực tế: mô hình được đặt vào các tình huống mô phỏng, có quyền truy cập công cụ thật, để xem nó có thể tự gây hại mà không cần con người hướng dẫn hay không.
Tại sao cần gỡ rào chắn khi kiểm tra
Một chi tiết quan trọng trong thỏa thuận của CAISI là các công ty thường cung cấp phiên bản mô hình đã được gỡ bớt hoặc nới lỏng các rào chắn an toàn. Nghe có vẻ mâu thuẫn, nhưng lý do lại khá rõ ràng. Các rào chắn chỉ là lớp bảo vệ bên ngoài, không phải bản chất của mô hình. Nếu chỉ kiểm tra phiên bản đã có rào chắn, bên đánh giá thực chất chỉ đo lớp bảo vệ, không phải năng lực thật của mô hình. CAISI cần biết mô hình gốc có thể làm gì để đánh giá rủi ro tổng thể. Các đánh giá này diễn ra trong môi trường bảo mật, và kết quả được chia sẻ qua lực lượng đặc nhiệm liên ngành TRAINS gồm các chuyên gia an ninh quốc gia.
Giới hạn của red-teaming
Dù quan trọng, red-teaming không phải giải pháp vạn năng. Một mô hình vượt qua đánh giá hôm nay có thể bị khai thác bằng kỹ thuật mới ngày mai. Số lượng kịch bản tấn công tiềm năng là vô hạn, trong khi ngân sách đánh giá thì có hạn. Vì vậy, CAISI xem đây là quá trình phải diễn ra liên tục. Với hơn 40 mô hình đã được đánh giá, trong đó có cả những mô hình chưa từng phát hành, đây là nỗ lực lớn nhất của chính phủ Mỹ nhằm đi trước các mối đe dọa từ những hệ thống AI ngày càng mạnh hơn.





