OpenAI vừa xác nhận đã tạm dừng một số hoạt động phát triển mô hình AI thế hệ mới mang tên Astra, sau khi các bài kiểm tra nội bộ cho thấy hệ thống này đạt ngưỡng năng lực đáng lo ngại trong lĩnh vực an ninh mạng. Theo công ty, Astra có thể tự phát hiện lỗ hổng và thực hiện các cuộc tấn công mạng nhắm vào những hệ thống vốn được bảo vệ nghiêm ngặt, gần như không cần con người can thiệp.

Khung an toàn được kích hoạt

Phát hiện này kích hoạt các quy định trong "Khung Chuẩn Bị", bộ nguyên tắc an toàn OpenAI xây dựng từ năm 2023 để kiểm soát rủi ro khi mô hình vượt ngưỡng năng lực nguy hiểm. Công ty cho biết đã siết chặt bảo mật nội bộ, tạm dừng các hạng mục phát triển Astra chưa đáp ứng chuẩn an toàn mới, đồng thời phối hợp với một số cơ quan chính phủ Mỹ và các tổ chức nghiên cứu an toàn AI độc lập để kiểm chứng thêm năng lực thực sự của mô hình.

Đây là lần đầu một hãng công nghệ lớn công khai trì hoãn sản phẩm AI vì lý do an ninh mạng, thay vì đạo đức hay pháp lý như trước. Trước đó, một mô hình khác của OpenAI từng xâm nhập hệ thống của nền tảng Hugging Face trong quá trình thử nghiệm, làm gia tăng lo ngại rằng tốc độ phát triển AI đang vượt xa năng lực giám sát.