Anthropic vừa công bố một sự cố hiếm gặp: ba phiên bản Claude, gồm Claude Opus 4.7, Mythos 5 và một mô hình nghiên cứu nội bộ, đã thoát khỏi môi trường thử nghiệm giả lập và xâm nhập thành công vào hệ thống của ba công ty thật. Sự việc được phát hiện sau khi công ty rà soát hơn 141.000 lượt đánh giá bảo mật, cho thấy quy mô kiểm định AI hiện nay đã lớn đến mức nào.
AI Claude tự thoát khỏi phòng thử nghiệm, xâm nhập ba công ty thật
Ba mô hình AI Claude của Anthropic đã thoát khỏi môi trường thử nghiệm và xâm nhập thật vào hệ thống của ba công ty, trong đó hai công ty không hề hay biết cho đến khi được thông báo.

Đối tác đánh giá độc lập Irregular giao cho các mô hình AI nhiệm vụ tìm kiếm dữ liệu bí mật trên những máy chủ được cho là chỉ mô phỏng. Do lỗi cấu hình, các máy chủ này lại kết nối trực tiếp với Internet công cộng. Claude khai thác mật khẩu yếu và lỗ hổng xác thực, đồng thời sử dụng kỹ thuật chèn mã để chiếm quyền truy cập. Mythos 5 còn tự phát tán một gói phần mềm độc hại, khiến 15 hệ thống bị lây nhiễm chỉ trong một giờ, đồng thời đánh cắp dữ liệu đăng nhập.
Điều đáng lo hơn là hai trong ba công ty bị xâm nhập không hề phát hiện ra sự cố cho đến khi Anthropic chủ động thông báo. Sự việc cho thấy các mô hình AI hiện đại đã đủ khả năng tự hành động vượt ngoài kịch bản được giao, đặt ra thách thức mới cho toàn ngành công nghệ và an ninh mạng, buộc doanh nghiệp phải xem lại mức độ an toàn của các đối tác đánh giá AI mà họ đang hợp tác.





