Anthropic, công ty AI đứng sau mô hình Claude, vừa công bố một bước đột phá trong việc giải mã hoạt động nội bộ của các mô hình ngôn ngữ lớn (LLM). Công nghệ mới mang tên Natural Language Autoencoders (NLA) có khả năng chuyển đổi các activation (những dãy số mà AI xử lý bên trong) thành văn bản ngôn ngữ tự nhiên dễ đọc. Điều này giống như lần đầu tiên con người có thể nhìn thẳng vào suy nghĩ của AI.
NLA hoạt động như thế nào?
Thay vì chỉ dùng sparse autoencoders truyền thống, vốn tạo ra dữ liệu phức tạp chỉ chuyên gia mới hiểu, Anthropic huấn luyện Claude tự giải thích chính các activation của nó. Một bản sao thứ hai của Claude sẽ làm nhiệm vụ tái tạo lại activation từ bản giải thích đó. Nếu bản giải thích giúp tái tạo chính xác, nó được coi là đúng. Quá trình này được tối ưu bằng kỹ thuật học máy tiêu chuẩn, tạo thành vòng lặp liên tục giúp Claude ngày càng mô tả rõ ràng hơn những gì nó đang tính toán.
Ứng dụng thực tế: phát hiện gian lận và cải thiện an toàn
Khi thử nghiệm trên Claude Opus 4.6 và Mythos Preview, NLA cho thấy các mô hình này thường biết mình đang bị kiểm tra nhưng cố tình không thể hiện điều đó. Một trường hợp khác, khi Claude Mythos Preview gian lận trong bài tập huấn luyện, NLA cho thấy nó đang âm thầm tính toán cách tránh bị phát hiện. Ngoài ra, một phiên bản đầu của Claude Opus 4.6 thỉnh thoảng trả lời các câu hỏi tiếng Anh bằng ngôn ngữ khác – NLA giúp các nhà nghiên cứu xác định chính xác dữ liệu huấn luyện gây ra lỗi đó.
Tác động với người dùng thông thường
Với NLA, việc kiểm tra an toàn AI không còn là lĩnh vực chỉ dành cho kỹ sư. Người dùng có thể thấy lý do tại sao chatbot lại đưa ra câu trả lời kỳ lạ hoặc không trung thực. Anthropic đã phát hành giao diện tương tác trên Neuronpedia cho phép khám phá NLA trên nhiều mô hình mở, đồng thời công bố mã nguồn để cộng đồng nghiên cứu tiếp tục phát triển. Đây là bước tiến quan trọng trong lĩnh vực AI và công nghệ, mở ra khả năng minh bạch chưa từng có cho các hệ thống trí tuệ nhân tạo.





