Ông Noam Shazeer, đồng tác giả bài báo "Attention Is All You Need" năm 2017 và phó chủ tịch kỹ thuật kiêm đồng lãnh đạo Gemini tại Google (GOOGL), vừa tuyên bố chuyển sang OpenAI vào ngày 18/6. Google đã chi 2,7 tỷ USD để đưa ông Shazeer trở lại từ Character.AI chưa đầy hai năm trước. Giờ đây, một trong những nhân vật then chốt đứng sau kiến trúc Transformer lại đầu quân cho đối thủ. Vậy cơ chế multi-head attention mà ông Shazeer đồng phát triển, nền tảng của các mô hình ngôn ngữ lớn hiện nay, thực sự hoạt động ra sao?

Từ attention đơn lẻ đến nhiều "góc nhìn" song song

Ý tưởng cốt lõi của attention là: khi xử lý một từ trong câu, mô hình cần "nhìn" vào các từ khác để hiểu ngữ cảnh. Cơ chế self-attention tính mối quan hệ giữa các từ bằng cách biểu diễn mỗi từ qua ba vector: Query, Key và Value. Query của từ đang xét được so với Key của các từ còn lại để tạo ra điểm tương đồng, rồi dùng các điểm này làm trọng số khi tổng hợp Value. Kết quả là một biểu diễn mới của từ đó, đã "hấp thụ" thông tin từ toàn bộ câu.

Nhưng một đầu attention đơn lẻ thường chỉ nắm bắt tốt một kiểu quan hệ. Ví dụ, trong câu "Con mèo ngồi trên thảm vì nó mệt", từ "nó" cần đồng thời hiểu rằng nó ám chỉ "con mèo" (quan hệ đồng tham chiếu), đồng thời việc "ngồi" xuất phát từ trạng thái "mệt" (quan hệ nhân quả). Một đầu attention duy nhất khó làm cả hai việc cùng lúc.

Chia nhỏ, tính song song, ghép lại

Multi-head attention giải quyết vấn đề này bằng cách chạy nhiều phép attention song song, mỗi phép gọi là một "head". Giả sử mô hình có vector 512 chiều và 8 head. Thay vì chạy attention trên toàn bộ 512 chiều, mô hình chia vector thành 8 phần, mỗi phần 64 chiều, rồi mỗi head tự học bộ trọng số riêng cho Query, Key, Value của mình. Head thứ nhất có thể học cách theo dõi quan hệ cú pháp, như chủ ngữ đi với động từ; head thứ hai theo dõi quan hệ đồng tham chiếu, như đại từ trỏ về danh từ; head thứ ba theo dõi quan hệ vị trí. Sau khi tất cả head tính xong, kết quả được nối (concatenate) lại thành vector 512 chiều ban đầu, rồi đi qua một lớp tuyến tính để trộn thông tin từ các head.

Tại sao điều này hiệu quả đến vậy?

Trước Transformer, mạng nơ-ron hồi quy (RNN) xử lý từng từ theo thứ tự, giống như đọc từ trái sang phải mà không thể nhìn lại. Cách làm này gây ra hai vấn đề: tốc độ chậm vì không thể xử lý song song, và thông tin ở đầu câu dễ bị phai dần khi mô hình đi tới cuối câu. Multi-head attention xử lý tất cả các từ cùng lúc, mỗi từ "nhìn" thẳng vào mọi từ khác với chi phí tính toán O(n²) theo độ dài chuỗi. Đổi lại, mô hình nắm bắt phụ thuộc tầm xa tốt hơn hẳn và tận dụng triệt để sức mạnh GPU.

Từ 8 head đến hàng trăm head

Bài báo gốc năm 2017 dùng 8 head trên mô hình dịch máy. Ngày nay, các mô hình như GPT-5 hay Gemini dùng hàng trăm head trên những vector có hàng nghìn chiều. Các biến thể như grouped-query attention (GQA) của LLaMA chia sẻ Key/Value giữa nhiều head để tiết kiệm bộ nhớ, hay multi-query attention (MQA) chỉ dùng một bộ Key/Value chung. Những cải tiến này giúp giảm mức dùng bộ nhớ khi sinh văn bản, gần như không làm suy giảm chất lượng.

Sự ra đi của Shazeer sang OpenAI cho thấy cuộc chạy đua AI không chỉ là về dữ liệu hay phần cứng, mà còn về những bộ óc hiểu sâu nhất cách thức attention thực sự hoạt động bên trong mọi mô hình ngôn ngữ lớn.