Ngày 6/8, AMD công bố thâu tóm Taalas, startup có trụ sở tại Toronto chuyên sản xuất chip suy luận AI theo cách chưa từng có: khắc thẳng trọng số của mô hình đã huấn luyện vào silicon, thay vì lưu trong bộ nhớ rời như các GPU truyền thống. Thương vụ này đáng chú ý không chỉ vì tham vọng cạnh tranh với Nvidia, mà vì nó chạm đúng vào nút thắt cổ chai lớn nhất của suy luận AI hiện nay: bức tường bộ nhớ.
Bức tường bộ nhớ là gì
Một GPU chạy mô hình ngôn ngữ lớn về bản chất vẫn theo kiến trúc von Neumann: bộ xử lý và bộ nhớ là hai khối tách biệt, mỗi lần tính một token mới, chip phải kéo hàng tỷ trọng số từ bộ nhớ HBM sang lõi tính toán. Việc di chuyển dữ liệu này tốn năng lượng và thời gian hơn nhiều so với chính phép tính, giống như một đầu bếp phải chạy ra kho lấy từng nguyên liệu mỗi khi nêm một món, dù công thức không hề đổi. Với các mô hình hàng chục tỷ tham số, việc chạy ra kho liên tục này chính là lý do GPU tiêu tốn điện khủng khiếp mà vẫn chưa đạt tốc độ tối đa.
Khắc mạch: biến trọng số thành mạch điện
Taalas giải quyết vấn đề bằng cách loại bỏ hẳn chuyến đi lấy hàng đó. Trọng số của mô hình được khắc vĩnh viễn vào một vùng mạch gọi là mask-ROM ngay trên chip, giống như in cố định vào bảng mạch thay vì ghi vào ổ đĩa có thể xóa. Chip HC1 thế hệ đầu của họ, khi chạy mô hình Llama 3.1 8B, đạt gần 17.000 token mỗi giây, nhanh hơn GPU Nvidia hàng chục lần, vì phần lớn tính toán giờ diễn ra ngay tại nơi dữ liệu nằm sẵn, không cần đường truyền tốn năng lượng để chuyển tiếp. Chip chỉ giữ lại một phần SRAM nhỏ để xử lý bộ nhớ đệm ngữ cảnh và các phần tinh chỉnh, còn phần hiểu biết cốt lõi của mô hình đã đúc cứng vĩnh viễn vào cấu trúc vật lý.
Cái giá của tốc độ: mất linh hoạt
Đánh đổi lớn nhất là sự cứng nhắc. Một GPU có thể nạp bất kỳ mô hình nào bằng phần mềm trong vài phút, nhưng một chip đã khắc mô hình thì gắn chặt với đúng phiên bản đó. Muốn cập nhật mô hình đáng kể, gần như phải sản xuất lại chip. Taalas cho biết chỉ cần thay hai lớp kim loại là có thể thích ứng phần nào, nhưng chi phí và thời gian vẫn cao hơn nhiều so với việc chỉ đổi phần mềm trên GPU.
Vì sao điều này quan trọng với kinh tế suy luận
Với các công ty vận hành mô hình ở quy mô hàng tỷ lượt truy vấn mỗi ngày, như phần lớn dịch vụ công nghệ hiện nay, chi phí điện năng cho suy luận đã vượt xa chi phí huấn luyện ban đầu. AMD dự định ghép chip Taalas với GPU Instinct: GPU xử lý phần đọc hiểu prompt cần linh hoạt, còn chip khắc sẵn đảm nhận việc sinh token hàng loạt cho những mô hình đã ổn định, ít thay đổi. Đây là dấu hiệu cho thấy ngành công nghiệp AI đang tách suy luận thành hai lớp: một lớp linh hoạt và một lớp chuyên biệt hóa tới mức đúc vào phần cứng, đánh đổi khả năng cập nhật để lấy tốc độ và hiệu suất năng lượng tối đa.






