Anthropic vừa xác nhận đang lập một đội kỹ sư chip riêng, không phải để rời bỏ Nvidia hay Google mà để làm điều tham vọng hơn: đồng thiết kế phần cứng và mô hình Claude cùng lúc, sao cho con chip sinh ra vừa khít với cách Claude tính toán. Người dẫn dắt kỹ thuật là Clive Chan, kỹ sư từng làm việc trên Jalapeño, con chip nội bộ của OpenAI chuyên tăng tốc phép nhân ma trận. Chi tiết này hé lộ đúng thứ nằm ở tâm điểm mọi chip AI hiện nay: một mạch phần cứng gọi là mảng systolic, thứ quyết định Claude trả lời nhanh hay chậm, tốn bao nhiêu điện cho mỗi token sinh ra.

Vì sao phép nhân ma trận là nút thắt cổ chai

Mỗi lớp trong một mạng nơ-ron về bản chất là một phép nhân ma trận khổng lồ: nhân dữ liệu đầu vào với hàng triệu trọng số đã huấn luyện sẵn. Trên một CPU thông thường, mỗi con số phải được nạp từ bộ nhớ, tính toán, rồi ghi kết quả trở lại bộ nhớ trước khi phép tính tiếp theo bắt đầu. Với hàng tỷ phép nhân cộng dồn cho một câu trả lời của Claude, việc liên tục ra vào bộ nhớ này tốn thời gian và điện năng hơn cả bản thân phép tính. Đây chính là lý do các công ty AI không dùng CPU để chạy mô hình lớn mà cần một kiến trúc phần cứng chuyên biệt hơn hẳn.

Mảng systolic hoạt động ra sao

Mảng systolic giải quyết vấn đề đó bằng một lưới các đơn vị tính toán nhỏ, gọi là PE, xếp thành hàng và cột như bàn cờ. Dữ liệu chảy qua lưới này theo nhịp đều, giống một dây chuyền chuyền tay: mỗi ô nhận một số từ ô bên trái, một số khác từ ô phía trên, nhân chúng, cộng dồn vào kết quả đang giữ, rồi đẩy cả hai số tiếp sang ô kế bên ở nhịp đồng hồ sau. Trọng số của mô hình thường được nạp sẵn và giữ cố định trong từng ô suốt hàng nghìn phép tính, nên chip chỉ cần đẩy dữ liệu đầu vào chảy qua một lần là hàng loạt phép nhân cộng xảy ra song song mà gần như không phải đọc ghi bộ nhớ giữa chừng. Google TPU, chip Jalapeño của OpenAI hay các chip tăng tốc AI khác đều dùng biến thể của cơ chế này, chỉ khác nhau ở kích thước lưới và cách sắp xếp dữ liệu chảy vào.

Đồng thiết kế chip và mô hình tiết kiệm được gì

Cái hay của mảng systolic là hiệu quả của nó phụ thuộc rất nhiều vào việc lưới PE có vừa khít với hình dạng ma trận thực tế của mô hình hay không. Nếu ma trận quá nhỏ so với lưới, nhiều ô sẽ ngồi không, không có việc để làm; nếu quá lớn, dữ liệu phải chia nhỏ và nạp lại nhiều lần, sinh thêm độ trễ đáng kể. Đó là lý do đội chip của Anthropic muốn thiết kế song song với đội mô hình: định hình kiến trúc Claude sao cho các lớp tính toán khớp với kích thước lưới systolic ngay từ đầu, thay vì thiết kế chip trước rồi mới ép mô hình chạy trên đó. Cách làm này, theo kinh nghiệm từ chính đội từng làm Jalapeño, có thể cắt giảm chi phí suy luận trên mỗi token gần một nửa, điều sống còn khi Anthropic phục vụ hàng tỷ lượt truy vấn mỗi ngày. Nhiều phân tích hạ tầng AI khác được cập nhật tại chuyên mục Khoa học Công nghệ của VnRead.