Chỉ vài tuần sau khi ra mắt Gemma 4, dòng mô hình AI mở mạnh nhất từ trước đến nay của Google (GOOGL), đội ngũ phát triển vừa công bố một bước tiến đột phá về hiệu suất. Họ phát hành Multi-Token Prediction drafters, một kỹ thuật giải mã suy đoán cho phép mô hình dự đoán nhiều token cùng lúc, giúp tăng tốc độ xử lý lên đến 3 lần mà không làm giảm chất lượng đầu ra hay khả năng suy luận.

Tại sao tốc độ suy luận lại quan trọng?

Với hơn 60 triệu lượt tải xuống, Gemma 4 đã chứng tỏ sức hút trên máy tính cá nhân, thiết bị di động và cloud. Nhưng điểm yếu của các LLM hiện nay là tốc độ sinh token bị giới hạn bởi băng thông bộ nhớ VRAM. Nói dễ hiểu: chip xử lý mất phần lớn thời gian chỉ để di chuyển hàng tỷ tham số từ bộ nhớ đến đơn vị tính toán, khiến việc sinh ra một từ đơn lẻ trở nên chậm chạp. Với MTP, một mô hình drafter nhẹ sẽ dự đoán trước vài từ cùng lúc, sau đó mô hình chính kiểm tra song song toàn bộ chuỗi đó. Kết quả: bạn có thể nhận được cả câu hoàn chỉnh trong thời gian trước đây chỉ để viết một từ.

Lợi ích thiết thực cho nhà phát triển và doanh nghiệp

Đối với những ai đang xây dựng ứng dụng chatbot thời gian thực, trợ lý lập trình hay agent tự động, tốc độ inference thường là nút thắt cổ chai. Nhờ MTP, các mô hình Gemma 4 26B MoE và 31B Dense giờ đây có thể chạy mượt mà trên máy tính cá nhân và GPU tiêu dùng, với tốc độ phản hồi được cải thiện đáng kể. Bạn có thể dùng thử ngay qua các framework như vLLM, MLX hay Hugging Face Transformers.

Đây là tin vui cho cả cộng đồng AIcông nghệ mở. Google không chỉ đẩy mạnh hiệu năng cho developer mà còn mở đường cho những ứng dụng AI chạy hoàn toàn trên thiết bị di động, không cần kết nối Internet.