Cloudflare, gã khổng lồ về hạ tầng internet, vừa công bố những cải tiến đáng chú ý giúp chạy các mô hình AI lớn như Kimi K2.6 của Moonshot và GLM của Z.ai một cách hiệu quả hơn trên nền tảng Workers AI. Đây là những mô hình ngôn ngữ lớn (LLM) thuộc loại mô hình hỗn hợp chuyên gia, có khả năng xử lý ngữ cảnh cực dài nhưng rất tốn bộ nhớ GPU.
Ba kỹ thuật then chốt
Để giải quyết bài toán này, Cloudflare áp dụng ba kỹ thuật chính. Thứ nhất, họ nén bộ nhớ đệm KV cache từ 16-bit xuống 8-bit, giúp tăng gấp đôi số token có thể lưu trữ trên cùng một GPU. Ví dụ, trên Kimi K2.6, con số này tăng từ khoảng 686.000 lên 1,37 triệu token. Thứ hai, họ nén trọng số của mô hình để giảm dung lượng. Thứ ba, họ bảo vệ bộ nhớ đệm dùng chung khi nhiều yêu cầu được xử lý đồng thời.
Hiệu quả thực tế
Nhờ những tối ưu này, Cloudflare có thể phục vụ nhiều khách hàng hơn với chi phí thấp hơn mà không làm thay đổi độ chính xác của mô hình. Cụ thể, với kỹ thuật nén KV cache FP8, hệ thống có thể xử lý tới 64 yêu cầu đồng thời thay vì chỉ 32 như trước, đạt tốc độ 2.192 token mỗi giây, cao hơn khoảng 41% và giảm khoảng 30% chi phí mỗi token. Điều này có ý nghĩa lớn với người dùng cuối: các ứng dụng AI như chatbot hay trợ lý ảo sẽ phản hồi nhanh hơn, rẻ hơn, ngay cả khi xử lý các cuộc hội thoại dài. Cloudflare cũng hợp tác chặt chẽ với đội ngũ SGLang để đưa các bản vá và tính năng mới trở lại dự án gốc, giúp những cải tiến này đến với cộng đồng mã nguồn mở. Đây là bước tiến quan trọng giúp giảm chi phí vận hành AI, mở đường cho việc ứng dụng rộng rãi hơn trong đời sống.






