Một dự án mã nguồn mở mới mang tên Swiftlet đang gây chú ý trong cộng đồng AI khi cho phép chạy các mô hình ngôn ngữ lớn (LLM) Qwen 35B và 80B trên các thiết bị Apple thông thường, bao gồm cả iPhone. Được phát triển bằng Swift và Metal, Swiftlet tối ưu hóa bộ nhớ bằng cách chỉ giữ phần lõi dày đặc nhỏ của mô hình trong RAM và truyền trực tiếp các trọng số Mixture-of-Experts (MoE) từ bộ nhớ lưu trữ khi cần. Kết quả: mô hình 35B chạy trên iPhone 17 chỉ với khoảng 2,5 GB RAM, đạt tốc độ 1 token/giây, trong khi mô hình 80B chỉ chiếm khoảng 4,3 GB RAM trên Mac.
Đột phá về hiệu năng và khả năng truy cập
Điểm mấu chốt của Swiftlet nằm ở việc kích hoạt chỉ khoảng 3B tham số trên mỗi token, nhờ cơ chế định tuyến 10/512 chuyên gia (đối với 80B) và 8/256 (đối với 35B). Điều này giúp giảm đáng kể bộ nhớ truy cập, cho phép chạy các mô hình lớn trên thiết bị cá nhân mà không cần máy chủ. Dự án lấy cảm hứng từ nguyên mẫu thử nghiệm của ANEMLL hồi đầu năm 2026, nhưng Swiftlet tiến xa hơn khi biến nó thành ứng dụng cài đặt được trên iPhone cơ bản. Hiện tại, mã nguồn đã hoạt động hoàn chỉnh, tạo ra đầu ra đúng, và đang tập trung tối ưu tốc độ nhân. Tuy nhiên, như tác giả thừa nhận, các mô hình này trò chuyện và viết như mô hình lớn nhưng khả năng ghi nhớ sự kiện lại hạn chế như mô hình nhỏ vì chỉ có 3B tham số hoạt động.
Ý nghĩa với người dùng phổ thông
Với Swiftlet, người dùng iPhone và Mac có thể chạy các mô hình AI mạnh mẽ trực tiếp trên thiết bị mà không cần kết nối internet, đảm bảo quyền riêng tư. Điều này mở ra cánh cửa cho các ứng dụng AI ngoại tuyến trong giáo dục, y tế hay giải trí. Dự án hiện đã có trong ứng dụng Priv AI trên App Store, còn tính năng Experimental Models của phiên bản mới nhất vẫn đang chờ duyệt nên có thể chưa xuất hiện ngay. Với xu hướng AI cục bộ ngày càng phổ biến, Swiftlet là một bước tiến quan trọng, đưa công nghệ AI đến gần hơn với đại chúng, đồng thời cho thấy khả năng xử lý các tác vụ phức tạp của phần cứng Apple.





