Jacky Liang, phụ trách quan hệ nhà phát triển tại OpenRouter, vừa thực hiện một thí nghiệm độc đáo: thả 11 mô hình AI vào một đấu trường battle royale 2D, nơi chúng tự điều khiển nhân vật, chiến đấu và sinh tồn qua 30 ván đấu. Kết quả khiến giới công nghệ bất ngờ, mô hình Grok 4.1 Fast của xAI chiến thắng tới 43% số trận, với chi phí chỉ 0,97 USD mỗi lần thắng. Trong khi đó, Claude Sonnet 4.6 của Anthropic chỉ thắng 5 trận, nhưng tốn tới 26,78 USD mỗi chiến thắng, đắt hơn 27 lần.
Mô hình giết nhiều nhất không phải người thắng cuộc
Điều thú vị là GPT 5.4 của OpenAI dù tiêu diệt tới 38 đối thủ, nhiều nhất trong tất cả mô hình, nhưng chỉ xếp thứ hai với 2 chiến thắng. Có ba mô hình gồm GPT 5.4-mini, DeepSeek 4 Flash và Kimi K2.6 không thắng nổi một trận nào dù tổng chi phí vận hành lên tới 57 USD. Thí nghiệm này cho thấy các benchmark truyền thống trên Artificial Analysis không dự đoán được kết quả thực tế, vì kỹ năng chiến thuật, phối hợp và ra quyết định quan trọng hơn khả năng tấn công đơn thuần.
Bài học cho người dùng AI thông thường
Thử nghiệm này mang ý nghĩa thực tế cho bất kỳ ai sử dụng AI hàng ngày. Một mô hình đắt tiền chưa chắc đã tốt hơn mô hình giá rẻ trong các tác vụ phức tạp như điều hướng, chiến thuật hoặc cộng tác. Claude Sonnet 4.6, dù thua nhiều, lại tỏ ra xuất sắc trong các tình huống yêu cầu hợp tác và giao tiếp. Đây là kỹ năng quý giá cho chatbot và trợ lý ảo. Trong khi đó, Grok 4.1 Fast chứng tỏ sự hiệu quả khó tin về chi phí, một yếu tố quan trọng khi doanh nghiệp triển khai AI ở quy mô lớn. Giới công nghệ đánh giá cuộc thử nghiệm này mở ra cách nhìn mới về cách chọn mô hình AI phù hợp với từng mục đích cụ thể.





