Reflex, công ty phát triển framework web Reflex, vừa công bố benchmark cho thấy việc cho AI agent thao tác qua ảnh chụp màn hình (computer-use) tốn kém hơn 45 lần so với dùng API có cấu trúc. Thí nghiệm được thực hiện trên cùng một admin panel: một agent dùng vision, một agent dùng API. Kết quả: vision agent tiêu tốn 53 bước và 551 nghìn token, trong khi API agent chỉ cần 8 lần gọi và 12 nghìn token.
Bài toán chi phí cho AI agent
Nhiều startup và đội ngũ phát triển hiện nay phải đối mặt với lựa chọn: xây dựng giao diện API riêng cho từng công cụ nội bộ (tốn kém nhân lực) hoặc dùng vision agent để AI tự động hóa thao tác trên giao diện người dùng. Reflex chỉ ra rằng vision agent không chỉ đắt hơn về token, mà còn dễ mắc lỗi như bỏ qua các mục bị ẩn trong trang, không thể cuộn trang, và thiếu tín hiệu để xử lý dữ liệu không hiển thị đầy đủ.
Giải pháp từ open source
Reflex đã mã nguồn mở toàn bộ benchmark, cho phép các nhà phát triển tự kiểm tra. Thay vì mặc định chọn vision agent, các đội ngũ nên cân nhắc đầu tư vào việc tạo API endpoints cho các công cụ nội bộ - dù tốn thời gian ban đầu, nhưng tiết kiệm chi phí vận hành lâu dài. Xu hướng này phù hợp với sự phát triển của MCP (Model Context Protocol) và REST APIs, giúp AI agent hoạt động hiệu quả mà không cần nhìn vào ảnh chụp màn hình.
Tác động đến người dùng thông thường
Đối với người dùng cuối, điều này đồng nghĩa với việc các ứng dụng AI trong tương lai sẽ rẻ hơn và chính xác hơn. Khi các đội ngũ phát triển chuyển sang dùng API có cấu trúc thay vì vision agent, chi phí vận hành giảm đáng kể, từ đó giảm giá thành sản phẩm cho người dùng. Bài học từ Reflex là: đừng để AI phải nhìn vào màn hình, hãy để nó đọc dữ liệu trực tiếp.





