Ngành AI đang đối mặt với một cuộc khủng hoảng thầm lặng: dữ liệu rác (junk data) đang làm chậm sự phát triển của các mô hình AI thế hệ tiếp theo, đặc biệt là AI vật lý (physical AI) và world models, những hệ thống có khả năng học và hoạt động trong thế giới thực. Trong khi các LLM như ChatGPT có thể học từ hàng tỷ trang web, việc huấn luyện robot tự lái hay robot hình người đòi hỏi dữ liệu phong phú, đa chiều mà không thể "tải về" đơn giản.
Startup dữ liệu lên ngôi, nhưng dữ liệu rác tràn lan
Cơn khát dữ liệu của các công ty AI đã thúc đẩy sự bùng nổ của các startup cung cấp dữ liệu như Scale AI, Surge AI và Mercor, định giá hàng tỷ USD. Tuy nhiên, áp lực sản xuất nhanh đã tạo ra lượng lớn dữ liệu không giúp ích cho quá trình học của mô hình. Junk data dễ sản xuất hơn, nhưng với AI vật lý, ví dụ như huấn luyện xe tự lái xử lý tình huống trẻ em băng qua đường trong điều kiện chói sáng, thì dữ liệu chất lượng thấp có thể dẫn đến hậu quả khó lường.
OpenAI rút Sora: bài học từ junk data
OpenAI gần đây đã ngừng ứng dụng video AI Sora và điều chuyển đội ngũ, nguyên nhân cốt lõi là mô hình world model của họ thiếu hiểu biết về vật lý thực tế. Thực tế này cho thấy dù có nhiều dữ liệu, nếu không có quy trình loại bỏ dữ liệu rác, các mô hình sẽ không thể đạt được độ chính xác cần thiết cho các ứng dụng như phẫu thuật hỗ trợ AI hay gấp quần áo bằng robot. Các nhà phát triển đang phải dùng mô phỏng ảo hàng giờ để tạo dữ liệu huấn luyện, nhưng nếu dữ liệu đó không đại diện cho thế giới thực, mọi nỗ lực sẽ trở nên vô ích.
Tác động đến người dùng thường
Đối với người Việt, điều này có nghĩa là các sản phẩm AI như xe tự lái hay robot gia dụng có thể bị chậm tiến độ hoặc hoạt động thiếu an toàn nếu vấn đề junk data không được giải quyết. Các đội ngũ machine learning đang cần công cụ và quy trình để loại bỏ dữ liệu rác, nhằm đảm bảo AI vật lý đạt tiềm năng thực sự. Đây là cuộc đua không chỉ về lượng dữ liệu, mà còn về chất lượng, một thách thức kỹ thuật mang tính sống còn cho công nghệ tương lai và AI.






