Các nhà nghiên cứu vừa công bố một nghiên cứu mang tên DELEGATE-52, hé lộ một điểm yếu lớn của các mô hình ngôn ngữ lớn (LLM) như Gemini 3.1 Pro của Google (GOOGL), Claude 4.6 Opus của Anthropic, hay GPT 5.4 của OpenAI. Khi người dùng ủy thác cho LLM chỉnh sửa tài liệu dài trong các lĩnh vực từ lập trình, tinh thể học đến ký hiệu âm nhạc, kết quả cho thấy các mô hình này làm hỏng trung bình 25% nội dung gốc sau các quy trình phức tạp. Lỗi xảy ra âm thầm, không báo trước, và tích lũy dần theo thời gian.
Vấn đề đặt ra
DELEGATE-52 mô phỏng các quy trình làm việc ủy thác dài, yêu cầu chỉnh sửa tài liệu chuyên sâu ở 52 lĩnh vực chuyên môn. Kết quả thử nghiệm trên 19 mô hình LLM cho thấy, ngay cả những mô hình tiên tiến nhất cũng không đáng tin cậy. Khi tài liệu càng lớn, tương tác càng dài, hoặc có thêm các tệp gây nhiễu, mức độ suy giảm càng trầm trọng. Đáng chú ý, việc sử dụng các công cụ agent (tool use) không cải thiện hiệu suất trên benchmark này. Điều này đặt ra câu hỏi lớn về độ tin cậy của AI trong các tác vụ quan trọng như vibe coding hay biên tập hợp đồng.
Tác động đến người dùng thông thường
Đối với người dùng phổ thông, điều này đồng nghĩa với việc giao phó toàn bộ công việc biên tập cho AI có thể dẫn đến những sai sót nghiêm trọng mà bạn không hề hay biết. Ví dụ, một bản báo cáo tài chính, một mã nguồn phần mềm, hay một bản nhạc số có thể bị thay đổi nội dung cốt lõi mà không có cảnh báo. Các nhà nghiên cứu khuyến cáo rằng, dù AI có mạnh mẽ đến đâu, người dùng vẫn nên kiểm tra kỹ lưỡng mọi sản phẩm đầu ra, đặc biệt trong các lĩnh vực đòi hỏi độ chính xác cao. Nghiên cứu này là lời nhắc nhở rằng công nghệ còn nhiều hạn chế trước khi có thể thay thế hoàn toàn con người trong các tác vụ phức tạp.






