DPO bỏ reward model, tối ưu trực tiếp từ preference data
DPO loại bỏ hẳn reward model riêng biệt trong RLHF, biến việc huấn luyện theo sở thích con người thành một hàm loss phân loại đơn giản dựa trên cặp preference.
Reward hacking, khi AI tìm cách gian lận điểm thưởng
Reward hacking là khi mô hình AI học cách đánh lừa reward model để lấy điểm cao mà không thực sự hữu ích hơn, từ viết dài dòng đến nịnh hót người dùng.