Bạn có bao giờ thắc mắc vì sao ChatGPT hay Claude trả lời lịch sự, từ chối yêu cầu nguy hiểm, và nhìn chung "hiểu" được con người muốn gì không? Bí mật nằm ở RLHF, viết tắt của Reinforcement Learning from Human Feedback. Đây là quy trình huấn luyện gồm ba giai đoạn, giúp mô hình ngôn ngữ lớn (LLM) chuyển từ chỗ chỉ biết tạo câu sang trả lời đúng ý người dùng.

Giai đoạn 1: Supervised Fine-Tuning (SFT)

Hãy hình dung bạn tuyển một nhân viên mới rất giỏi kiến thức tổng quát nhưng chưa biết cách làm việc theo quy trình công ty. SFT chính là giai đoạn làm quen với cách trả lời theo yêu cầu đó. Mô hình được cho xem hàng nghìn cặp câu hỏi và câu trả lời mẫu do con người viết, từ đó học cách trả lời theo định dạng hội thoại thay vì chỉ dự đoán từ tiếp theo. Sau bước này, mô hình đã biết trả lời câu hỏi, nhưng chất lượng vẫn chưa ổn định.

Giai đoạn 2: Thu thập sở thích và huấn luyện mô hình phần thưởng

Đây là bước then chốt biến phản hồi chủ quan của con người thành tín hiệu toán học. Với mỗi câu hỏi, mô hình SFT sinh ra nhiều câu trả lời khác nhau. Nhóm đánh giá viên (annotator) sẽ xếp hạng các câu trả lời từ tốt nhất đến kém nhất. Ví dụ: với câu hỏi "Làm sao để ngủ ngon hơn?", câu trả lời đưa ra lời khuyên cụ thể và an toàn sẽ được xếp trên câu trả lời mơ hồ hoặc có thông tin sai.

Từ dữ liệu xếp hạng này, nhóm phát triển huấn luyện một mô hình riêng gọi là Reward Model (mô hình phần thưởng). Nhiệm vụ của nó rất đơn giản: Nhận một cặp câu hỏi - trả lời và chấm điểm. Điểm cao nghĩa là "con người sẽ thích câu trả lời này." Về bản chất, Reward Model là cầu nối giữa sở thích của con người và tín hiệu toán học để thuật toán tối ưu có thể xử lý.

Giai đoạn 3: Tối ưu hóa bằng PPO

PPO (Proximal Policy Optimization) là thuật toán học tăng cường đảm nhận phần "huấn luyện bằng phần thưởng" trong RLHF. Quy trình diễn ra như sau: Mô hình nhận câu hỏi, tạo câu trả lời, Reward Model chấm điểm, rồi PPO cập nhật trọng số để lần sau mô hình tạo ra câu trả lời có điểm cao hơn.

Điểm mấu chốt là PPO không để mô hình thay đổi quá nhiều sau mỗi lần cập nhật. Cơ chế "clipping" giới hạn mức độ thay đổi xác suất đầu ra, giống như bạn chỉ cho phép nhân viên cải tiến từng bước nhỏ thay vì đột ngột thay đổi toàn bộ cách làm việc.

KL Penalty: giữ cho AI không "hack" phần thưởng

Một vấn đề nghiêm trọng là: Nếu chỉ tối ưu hóa điểm của Reward Model, mô hình có thể học cách "lách" hệ thống bằng những câu trả lời được chấm cao nhưng vô nghĩa hoặc lặp đi lặp lại. Đây gọi là reward hacking. Để ngăn chặn, PPO thêm một "hình phạt KL" (KL penalty), đo khoảng cách giữa mô hình đang huấn luyện và mô hình tham chiếu ban đầu (reference model). Nếu câu trả lời lệch quá xa so với cách mô hình SFT ban đầu sẽ trả lời, hình phạt sẽ tăng lên, kéo mô hình trở lại vùng an toàn.

Những hạn chế của RLHF

RLHF không hoàn hảo. Reward Model chỉ là xấp xỉ sở thích con người, nên nó có thể bị đánh lừa. Nghiên cứu gần đây cho thấy mô hình càng mạnh thì càng giỏi tìm cách "hack" Reward Model. Ngoài ra, chất lượng dữ liệu đánh giá phụ thuộc nhiều vào đội ngũ annotator. Nếu annotator không nhất quán hoặc thiếu chuyên môn, Reward Model sẽ học sai tín hiệu.

Đến năm 2026, RLHF vẫn là nền tảng khái niệm cho việc căn chỉnh LLM theo mục tiêu của con người. Tuy nhiên, trong các hệ thống triển khai thực tế, PPO ngày càng được thay bằng những phương pháp đơn giản hơn như DPO (Direct Preference Optimization) hay GRPO, tùy dữ liệu và ngân sách tính toán. Dù vậy, hiểu RLHF vẫn là chìa khóa để nắm bắt các biến thể phát triển từ phương pháp này.