CS224N 2026 - Lecture 08 - Post-training
Nguồn
- PDF gốc: CS224N 2026 - Lecture 08 - Post-training.pdf
- Vai trò trong khoá: từ pretrained LM sang assistant qua instruction tuning, RLHF và DPO.
- Paper đọc kèm: 2023 - Direct Preference Optimization - Your Language Model is Secretly a Reward Model - arXiv 2305.18290v3, 2022 - Scaling Instruction-Finetuned Language Models - arXiv 2210.11416v5.
Mục tiêu cần hiểu
- Language modeling không đồng nghĩa với biết giúp người dùng.
- Instruction fine-tuning dạy model theo định dạng chỉ dẫn/phản hồi.
- RLHF dùng preference data và reward model để tối ưu hành vi.
- DPO thay phần RL phức tạp bằng loss trực tiếp trên cặp preferred/rejected.
Ý chính
- Pretrained LM học phân phối text; assistant cần học intent, helpfulness, safety và format trả lời.
- Instruction fine-tuning dùng data có prompt và response mong muốn để kéo model về hành vi “làm theo lệnh”.
- RLHF thường gồm: collect preference, train reward model, optimize policy với ràng buộc không lệch quá xa base model.
- RL/PPO có thể đắt, nhạy hyperparameter và phức tạp về infrastructure.
- DPO tận dụng quan hệ giữa reward và log-probability ratio để học trực tiếp từ preference pairs.
Pipeline post-training
pretrained LM
-> supervised [[Instruction Fine-Tuning|instruction fine-tuning]]
-> preference data: y_w tốt hơn y_l
-> reward modeling hoặc DPO
-> assistant model aligned hơn với người dùngDPO intuition
DPO dùng cặp , trong đó là response được chọn và là response bị chê. Mục tiêu là tăng log-probability tương đối của so với , đồng thời so với reference model để tránh drift quá mạnh.
Trực giác:
Không cần train reward model riêng rồi chạy PPO.
Học trực tiếp: với cùng prompt, response thắng phải có xác suất tương đối cao hơn response thua.Cách hiểu bằng lời của tôi
Pretraining tạo model biết ngôn ngữ; post-training tạo model biết cư xử trong vai trò assistant. RLHF/DPO không chủ yếu dạy facts mới, mà định hình preference: trả lời nào được con người xem là hữu ích, đúng format, an toàn và đáng tin hơn.
Câu hỏi review
- Vì sao LM thuần có thể không làm assistant tốt?
- Instruction fine-tuning khác pretraining ở dữ liệu và mục tiêu nào?
- RLHF gồm các bước chính nào?
- DPO loại bỏ phần khó nào của RLHF truyền thống?
- Preference pair chứa thông tin gì?