CS224N 2026 - Lecture 12 - Reasoning Part 1

Nguồn

Mục tiêu cần hiểu

  • Decoding algorithm biến phân phối token thành chuỗi output.
  • Greedy, beam search và sampling tạo hành vi rất khác nhau.
  • Reasoning model hiện đại dùng RL/test-time compute để cải thiện lời giải.
  • RL cho reasoning có thể tạo năng lực nhưng cũng làm evaluation/phân tích phức tạp hơn.

Ý chính

  • Greedy decoding chọn token xác suất cao nhất ở từng bước, nhanh nhưng myopic.
  • Beam search giữ top-k hypotheses, tốt cho một số mô hình cổ điển nhưng thường kém đa dạng và không còn mặc định cho LLM hiện đại.
  • Sampling chấp nhận stochasticity để tạo output tự nhiên hơn và tránh degeneration trong generation mở.
  • Reasoning không chỉ là decoding; nó liên quan tới training signal, process supervision, reward design và inference-time compute.
  • DeepSeek-R1/R1-Zero cho thấy RL có thể khuyến khích reasoning traces, nhưng cần hiểu rõ reward và data pipeline.

Decoding cơ bản

logits
-> softmax distribution over vocabulary
-> decoding algorithm chọn token
-> append token vào context
-> lặp đến stop condition

So sánh:

Thuật toánCách chọnĐiểm mạnhĐiểm yếu
Greedytoken xác suất cao nhấtnhanh, deterministicdễ mắc local optimum
Beam searchgiữ k chuỗi tốt nhấttìm sequence có xác suất cao hơnít đa dạng, đắt hơn
Samplinglấy mẫu từ phân phốiđa dạng, hợp open-ended generationcó variance, cần kiểm soát

Reasoning và RL

RL cho reasoning thường không chỉ thưởng đáp án cuối, mà có thể tác động tới cách model khám phá lời giải. Các biến thể như PPO, GRPO, DAPO tìm cách tối ưu policy dưới reward nhưng giảm chi phí/độ phức tạp khác nhau.

Điểm cần giữ: nếu reward chỉ đo output cuối, model có thể học shortcut; nếu reward/process signal tốt hơn, model có khả năng học chiến lược giải bài ổn định hơn.

Cách hiểu bằng lời của tôi

Decoding là lúc “tính cách” của phân phối được bộc lộ. Cùng một model, greedy có thể khô và mắc kẹt; sampling có thể sáng tạo nhưng rủi ro. Với reasoning, vấn đề không chỉ là chọn token, mà là tạo điều kiện để model tiêu thêm compute đúng chỗ và được reward cho quá trình giải có ích.

Câu hỏi review

  1. Vì sao greedy decoding myopic?
  2. Khi nào beam search giảm về greedy decoding?
  3. Vì sao sampling từng được xem là bất ngờ với GPT-2?
  4. Test-time compute giúp reasoning theo nghĩa nào?
  5. Reward thiết kế sai có thể gây lỗi gì?

Liên kết