Đọc ngày 2026-07-29

Kế hoạch hôm nay

Mục tiêu cần hiểu

  • Hiểu vì sao sinh văn bản mạch lạc khó hơn chỉ dự đoán token tiếp theo.
  • Phân biệt greedy search, beam search và sampling khi decode text.
  • Nắm top-k và nucleus sampling kiểm soát sự đa dạng của output như thế nào.
  • Biết trade-off giữa output chính xác, đa dạng, tự nhiên và ít lặp.

Câu hỏi dẫn đường

  • Greedy search, beam search và sampling khác nhau thế nào?
  • Vì sao output sinh văn bản dễ bị lặp?
  • Top-k và nucleus sampling kiểm soát sự đa dạng ra sao?

Ghi chú trong khi đọc

Viết lại bằng lời của tôi

Điều chưa rõ

Việc cần làm

  • Đọc trang 150-163
  • So sánh 3 decoding strategy bằng lời của tôi
  • Cập nhật Text Generation