Đọc ngày 2026-08-05

Kế hoạch hôm nay

Mục tiêu cần hiểu

  • Hiểu bài toán thiếu nhãn qua ví dụ GitHub Issues tagger.
  • Biết cách tạo training sets và training slices để đánh giá khi dữ liệu ít.
  • Nắm chiến lược khi không có nhãn: dùng zero-shot/NLI trước khi fine-tune.
  • Hiểu data augmentation và token perturbations giúp mở rộng dữ liệu ít nhãn như thế nào.

Câu hỏi dẫn đường

  • Khi ít nhãn, vì sao không nên fine-tune ngay?
  • Baseline đơn giản giúp mình biết điều gì?
  • Embedding lookup có thể thay thế phần nào của training?

Ghi chú trong khi đọc

Viết lại bằng lời của tôi

Điều chưa rõ

Việc cần làm

  • Đọc trang 286-305
  • Viết lại chiến lược khi chỉ có ít nhãn
  • Tạo/cập nhật Few-shot Learning