Đọc ngày 2026-08-05
Kế hoạch hôm nay
Mục tiêu cần hiểu
- Hiểu bài toán thiếu nhãn qua ví dụ GitHub Issues tagger.
- Biết cách tạo training sets và training slices để đánh giá khi dữ liệu ít.
- Nắm chiến lược khi không có nhãn: dùng zero-shot/NLI trước khi fine-tune.
- Hiểu data augmentation và token perturbations giúp mở rộng dữ liệu ít nhãn như thế nào.
Câu hỏi dẫn đường
- Khi ít nhãn, vì sao không nên fine-tune ngay?
- Baseline đơn giản giúp mình biết điều gì?
- Embedding lookup có thể thay thế phần nào của training?
Ghi chú trong khi đọc
Viết lại bằng lời của tôi
Điều chưa rõ
Việc cần làm