Đọc ngày 2026-08-07
Kế hoạch hôm nay
Mục tiêu cần hiểu
- Hiểu khi nào cần train Transformer từ đầu thay vì dùng pretrained model.
- Nắm tầm quan trọng của chất lượng corpus đối với chất lượng model sau pretraining.
- Biết các bước xây dựng custom code dataset và xử lý dữ liệu lớn bằng Datasets.
- Hiểu vì sao cần tokenizer riêng cho domain/code và cách chuẩn bị dữ liệu để train tokenizer.
Câu hỏi dẫn đường
- Khi nào train từ đầu hợp lý hơn fine-tune?
- Corpus cần chuẩn bị như thế nào?
- Tokenizer riêng thay đổi khả năng hiểu domain ra sao?
Ghi chú trong khi đọc
Viết lại bằng lời của tôi
Điều chưa rõ
Việc cần làm