Trọng tâm: Khi nào train từ đầu, corpus và tokenizer.
Thời gian: 45 phút đọc, 15 phút viết lại.
Mục tiêu cần hiểu
Hiểu khi nào cần train Transformer từ đầu thay vì dùng pretrained model.
Nắm tầm quan trọng của chất lượng corpus đối với chất lượng model sau pretraining.
Biết các bước xây dựng custom code dataset và xử lý dữ liệu lớn bằng Datasets.
Hiểu vì sao cần tokenizer riêng cho domain/code và cách chuẩn bị dữ liệu để train tokenizer.
Câu hỏi dẫn đường
Khi nào train từ đầu hợp lý hơn fine-tune?
Corpus cần chuẩn bị như thế nào?
Tokenizer riêng thay đổi khả năng hiểu domain ra sao?
Ghi chú trong khi đọc
Training from scratch chỉ hợp lý khi pretrained model hiện có không khớp domain/ngôn ngữ/token distribution của mình, hoặc khi mục tiêu là tạo nền tảng mới chứ không chỉ làm downstream task.
Chất lượng corpus quan trọng hơn chỉ riêng kích thước: dữ liệu rác, duplicate hoặc lệch domain sẽ làm pretraining tốn compute nhưng học tín hiệu kém.
Với text chuyên biệt như code hoặc domain nhiều ký hiệu lạ, Tokenizer Training trở thành phần quan trọng vì tokenizer cũ có thể phân mảnh token quá tệ.
Pipeline dễ nhớ: xác định mục tiêu → thu thập/lọc corpus → train tokenizer → chuẩn bị dataset bằng Datasets → chọn objective → bắt đầu pretraining.
Working with Large Datasets ở chapter trước nối rất tự nhiên sang chapter này: khi train từ đầu, bài toán data pipeline trở thành hạ tầng cốt lõi chứ không chỉ là hỗ trợ.
Viết lại bằng lời của tôi
Train từ đầu không phải “bản nâng cấp mặc định” của fine-tuning. Nó chỉ đáng làm khi mình thật sự có dữ liệu, compute và lý do rõ ràng để xây một model hợp domain hơn tất cả model sẵn có.
Tokenizer riêng không phải chi tiết phụ. Nếu tokenizer cắt text domain quá vụn, model sẽ học representation kém ngay từ tầng đầu tiên.
Điều chưa rõ
Chapter 10 làm rõ rằng quyết định train từ đầu là quyết định về dữ liệu và hạ tầng trước khi là quyết định về kiến trúc.