Đọc ngày 2026-08-07

Kế hoạch hôm nay

Mục tiêu cần hiểu

  • Hiểu khi nào cần train Transformer từ đầu thay vì dùng pretrained model.
  • Nắm tầm quan trọng của chất lượng corpus đối với chất lượng model sau pretraining.
  • Biết các bước xây dựng custom code dataset và xử lý dữ liệu lớn bằng Datasets.
  • Hiểu vì sao cần tokenizer riêng cho domain/code và cách chuẩn bị dữ liệu để train tokenizer.

Câu hỏi dẫn đường

  • Khi nào train từ đầu hợp lý hơn fine-tune?
  • Corpus cần chuẩn bị như thế nào?
  • Tokenizer riêng thay đổi khả năng hiểu domain ra sao?

Ghi chú trong khi đọc

  • Training from scratch chỉ hợp lý khi pretrained model hiện có không khớp domain/ngôn ngữ/token distribution của mình, hoặc khi mục tiêu là tạo nền tảng mới chứ không chỉ làm downstream task.
  • Chất lượng corpus quan trọng hơn chỉ riêng kích thước: dữ liệu rác, duplicate hoặc lệch domain sẽ làm pretraining tốn compute nhưng học tín hiệu kém.
  • Với text chuyên biệt như code hoặc domain nhiều ký hiệu lạ, Tokenizer Training trở thành phần quan trọng vì tokenizer cũ có thể phân mảnh token quá tệ.
  • Pipeline dễ nhớ: xác định mục tiêu → thu thập/lọc corpus → train tokenizer → chuẩn bị dataset bằng Datasets → chọn objective → bắt đầu pretraining.
  • Working with Large Datasets ở chapter trước nối rất tự nhiên sang chapter này: khi train từ đầu, bài toán data pipeline trở thành hạ tầng cốt lõi chứ không chỉ là hỗ trợ.

Viết lại bằng lời của tôi

  • Train từ đầu không phải “bản nâng cấp mặc định” của fine-tuning. Nó chỉ đáng làm khi mình thật sự có dữ liệu, compute và lý do rõ ràng để xây một model hợp domain hơn tất cả model sẵn có.
  • Tokenizer riêng không phải chi tiết phụ. Nếu tokenizer cắt text domain quá vụn, model sẽ học representation kém ngay từ tầng đầu tiên.

Điều chưa rõ

  • Chapter 10 làm rõ rằng quyết định train từ đầu là quyết định về dữ liệu và hạ tầng trước khi là quyết định về kiến trúc.

Việc cần làm

  • Đọc trang 326-358
  • Viết lại quyết định train từ đầu hay fine-tune
  • Ghi concept Tokenization