Đọc ngày 2026-08-07

Kế hoạch hôm nay

Mục tiêu cần hiểu

  • Hiểu khi nào cần train Transformer từ đầu thay vì dùng pretrained model.
  • Nắm tầm quan trọng của chất lượng corpus đối với chất lượng model sau pretraining.
  • Biết các bước xây dựng custom code dataset và xử lý dữ liệu lớn bằng Datasets.
  • Hiểu vì sao cần tokenizer riêng cho domain/code và cách chuẩn bị dữ liệu để train tokenizer.

Câu hỏi dẫn đường

  • Khi nào train từ đầu hợp lý hơn fine-tune?
  • Corpus cần chuẩn bị như thế nào?
  • Tokenizer riêng thay đổi khả năng hiểu domain ra sao?

Ghi chú trong khi đọc

Viết lại bằng lời của tôi

Điều chưa rõ

Việc cần làm

  • Đọc trang 326-358
  • Viết lại quyết định train từ đầu hay fine-tune
  • Ghi concept Tokenization