Language Modeling là lõi của pretraining: model học xác suất hoặc cấu trúc của text trước khi được giao downstream task cụ thể.
Training Loop ở quy mô pretraining gồm data loading/streaming, batching, forward, loss, backward, optimizer step, checkpointing và evaluation định kỳ.
Khi corpus và model đủ lớn, bottleneck chuyển mạnh sang compute, distributed training, GPU memory và throughput hơn là chỉ riêng thuật toán.
Perplexity là tín hiệu hữu ích để theo dõi language modeling, nhưng tự nó không đảm bảo downstream quality; vẫn cần xem mục tiêu sử dụng cuối cùng.
Viết lại bằng lời của tôi
Chapter này dạy mình rằng pretraining là một bài toán hệ thống hoàn chỉnh: dữ liệu, tokenizer, objective, training loop và compute phải khớp nhau. Không có một phần nào “vá tạm” mà kết quả vẫn tốt được.
Nếu không có tài nguyên rất lớn, giá trị lớn nhất của chapter không phải là tự train một model khổng lồ, mà là hiểu vì sao pretrained models mạnh và khi nào mình nên dừng ở fine-tuning thay vì xây từ số 0.
Điều chưa rõ
Compute budget là ràng buộc thật của training from scratch; chapter này làm rõ vì sao nhiều team nên xem pretraining là ngoại lệ, không phải mặc định.