Trọng tâm: Scaling, efficient attention, multimodal và tổng kết sách.
Thời gian: 45 phút đọc, 15 phút viết lại.
Mục tiêu cần hiểu
Hiểu scaling laws nói gì về quan hệ giữa model size, data, compute và performance.
Nhận ra các ràng buộc thực tế của scaling: hạ tầng, chi phí, dataset curation, evaluation và deployment.
Phân biệt sparse attention và linearized attention như các hướng giảm chi phí attention.
Nắm cách Transformer mở rộng ra ngoài text: vision, tables, speech và multimodal.
Câu hỏi dẫn đường
Những hướng phát triển nào quan trọng nhất sau Transformer text?
Scaling đem lại lợi ích và rủi ro gì?
Tôi muốn đào sâu nhánh nào sau khi đọc xong sách?
Ghi chú trong khi đọc
Sparse attention: thay vì để mọi token nhìn mọi token như attention chuẩn, model chỉ giữ một attention pattern thưa hơn để giảm compute và memory trên sequence dài.
Sparse Attention thường dùng local window, global tokens hoặc block/stride patterns để giữ bớt long-range context mà không phải trả full quadratic cost.
Trade-off quan trọng: rẻ hơn nhưng dễ mất tương tác toàn cục trực tiếp nếu pattern không phù hợp bài toán.
Linearized attention: thay vì giảm số kết nối attention, hướng này đổi cách tính attention để tránh phải dựng toàn bộ attention matrix lớn.
Trade-off của linearized attention thường là approximation: nhanh hơn trên sequence dài, nhưng có thể không giữ nguyên hành vi của full attention.
Scaling Laws cho một mental model rất quan trọng: tăng model, dữ liệu và compute thường cải thiện performance theo quy luật có thể quan sát, chứ không hoàn toàn mò mẫm.
Vision Transformer cho thấy Transformer không bị khóa vào text; nếu ảnh được chia patch và biểu diễn thành sequence, attention vẫn hoạt động như một bộ trộn thông tin mạnh.
Multimodal Transformer mở rộng ý tưởng này sang nhiều loại input, nơi text, ảnh, bảng hoặc âm thanh có thể được đưa vào cùng một khung attention.
Viết lại bằng lời của tôi
Sparse attention là cách “cho model nhìn chọn lọc” thay vì nhìn toàn bộ sequence. Nó không làm attention biến mất; nó chỉ bớt số cặp token phải tính để đổi lấy context dài hơn với chi phí thấp hơn.
Linearized attention là cách “tính attention khôn hơn” thay vì “nhìn ít đi”. Nó không nhất thiết bỏ bớt token, mà viết lại phép tính để attention đỡ đắt hơn.
Chương cuối giống một bản đồ phương hướng: Transformer mạnh không chỉ vì kiến trúc hiện tại, mà vì nó còn mở ra các trục phát triển về scaling, efficiency và multimodality.
Tổng kết sách
Cuốn sách đi từ workflow Hugging Face cơ bản, qua các task NLP chính, rồi sang production, ít nhãn, training from scratch và future directions. Điểm xuyên suốt là: muốn dùng Transformer tốt thì phải hiểu cả data, model, evaluation và deployment, chứ không chỉ gọi pipeline.
Với mình, khung quyết định thực tế quan trọng nhất sau khi đọc xong là: khi nào fine-tune, khi nào tối ưu production, khi nào tận dụng dữ liệu không nhãn, và khi nào tuyệt đối chưa nên train model từ đầu.