Đọc ngày 2026-08-09

Kế hoạch hôm nay

Mục tiêu cần hiểu

  • Hiểu scaling laws nói gì về quan hệ giữa model size, data, compute và performance.
  • Nhận ra các ràng buộc thực tế của scaling: hạ tầng, chi phí, dataset curation, evaluation và deployment.
  • Phân biệt sparse attention và linearized attention như các hướng giảm chi phí attention.
  • Nắm cách Transformer mở rộng ra ngoài text: vision, tables, speech và multimodal.

Câu hỏi dẫn đường

  • Những hướng phát triển nào quan trọng nhất sau Transformer text?
  • Scaling đem lại lợi ích và rủi ro gì?
  • Tôi muốn đào sâu nhánh nào sau khi đọc xong sách?

Ghi chú trong khi đọc

  • Sparse attention: thay vì để mọi token nhìn mọi token như attention chuẩn, model chỉ giữ một attention pattern thưa hơn để giảm compute và memory trên sequence dài.
  • Sparse Attention thường dùng local window, global tokens hoặc block/stride patterns để giữ bớt long-range context mà không phải trả full quadratic cost.
  • Trade-off quan trọng: rẻ hơn nhưng dễ mất tương tác toàn cục trực tiếp nếu pattern không phù hợp bài toán.
  • Linearized attention: thay vì giảm số kết nối attention, hướng này đổi cách tính attention để tránh phải dựng toàn bộ attention matrix lớn.
  • Linearized Attention khác Sparse Attention ở chỗ nó tối ưu phép toán, không chủ yếu tối ưu attention pattern.
  • Trade-off của linearized attention thường là approximation: nhanh hơn trên sequence dài, nhưng có thể không giữ nguyên hành vi của full attention.
  • Scaling Laws cho một mental model rất quan trọng: tăng model, dữ liệu và compute thường cải thiện performance theo quy luật có thể quan sát, chứ không hoàn toàn mò mẫm.
  • Vision Transformer cho thấy Transformer không bị khóa vào text; nếu ảnh được chia patch và biểu diễn thành sequence, attention vẫn hoạt động như một bộ trộn thông tin mạnh.
  • Multimodal Transformer mở rộng ý tưởng này sang nhiều loại input, nơi text, ảnh, bảng hoặc âm thanh có thể được đưa vào cùng một khung attention.

Viết lại bằng lời của tôi

  • Sparse attention là cách “cho model nhìn chọn lọc” thay vì nhìn toàn bộ sequence. Nó không làm attention biến mất; nó chỉ bớt số cặp token phải tính để đổi lấy context dài hơn với chi phí thấp hơn.
  • Linearized attention là cách “tính attention khôn hơn” thay vì “nhìn ít đi”. Nó không nhất thiết bỏ bớt token, mà viết lại phép tính để attention đỡ đắt hơn.
  • Chương cuối giống một bản đồ phương hướng: Transformer mạnh không chỉ vì kiến trúc hiện tại, mà vì nó còn mở ra các trục phát triển về scaling, efficiency và multimodality.

Tổng kết sách

  • Cuốn sách đi từ workflow Hugging Face cơ bản, qua các task NLP chính, rồi sang production, ít nhãn, training from scratch và future directions. Điểm xuyên suốt là: muốn dùng Transformer tốt thì phải hiểu cả data, model, evaluation và deployment, chứ không chỉ gọi pipeline.
  • Với mình, khung quyết định thực tế quan trọng nhất sau khi đọc xong là: khi nào fine-tune, khi nào tối ưu production, khi nào tận dụng dữ liệu không nhãn, và khi nào tuyệt đối chưa nên train model từ đầu.

Việc cần làm