2019 - Parameter-Efficient Transfer Learning for NLP - arXiv 1902.00751v2
Nguồn
- PDF gốc: 2019 - Parameter-Efficient Transfer Learning for NLP - arXiv 1902.00751v2.pdf
- Vai trò trong CS224N: paper nền cho Adapter và Parameter-Efficient Fine-Tuning.
Câu hỏi trung tâm
Có thể adapt pretrained language model cho nhiều task mà không cần fine-tune toàn bộ tham số mỗi lần không?
Kiến thức cốt lõi
- Full fine-tuning tạo một bản model riêng cho mỗi task, tốn storage và deployment cost.
- Adapter layers thêm module nhỏ vào model pretrained.
- Chỉ train adapter/task-specific parameters, giữ weight gốc gần như cố định.
- Cách này cho phép chia sẻ một backbone cho nhiều task.
- Paper đặt nền cho PEFT trước thời LoRA phổ biến.
Cơ chế / công thức / kiến trúc
pretrained model frozen/shared
-> chèn adapter modules vào layer
-> train adapter cho task mới
-> lưu adapter nhỏ thay vì cả modelAdapter thường có bottleneck để giới hạn số tham số thêm.
Khi áp dụng
- Dùng khi cần nhiều task/domain nhưng không muốn lưu nhiều full checkpoints.
- Hữu ích khi compute/memory giới hạn.
- So sánh với LoRA: adapter thêm module, LoRA thêm low-rank update vào weight.
Kết quả / bằng chứng đáng giữ
- Paper title và abstract tập trung vào transfer learning hiệu quả tham số.
- Lecture 09 dùng adapter như một PEFT method quan trọng.
- Adapter trade-off accuracy vs số tham số train được nhấn mạnh trong lecture.
Cách hiểu bằng lời của tôi
Adapter là cách biến một model lớn thành nền chung, còn từng task chỉ mang theo một “miếng điều chỉnh” nhỏ.
Câu hỏi review
- Adapter tiết kiệm tham số bằng cách nào?
- Vì sao sharing backbone hữu ích cho nhiều task?
- Adapter khác LoRA ở vị trí can thiệp vào model như thế nào?