Một Transformer block biến sequence embeddings thành contextualized embeddings như thế nào?
Mental model
token IDs-> token embeddings + positional embeddings-> multi-head self-attention: token trao đổi thông tin-> residual + layer normalization: giữ tín hiệu ổn định-> feed-forward layer: xử lý từng token sau khi đã có context-> residual + layer normalization-> contextualized embeddings
Các concept cấu thành
Self-Attention: mỗi token lấy thông tin từ các token liên quan trong sequence.
Multi-Head Attention: chạy nhiều attention pattern song song để học nhiều kiểu quan hệ.
Feed-Forward Layer: biến đổi từng token representation sau khi attention đã đưa context vào.