Tên model là ví dụ; điều cần nhớ là architecture quyết định model được phép nhìn context nào.
Encoder-only mạnh cho understanding vì token nhìn được toàn bộ input.
Decoder-only mạnh cho generation vì training/inference đều xoay quanh dự đoán token kế tiếp.
Encoder-decoder phù hợp khi output là một sequence mới dựa trên input khác, vì decoder có cross-attention để nhìn encoder output.
Điểm dễ nhầm
Cùng là sinh văn bản, decoder-only và encoder-decoder không giống nhau: decoder-only sinh từ prefix, còn encoder-decoder sinh có điều kiện trên input đã được encoder đọc.
Attention Mask không chỉ dùng cho padding; causal mask là thứ giữ decoder không nhìn token tương lai.