Khi model đã trả về phân phối xác suất next-token, nên chọn token tiếp theo bằng chiến lược nào?
Mental model
prompt-> model tạo logits cho token kế tiếp-> softmax thành xác suất trên vocabulary-> decoding strategy chọn token-> nối token vào prefix-> lặp lại cho đến khi đủ dài hoặc gặp EOS
Vì sao decoding quan trọng?
Text Generation không kết thúc ở một forward pass như classification.
Mỗi token được chọn sẽ trở thành context cho bước tiếp theo.
Vì vậy decoding strategy quyết định output ổn định, lặp, generic, đa dạng hay dễ mất mạch.