Một pipeline multilingual NER cần đi qua những quyết định nào từ dữ liệu đến đánh giá?
Mental model
multilingual text + NER tags-> tokenizer shared across languages-> label alignment-> token classification head-> fine-tune multilingual Transformer-> entity-level metrics-> error analysis by language/entity type
Multilingual NER không chỉ là thay model bằng XLM-R.
Các điểm dễ lỗi nằm ở tokenizer/subword alignment, head token classification, metric entity-level và độ lệch performance giữa ngôn ngữ nguồn/ngôn ngữ đích.
Zero-shot Learning trong chapter này nên hiểu là zero-shot cross-lingual transfer: fine-tune trên source language có nhãn, rồi áp dụng sang target language ít hoặc không có nhãn.
Khi áp dụng
Khi target language ít dữ liệu nhãn.
Khi cần kiểm tra model có transfer được giữa các ngôn ngữ không.
Khi metric tổng có vẻ ổn nhưng nghi ngờ model yếu ở một entity type hoặc một ngôn ngữ cụ thể.