Text Representation
Định nghĩa
Text representation là cách biểu diễn token, câu, đoạn hoặc tài liệu thành vector/số để thuật toán có thể xử lý.
Cách hiểu bằng lời của tôi
Model không xử lý chữ trực tiếp. Representation là lăng kính biến text thành tín hiệu toán học. Nếu lăng kính mất thông tin quan trọng, model phía sau dù mạnh vẫn khó làm đúng task.
Các nhóm chính
- Sparse representation: one-hot, Bag of Words, Bag of N-Grams, TF-IDF.
- Dense/distributed representation: Embedding ở mức word, subword, sentence hoặc document.
- Handcrafted features: feature do người thiết kế dựa trên domain signal.
Cần biết
- Sparse vector dễ debug và làm baseline tốt, nhưng thường mất thứ tự/ngữ cảnh.
- Với text classification, sparse representation như Bag of Words có thể tạo document-term matrix cho classifier cổ điển. Điểm cần kiểm soát là vocabulary quá lớn làm vector rất sparse và nhiều feature hiếm thành noise.
- Embedding nén thông tin vào vector dense, hữu ích cho similarity, retrieval, clustering và classification. Trong Practical NLP, word embeddings được average để tạo sentence-level features cho classifier.
- Document Embedding học trực tiếp vector cho sentence/paragraph/document, nên khác với cách lấy trung bình word embeddings rồi xem đó là vector của text.
- Khi dùng pretrained word embeddings, cần kiểm tra OOV/domain vocabulary overlap và chi phí lưu/load embedding model.
- Representation phải khớp task: document classification, NER, search và QA có nhu cầu khác nhau.
- Visualization chỉ là công cụ trực giác; không nên xem plot 2D như bằng chứng đầy đủ về embedding space.