Khác biệt giữa sparse representation và distributed representation.
Khi nào dùng BoW/TF-IDF, khi nào cần embedding.
Cách đọc và đánh giá embedding visualization một cách thận trọng.
Tóm tắt nền đã tự note
Text Representation là bước biến text thành dạng toán học để model có thể so sánh, phân loại, truy hồi hoặc gom cụm.
Vector space model biểu diễn từ/câu/tài liệu bằng vector. Similarity thường được hiểu qua khoảng cách hoặc cosine similarity trong không gian vector.
One-hot, Bag of Words, Bag of N-Grams và TF-IDF là các biểu diễn sparse. Chúng đơn giản, dễ debug, mạnh cho baseline, nhưng làm mất nhiều thông tin ngữ cảnh và thứ tự.
Distributed representation như Embedding tạo vector dense, chiều thấp hơn, học từ context và có khả năng nắm semantic similarity tốt hơn.
Representation có thể ở nhiều mức: character, subword, word, sentence, paragraph hoặc document. Mức biểu diễn phải khớp task.
Visualization giúp nhìn trực giác embedding space nhưng dễ gây hiểu nhầm vì phép chiếu 2D/3D có thể bóp méo quan hệ trong không gian cao chiều.
Handcrafted features vẫn hữu ích khi có domain signal rõ, dữ liệu ít, hoặc cần giải thích dễ hơn.