Trọng tâm: Social media challenges, tokenizer, trends, sentiment.
Thời gian: 40 phút đọc, 15 phút viết lại.
Câu hỏi dẫn đường
Social media text nhiễu ở những dạng nào?
Tokenizer/preprocessing cần xử lý hashtag, mention, URL ra sao?
Sentiment/trending topic dễ sai vì những tín hiệu nào?
Ghi chú trong khi đọc
Social media tạo ra khối lượng text quá lớn và quá nhanh để phân tích thủ công, nên NLP được dùng để rút insight từ trend, opinion, sentiment, support và moderation.
Trending topic detection: theo dõi hashtag/chủ đề đang thu hút attention theo thời gian và vị trí. Trend trên social media có thể đổi trong vài giờ, nên yếu tố time window và geolocation rất quan trọng.
Opinion mining và sentiment detection: dùng để tóm tắt hàng nghìn post và đo public attitude với brand, product, service hoặc policy.
Customer support: social channel làm support trở nên công khai; NLP giúp hiểu, lọc, phân loại, ưu tiên và đôi khi tự động phản hồi complaint.
SMTD phá vỡ giả định của NLP truyền thống: text informal, viết tắt, thiếu dấu câu, code-mixing, transliteration, hashtag, mention, URL, emoji và vocabulary drift.
Tokenizer chuẩn có thể tách sai @NLPer, #NLProc hoặc emoticon; tokenizer cho SMTD như twokenize/TweetTokenizer giữ các unit này như token có nghĩa.
BoW/TF-IDF dễ sparse vì social text nhiều biến thể. Word2Vec train trên news/Wikipedia có thể kém vì vocabulary khác Twitter.
Viết lại bằng lời của tôi
Social media text không phải “văn bản xấu” cần làm sạch cho giống báo chí. Nó là một domain riêng, nơi hashtag, emoji, mention và slang đều có thể là tín hiệu. Pipeline tốt phải quyết định giữ/chuẩn hóa/xóa theo task, không theo thói quen.
Với social media, bài toán NLP thường gắn trực tiếp với hành động kinh doanh: biết trend nào đang lên, sentiment đang đổi ra sao, complaint nào cần xử lý, nội dung nào độc hại hoặc sai lệch.