Trọng tâm: Social preprocessing, support, memes, fake news.
Thời gian: 40 phút đọc, 15 phút viết lại.
Câu hỏi dẫn đường
Preprocessing social media có thể làm mất tín hiệu nào?
Customer support trên social channel cần ưu tiên gì?
Fake news detection cần xem xét gì ngoài text?
Ghi chú trong khi đọc
Preprocessing social media cần giữ tín hiệu quan trọng: emoji có thể mang sentiment, hashtag có thể biểu diễn topic, URL có thể liên quan source/credibility.
Emoji không nên bị xóa mặc định; có thể map thành mô tả text bằng thư viện như demoji để model giữ được meaning.
Repeated character normalization như yessssss -> yes giúp giảm sparsity, nhưng phải cân nhắc vì độ lặp có thể biểu thị intensity.
Với embeddings, nên ưu tiên embeddings train trên Twitter/social data hoặc character n-gram embeddings như fastText để giảm OOV và vocabulary drift.
Customer support trên social channel có bài toán cốt lõi là tách actionable messages khỏi noise. Actionable cần xử lý nhanh; noise gồm promo, coupon, troll, spam hoặc opinion không cần action.
Meme detection có hai hướng: content-based matching theo template/text similarity và behavior-based detection dựa trên share/like/comment bất thường.
Fake news detection cần fact verification với external sources, phân tích linguistic style, hoặc phát hiện generated text. Chỉ text classification có thể không đủ vì cần xác minh claim.
Viết lại bằng lời của tôi
Nếu Chapter 4 xem classification là bài toán model, Chapter 8 nhắc rằng social media classification bắt đầu từ dữ liệu: text ngắn, nhiễu, đổi từ vựng liên tục và có tín hiệu ngoài chữ.
Với meme/fake news, NLP chỉ là một phần. Hệ thống tốt cần nhìn cả content, source, propagation behavior và dữ liệu xác minh bên ngoài.