Social Media Text Data

Định nghĩa

Social Media Text Data (SMTD) là dữ liệu văn bản sinh ra từ các nền tảng mạng xã hội như Twitter, Facebook, Instagram, WhatsApp và các kênh tương tự.

SMTD khác văn bản chuẩn vì nó ngắn, informal, nhiều nhiễu, dùng hashtag/mention/emoji/URL, đổi từ vựng nhanh và thường chứa code-mixing hoặc transliteration.

Vì sao khó với NLP

  • Không luôn đúng ngữ pháp hoặc đủ dấu câu.
  • Có nhiều viết tắt, slang và ký tự lặp.
  • Hashtag, mention, URL và emoji vừa là noise vừa có thể là tín hiệu quan trọng.
  • Vocabulary drift nhanh làm tăng OOV.
  • Văn bản ngắn làm feature sparse và thiếu context.
  • Có nhiều spam, promo, troll và nội dung không liên quan task.

Pipeline cần chú ý

SMTD
-> collect / filter
-> specialized tokenizer
-> social-specific normalization
-> representation robust to OOV
-> task model
-> monitoring for drift

Tokenization và preprocessing

  • Dùng tokenizer chuyên cho social data như twokenize, TweetTokenizer, Twikenizer hoặc Twokenizer.
  • Không xóa emoji mặc định; có thể map emoji thành text description.
  • Chuẩn hóa URL, hashtag, mention tùy task.
  • Rút gọn repeated characters nếu muốn giảm sparsity, nhưng không làm mất intensity khi sentiment cần tín hiệu này.
  • Mở rộng slang/apostrophe nếu có mapping đáng tin.

Representation

BoW/TF-IDF có thể sparse vì social data có nhiều biến thể bề mặt. Word embeddings train trên news/Wikipedia có thể lệch domain và OOV cao.

Các hướng thực dụng:

  • Dùng embeddings train trên tweet/social data.
  • Dùng tokenizer tốt hơn để giảm token lỗi.
  • Dùng character n-gram embeddings như fastText để xử lý OOV tốt hơn.
  • Train embeddings riêng chỉ khi có đủ dữ liệu lớn và thật sự cần.

Cách hiểu bằng lời của tôi

SMTD không phải văn bản chuẩn bị viết sai. Nó là một môi trường ngôn ngữ riêng: nhanh, ngắn, đầy ký hiệu và luôn thay đổi. Làm NLP trên SMTD cần xem preprocessing là quyết định mô hình, vì mỗi thứ bị xóa có thể chính là tín hiệu của task.

Liên kết