Đọc ngày 2026-08-09

Kế hoạch hôm nay

Câu hỏi dẫn đường

  • Relationship extraction cần thêm gì ngoài entity?
  • Event extraction và template filling tạo output có cấu trúc nào?
  • IE case study gợi ý failure mode gì?

Ghi chú trong khi đọc

  • RE có nhiều hướng: handwritten patterns, supervised learning, semi-supervised learning, weak/distant supervision, và unsupervised/open IE.
  • Pattern-based RE có precision cao khi pattern đúng, nhưng coverage thấp và khó phủ hết relation trong domain.
  • Supervised RE thường được model thành 2 bước: entity pair có liên quan không, rồi nếu có thì relation label là gì.
  • Feature có thể gồm words quanh entity, syntactic structure như NP VP NP, hoặc embedding + neural architecture.
  • Distant supervision dùng database lớn như Wikipedia/Freebase để tạo nhiều example relation tự động, rồi train supervised model.
  • Distant Supervision là cách tận dụng KB/infobox để sinh noisy labels cho relation extraction thay vì gán nhãn thủ công từng câu.
  • Open IE không cần danh sách relation cố định; output thường là tuple dạng <verb, argument1, argument2>, nhưng khó map về schema chuẩn như fatherOf hoặc inventorOf.
  • Practical advice: nếu pretrained supervised model không hợp domain, bắt đầu bằng pattern-based approach và dùng weak supervision.
  • Temporal IE cần extract date/time và normalize chúng về standard form; Duckling, SUTime, Natty và Parsedatetime là các công cụ được sách nhắc tới.
  • Event extraction đi xa hơn temporal IE: nó cố hiểu “chuyện gì đã xảy ra” và tạo temporally ordered event graph.
  • Template filling coi text generation như slot filling trên schema đã biết trước, thường là supervised 2-stage problem.
  • Case study cuối section cho thấy một hệ thống meeting extraction thực tế có thể khởi đầu bằng weak supervision/bootstrapping, rồi nâng cấp dần sang CRF, rule-based classifier, và cuối cùng là BERT/LSTM/GRU khi có đủ labeled data.
  • Case study cũng nhấn mạnh vòng lặp sản phẩm: deploy → collect feedback → add data → improve model, thay vì cố nhảy thẳng vào model lớn ngay từ đầu.

Viết lại bằng lời của tôi

RE là bước biến câu thành cạnh trong graph. Nếu NER/NEL cho mình các node đúng, RE quyết định giữa hai node có cạnh không và cạnh đó thuộc loại gì. Với domain mới, phần khó không chỉ là model, mà là định nghĩa relation schema và lấy đủ dữ liệu gán nhãn; vì vậy pattern + weak supervision thường là điểm bắt đầu thực dụng. Case study của chapter này làm rõ cùng một triết lý cho IE nói chung: đừng đợi có dataset hoàn hảo. Bắt đầu bằng giả định hẹp, bootstrap nhãn từ service/rule, validate tay, rồi mở rộng model theo dữ liệu thật và feedback từ production.

Việc cần làm