Đọc ngày 2026-08-08

Kế hoạch hôm nay

Câu hỏi dẫn đường

  • Một NER system thực tế cần dữ liệu/label/schema nào?
  • Active learning giúp giảm chi phí gán nhãn ra sao?
  • Entity linking khác nhận diện entity ở đâu?

Ghi chú trong khi đọc

  • Named entity disambiguation hỏi: mention này trỏ tới thực thể cụ thể nào trong thế giới/knowledge base?
  • Named Entity Recognition chỉ tìm span và type; Entity Linking cần gán identity duy nhất, ví dụ Lincoln là người, xe Lincoln Aviator, hay địa danh Lincoln Way.
  • NER + named entity disambiguation tạo thành named entity linking (NEL).
  • NEL cần context sâu hơn NER: parsing để biết subject/verb/object, có thể cần coreference resolution để gom Albert Einstein, Einstein, the scientist về cùng một entity.
  • Khi dùng API có sẵn như Azure Text Analytics hoặc DBpedia Spotlight, phải nhớ hệ thống không hoàn hảo, dễ yếu với tên mới/domain-specific terms, và mình có ít quyền kiểm soát preprocessing/internal behavior.
  • Relation Extraction đi sau KPE/NER/NEL: không chỉ biết có những entity nào, mà phải nối chúng bằng quan hệ có nghĩa.
  • Ví dụ từ bài Apple: (Luca Maestri, finance chief, Apple) là một relation record, trong đó relation nối person với organization.
  • RE hữu ích cho knowledge base, search và Question Answering vì nó biến các entity rời rạc thành graph/record có cạnh.
  • Khó hơn NER vì phải xét words nối giữa entities, sense của cách dùng, và schema quan hệ theo domain.

Viết lại bằng lời của tôi

NER giống như khoanh vùng và dán nhãn: “Apple” là organization. NED/NEL đi thêm một bước: “Apple” này là Apple Inc. trong knowledge base, không phải quả táo hay một organization khác. Khi đã link được entity vào identity cụ thể, RE mới có thể nối các entity bằng quan hệ như finance chief of, employee of hoặc citizen of để tạo tri thức có cấu trúc.

Việc cần làm