Nắm BLEU đo n-gram precision và vì sao cần cẩn trọng khi dùng cho summary.
Câu hỏi dẫn đường
Summary tốt cần thỏa điều kiện gì ngoài việc ngắn?
Extractive và abstractive summarization khác nhau thế nào?
BLEU và ROUGE đo điều gì?
Trả lời câu hỏi dẫn đường
Summary tốt cần giữ đúng ý chính của source, không thêm facts không có trong source, đọc mạch lạc, đủ ngắn để hữu ích và phù hợp mục tiêu người đọc. Ngắn nhưng thiếu ý hoặc hallucinate thì không phải summary tốt.
Extractive summarization chọn và ghép các câu/cụm quan trọng có sẵn trong văn bản nguồn. Abstractive Summarization sinh câu mới để diễn đạt lại ý chính, nên tự nhiên hơn nhưng cũng dễ sai facts hơn.
BLEU thiên về n-gram precision: output sinh ra có bao nhiêu cụm giống reference. ROUGE thiên về overlap với reference summary và phổ biến hơn trong summarization. Cả hai đều chỉ là metric tự động, không thay thế đọc thủ công.
Ghi chú trong khi đọc
Text Summarization Pipelines có thể hiểu theo hai mức: inference nhanh bằng pipeline("summarization"), hoặc workflow fine-tuning đầy đủ cho domain cụ thể.
Với Hugging Face, pipeline("summarization", model="sshleifer/distilbart-cnn-12-6") giúp tạo baseline nhanh để xem model pretrained tóm tắt ra sao.
max_length và min_length không chỉ là format; chúng ép summary nằm trong khoảng độ dài mong muốn.
do_sample=False làm output ổn định hơn, phù hợp khi muốn baseline deterministic cho summarization.
Summarization Baseline giúp mình không đánh giá model chỉ bằng cảm giác “nghe hay hơn”; cần một output rẻ, ổn định và dễ hiểu để so sánh trước khi fine-tune.
Viết lại bằng lời của tôi
Summarization pipeline là cách biến bài toán “đọc một đoạn dài rồi viết lại ngắn hơn” thành workflow có kiểm soát. Model chỉ là một phần; mình còn phải chọn tokenizer, model, decoding parameters và metric.
Baseline là vạch sàn của workflow summarization. Nếu pipeline hoặc model fine-tuned không vượt baseline rõ ràng, vấn đề có thể nằm ở dữ liệu, truncation, decoding hoặc metric chứ không chỉ ở kích thước model.
Điểm dễ quên: summary tốt không chỉ ngắn. Nó cần giữ ý chính, không bịa thêm thông tin và phù hợp mục tiêu người đọc.
Điều chưa rõ
Khi input dài hơn giới hạn model, nên chunk tài liệu và gộp summary theo chiến lược nào?
Với summary factual, decoding strategy nào giảm hallucination tốt hơn?
Trả lời điều chưa rõ
Nếu input dài hơn giới hạn model, hướng an toàn là chia tài liệu thành các chunk có ngữ cảnh tương đối hoàn chỉnh, summarize từng chunk, rồi summarize lại các chunk summaries. Điểm cần cẩn trọng là chunking có thể làm mất quan hệ giữa các phần xa nhau, nên cần kiểm tra coverage và factuality sau khi gộp.
Với summary cần factual, nên ưu tiên decoding ổn định hơn như greedy hoặc beam search nhỏ thay vì sampling quá tự do. Tuy nhiên decoding không tự giải quyết hallucination; vẫn cần kiểm tra source grounding, giới hạn độ dài hợp lý, baseline và human review.