Hiểu vai trò của tokenizer target, data collator và generation khi huấn luyện seq2seq.
Câu hỏi dẫn đường
Workflow fine-tune summarization gồm những bước nào?
Vì sao domain cụ thể ảnh hưởng chất lượng summary?
Tôi sẽ đánh giá summary bằng tiêu chí nào?
Trả lời câu hỏi dẫn đường
Workflow fine-tune summarization gồm: chuẩn bị dataset source -> reference summary, tokenize source, tokenize target summary thành labels, dùng data collator for seq2seq, fine-tune encoder-decoder model, generate summaries trên validation/test, rồi đánh giá bằng ROUGE và đọc mẫu thủ công.
Domain ảnh hưởng chất lượng summary vì mỗi domain có kiểu thông tin quan trọng khác nhau. Dialogue summary cần giữ ý định và quyết định chính; news summary cần giữ facts chính; tài liệu chuyên ngành cần giữ thuật ngữ và quan hệ chính xác.
Mình sẽ đánh giá summary bằng nhiều chiều: ROUGE để so sánh nhanh với reference, baseline để biết model có cải thiện thật không, và human review để soi coverage, factuality, coherence, conciseness và task fit.
dialogue/article + reference summary-> tokenize source-> tokenize target summary-> data collator for seq2seq-> train encoder-decoder model-> generate summaries-> evaluate with ROUGE
Điểm khác với inference: lúc train cần target summary làm nhãn, còn lúc inference model phải tự generate summary từ input.
Domain cụ thể ảnh hưởng mạnh tới summary vì model cần học phong cách rút gọn, độ dài, thông tin nào đáng giữ và format output.
Khi so sánh nhiều summary, ROUGE cho tín hiệu nhanh về overlap với reference, nhưng cần đọc lại để xem summary có giữ ý chính, đúng facts và mạch lạc không.
Measuring the Quality of Generated Text không nên dừng ở một score: cần nhìn generated text theo correctness, coverage, factuality, fluency, coherence, conciseness và task fit.
Evaluating PEGASUS on the CNN-DailyMail Dataset dùng CNN/DailyMail như benchmark cho summarization: article là input, highlights là reference summary, PEGASUS sinh output rồi so bằng ROUGE.
Data collator for seq2seq quan trọng vì batch cần padding đúng cho cả input lẫn labels; nếu padding labels bị tính vào loss thì training signal sẽ nhiễu.
Viết lại bằng lời của tôi
Fine-tuning summarization là dạy model cách tóm tắt theo kiểu mình cần, không chỉ gọi một model chung chung. Nếu domain là dialogue, model phải học cách bỏ lời thừa nhưng vẫn giữ ý định/chủ đề chính.
Evaluation không nên chỉ nhìn một con số ROUGE. ROUGE giúp so sánh nhanh, nhưng vẫn cần đọc summary để kiểm tra đủ ý, đúng facts và không thêm thông tin ngoài source.
Cách nghĩ tốt hơn: metric là bộ lọc nhanh, human review là bước quyết định summary có dùng được thật không.
Với generated text, câu hỏi cuối không phải “score có cao không?” mà là “output có giải quyết đúng việc cần làm không?“.
Khi đánh giá PEGASUS, mình nên ghi cả score lẫn vài sample cụ thể. Score cho biết xu hướng, sample cho biết model sai kiểu gì.
Training summarization là dạy decoder viết summary theo target, không chỉ ép encoder hiểu input. Vì vậy target tokenizer/labels là phần bắt buộc của workflow.
Tóm tắt Chapter 6 bằng 5-7 dòng
Chapter 06 biến summarization thành một workflow đầy đủ: dataset, tokenizer, model, generation, metric và review.
CNN/DailyMail dùng article làm source và highlights làm reference summary.
Baseline giúp biết model mạnh hơn có thật sự tạo cải thiện hay chỉ nhìn có vẻ hay hơn.
ROUGE hữu ích để so sánh nhiều summaries/checkpoints, nhưng không đủ để kết luận summary tốt.
PEGASUS đại diện cho hướng fine-tune encoder-decoder model cho abstractive summarization.
Training summarization cần tokenize cả input source và target summary, vì decoder học sinh chuỗi output.
Khi đánh giá generated text, phải đọc sample để kiểm tra facts, coverage, coherence và task fit.
Điều chưa rõ
Khi nào nên fine-tune summarization model thay vì dùng RAG hoặc prompt một LLM lớn?
ROUGE thấp nhưng summary đọc tốt thì nên tin metric hay human review hơn?
Trả lời điều chưa rõ
Nên fine-tune summarization model khi có nhiều dữ liệu cùng domain, format summary ổn định, cần chi phí inference thấp hoặc cần kiểm soát output nhất quán. Nếu dữ liệu thay đổi liên tục, cần truy xuất nguồn mới, hoặc muốn trả lời dựa trên tài liệu động, RAG/prompt LLM lớn có thể hợp hơn.
Nếu ROUGE thấp nhưng summary đọc tốt, không nên bỏ summary ngay. Cần kiểm tra vì ROUGE có thể phạt paraphrase. Tuy vậy human review cũng phải có tiêu chí rõ: summary có đúng facts, đủ ý chính, không bịa, và phù hợp task không. Kết luận tốt nhất là ghi cả metric lẫn nhận xét mẫu.