Making Pre-trained Language Models Better Continual Few-Shot Relation Extractors

Tóm tắt một câu

  • Paper đề xuất Contrastive Prompt Learning (CPL): biểu diễn relation bằng hidden state tại [MASK] trong một hybrid prompt, huấn luyện embedding bằng margin-based contrastive loss, replay một exemplar thật cho mỗi relation cùng dữ liệu do GPT-3.5 sinh, rồi dự đoán bằng Nearest-Class-Mean để giảm đồng thời Catastrophic Forgetting và overfitting trong Continual Few-Shot Relation Extraction.

Nguồn

Trạng thái và phạm vi ghi chú

Note

Frontmatter vẫn giữ status: unread và reading_status: not-started theo trạng thái quản lý paper hiện tại. Nội dung bên dưới là bản phân tích có đối chiếu đủ 14 trang PDF; nó không tự động thay đổi trạng thái đọc cá nhân hoặc rating.

Vấn đề paper giải quyết

Continual Few-Shot Relation Extraction là gì?

Relation Extraction thông thường giả định train và test dùng cùng một label space. Trong thực tế, relation mới xuất hiện theo thời gian và dữ liệu gắn nhãn cho relation mới thường rất ít. Continual Few-Shot Relation Extraction kết hợp hai ràng buộc:

  • Model phải học tuần tự các relation mới.
  • Model không được quên các relation đã học.
  • Các task mới chỉ có vài mẫu có nhãn cho mỗi relation.

Paper formalize một chuỗi task:

Mỗi task có relation set riêng; relation giữa các task là disjoint. Một instance gồm câu , head entity , tail entity và relation label. Sau khi học xong task , dữ liệu của task đó không còn được dùng trực tiếp ở các task sau, ngoại trừ số exemplar được giữ trong replay memory.

Thiết lập few-shot của paper không làm mọi task đều few-shot:

  • Task đầu có 100 mẫu cho mỗi relation.
  • Từ task thứ hai trở đi mới dùng 5-shot hoặc 10-shot.
  • Model được đánh giá trên test data của tất cả relation đã thấy, không chỉ relation của task hiện tại.

Hai vấn đề trung tâm

  1. Catastrophic forgetting: cập nhật encoder trên relation mới làm representation của relation cũ dịch chuyển hoặc mất khả năng phân biệt.
  2. Overfitting: với 5-10 mẫu cho mỗi relation, model dễ học noise, lexical shortcut hoặc cấu trúc quá riêng của training examples.

Research gap

Các hướng trước đó dùng embedding-space regularization, knowledge distillation, prototype learning, memory replay hoặc data augmentation. Theo paper, các phương pháp này chưa khai thác đủ knowledge implicit trong pretrained language model để đồng thời:

  • học biểu diễn có thể chuyển từ relation cũ sang relation mới;
  • phân biệt các relation gần nghĩa khi dữ liệu rất ít;
  • làm replay memory đa dạng hơn.

Novelty claim cần hiểu đúng phạm vi: paper tự nhận là lần đầu khảo sát prompt technology trong CFRE; prompt-based framework cho continual relation extraction nói chung đã tồn tại trước đó.

Đóng góp chính

  • Đề xuất framework Contrastive Prompt Learning (CPL) kết hợp prompt representation, margin-based contrastive learning và memory augmentation.
  • Dùng hybrid prompt không có verbalizer để đưa RE gần masked-language pretraining hơn và lấy hidden state tại [MASK] làm relation representation.
  • Đề xuất margin-based contrastive objective nhằm điều chỉnh contribution của positive/negative pairs theo similarity và nhấn mạnh hard samples.
  • Dùng GPT-3.5-turbo để sinh thêm replay examples từ relation description và một exemplar thật.
  • Dùng Nearest-Class-Mean thay cho softmax head cố định, phù hợp hơn khi class set tăng dần.
  • Báo cáo kết quả tốt nhất trong nhóm continual baselines được so sánh trên FewRel và TACRED ở cả 5-shot lẫn 10-shot.

Mental model tổng thể

Task mới
-> Hybrid prompt đưa entity và [MASK] vào input
-> BERT biến [MASK] thành relation embedding
-> MCL học geometry phân biệt relation mới
-> K-means chọn exemplar thật cho từng relation
-> GPT-3.5 sinh thêm replay samples
-> MCL replay relation cũ
-> NCM so test embedding với prototype của mọi relation đã thấy

Ba thành phần xử lý ba lớp vấn đề khác nhau:

Thành phầnVai trò chínhVấn đề nhắm tới
Hybrid promptCăn task RE với pretraining objective và tạo relation representation tổng quátForgetting, transfer sang relation mới
Margin-based contrastive learningLàm embedding phân biệt hơn, chú ý hard pairsOverfitting, relation gần nghĩa
Memory augmentationTăng support set cho replay từ một exemplar thậtSparse replay data

Phương pháp

1. Hybrid prompt representation

Vanilla prompt classification thường có:

  • Template: biến input thành cloze-style input.
  • Verbalizer: map mỗi label sang một token hoặc cụm token.

CPL bỏ verbalizer. Với câu , head entity và tail entity , template là:

Trong đó:

  • Bốn nhóm là continuous learnable prompt vectors.
  • Entity mentions là phần hard structure cung cấp prior cho RE.
  • [MASK] nằm giữa hai entity và đại diện cho relation giữa chúng.
  • Cấu hình chính dùng 4 nhóm prompt, mỗi nhóm dài 3 token, tức 12 learnable prompt tokens.
  • Prompt vectors được random initialization.

Embedding sequence được đưa qua encoder ; hidden state của [MASK] là relation representation:

Không có verbalizer nghĩa là model không phải dự đoán relation name như một vocabulary token. Nó học geometry của relation embedding, sau đó dùng metric classifier ở inference.

Vì sao hybrid thay vì hard-only hoặc soft-only?

  • Entity marker chỉ cho model biết vị trí entity nhưng không đưa task về masked-language form.
  • Hard prompt có expert prior tốt nhưng phải thiết kế thủ công.
  • Soft-only prompt linh hoạt nhưng random vectors khó hội tụ với vài mẫu.
  • Hybrid prompt giữ entity structure làm anchor và để continuous vectors tự thích nghi.

Figure 3 cho thứ tự kết quả sau task cuối: hybrid > hard > entity marker > soft-only trên cả FewRel và TACRED. Figure không in số trên từng bar nên chỉ nên dùng cho ranking, không suy số chính xác từ chiều cao cột.

2. Margin-based contrastive learning

Với normalized feature :

Trong đó là positive sample cùng relation, còn là negative sample khác relation.

Normalization term:

Similarity-dependent relaxation factors:

Batch loss:

Hyperparameters chính:

  • Margin .
  • Normalization constant .
  • Temperature .

Theo paper, và làm contribution và decision boundary thay đổi theo similarity, giúp model tập trung hơn vào hard pairs. Mục tiêu cuối là:

  • positive samples cùng relation gần nhau;
  • negative samples khác relation tách nhau;
  • feature space đồng đều hơn supervised contrastive learning;
  • giảm nhầm lẫn giữa relation gần nghĩa như child và father.

Feature bucket cho contrastive training

Supervised contrastive learning thường cần batch lớn để có đủ positive và negative pairs. CPL tránh tăng batch bằng một feature bucket :

  1. Encode current training set thành features và lưu vào .
  2. Với mỗi anchor trong batch, sample một tập features từ bucket để tạo .
  3. Tính MCL trên .
  4. Sau backpropagation, refresh các entries tương ứng trong bằng feature mới.

contrastive_sample_number được đặt là 500. Bucket này là auxiliary memory trong current-task optimization, không phải episodic memory dùng qua nhiều task.

3. Ba loại memory trong CPL

Ký hiệu / tênChứa gì?Tồn tại bao lâu?Dùng để làm gì?
/ feature bucketFeatures của current taskTrong khi train task Tạo nhiều contrastive pairs mà không cần batch lớn
/ replay memoryExemplar thật được chọn cho từng relationQua các taskGiữ evidence thật của relation cũ và tạo prototype
/ augmented samplesStructured examples do GPT-3.5 sinhTrong replay trainingMở rộng support set quanh exemplar thật

Việc tách ba memory giúp tránh nhầm rằng CPL chỉ có một replay buffer hoặc generated samples được dùng trực tiếp làm class prototype.

4. Representative memory sampling

Sau current-task training:

  1. Encode samples của từng relation.
  2. Chạy K-means với clusters cho mỗi relation.
  3. Trong mỗi cluster, chọn sample thật gần centroid nhất.
  4. Lưu sample đó vào replay memory.

Thí nghiệm chính dùng , nên mỗi relation chỉ giữ một exemplar thật gần mean embedding nhất.

5. GPT-3.5 memory augmentation

Với mỗi historical relation, prompt generation gồm:

  • mô tả format của một RE example;
  • relation name;
  • semantic relation explanation;
  • một demonstration thật có context, head entity và tail entity;
  • yêu cầu sinh examples mới cùng relation.

Paper dùng GPT-3.5-turbo, temperature 0, sinh:

  • 2 samples/relation cho FewRel;
  • 5 samples/relation cho TACRED.

Output được parse thành structured dataset , rồi ghép với real memory để replay bằng MCL.

Vì sao demonstration quan trọng?

Case study với relation child cho thấy relation name và description chưa chắc đủ để GPT hiểu đúng hướng head-tail. Khi có exemplar, output đúng relation; khi bỏ exemplar, một output mô tả hai entity là siblings nhưng vẫn gắn nhãn child.

Appendix C cũng cho thấy hai failure modes:

  • Generated samples lặp nhiều lexical pattern như mother, father, son, daughter.
  • Có thể tạo câu gần nghĩa về mặt từ vựng nhưng sai relation thật giữa head và tail.

6. Hai lượt training ở mỗi task

Prompt parameters và encoder parameters được khởi tạo từ checkpoint của task trước.

Current-task training
  D_train^k
  -> hybrid prompt
  -> encoder
  -> MCL
 
Memory construction
  -> K-means exemplar selection
  -> GPT-3.5 augmentation
 
Memory replay
  real exemplars + generated samples
  -> hybrid prompt
  -> encoder
  -> MCL lần hai

Lượt đầu học relation mới. Lượt replay củng cố relation cũ và tránh overfit vào một exemplar/relation.

7. Relation prediction bằng Nearest-Class-Mean

Sau contrastive training, prototype của relation được tính từ real memory:

Với test sample :

NCM phù hợp class-incremental setting vì:

  • không có softmax head với output dimension cố định;
  • relation mới chỉ cần thêm prototype;
  • inference tận dụng trực tiếp feature space đã được MCL làm discriminative.

Với , prototype chỉ dựa trên một exemplar thật, vì vậy chất lượng exemplar selection và stability của encoder đặc biệt quan trọng.

Experimental protocol

Datasets và task split

DatasetDữ liệu gốcTask đầuTask 2-8Setting
FewRel100 relations, 700 examples/relation; thí nghiệm dùng 80 public relations10 relations, 100 examples/relation10 relations/task, 5 hoặc 10 examples/relation10-way 5-shot / 10-way 10-shot
TACRED106,264 examples; 41 positive relations và no_relationBỏ no_relation; 6 relations, 100 examples/relation5 relations/task, 5 hoặc 10 examples/relation5-way 5-shot / 5-way 10-shot

FewRel cân bằng theo relation. TACRED mất cân bằng và gần real-world distribution hơn.

Evaluation

  • Sau task , model được đánh giá trên union test sets của mọi relation từ đến .
  • Metric là overall accuracy.
  • Kết quả được average qua 6 rounds.
  • Dùng strict evaluation: mọi seen relation đều là candidate label.
  • Loose protocol chỉ chọn 10 candidate labels không được dùng vì có thể làm task dễ hơn.
  • Task orders/random seeds được đặt theo prior CFRE work để tăng khả năng so sánh.

Baselines

  • Finetune: train tuần tự không memory; lower bound cho forgetting.
  • Joint-train: giữ toàn bộ dữ liệu cũ; upper bound phi-continual.
  • RP-CRE, CRL, CRECL: continual RE methods, gồm prototype/contrastive approaches.
  • EMAR+ACA, InfoCL: được re-run trong few-shot setting.
  • ERDA, SCKD: CFRE methods có memory và augmentation/distillation.
  • ConPL không được đưa vào vì paper cho rằng task setting khác.

Một số số liệu được lấy từ Wang et al. (2023), một số do authors re-run; đây là caveat khi so sánh tuyệt đối.

Implementation details

HyperparameterGiá trị
EncoderBERT-base-uncased
PyTorch / Transformers1.7.0 / 4.10.0
Batch size16
Current-task epochs10
Memory replay epochs10
Learning rate
OptimizerAdam
Max input length256
Hidden/output size768
Margin 0.3
Normalization 0.5
Contrastive temperature 0.1
Contrastive sample number500
Soft prompt initializationrandom
Soft prompt groups × length4 × 3
ChatGPT temperature0
Generated samples: FewRel / TACRED2 / 5

Experiments chạy trên một NVIDIA Tesla P40 24 GB và Intel Xeon Gold 5118; hyperparameters được chọn bằng grid search.

Kết quả chính

Accuracy sau task cuối

SettingFinetuneSCKDCPLJoint-trainCPL - SCKDGap CPL tới Joint
FewRel 5-shot9.7862.8764.5070.33+1.63-5.83
TACRED 5-shot7.9051.1157.3958.26+6.28-0.87
FewRel 10-shot10.7066.5867.4974.93+0.91-7.44
TACRED 10-shot8.4553.4258.5761.42+5.15-2.85

Các hiệu số trên là accuracy points, không phải relative percentage improvement.

Trajectory của CPL trong 5-shot

Dataset
FewRel94.8785.1478.8075.1072.5769.5766.8564.50
TACRED86.2781.5573.5268.9663.9662.6659.9657.39

Cách đọc kết quả

  • Finetune rơi từ 94.58 xuống 9.78 trên FewRel và từ 88.12 xuống 7.90 trên TACRED, cho thấy sequential fine-tuning không replay bị forgetting rất mạnh.
  • CPL không luôn tốt nhất ở , đặc biệt trên TACRED, nhưng giữ accuracy tốt hơn qua chuỗi task.
  • TACRED 5-shot là kết quả nổi bật nhất: CPL chỉ thấp hơn Joint-training 0.87 điểm khi episodic memory giữ một real exemplar/relation và replay còn được bổ sung 5 synthetic samples/relation do GPT-3.5 sinh. Vì vậy đây không phải kết quả của chỉ một exemplar đơn lẻ.
  • Lợi thế trên TACRED lớn hơn FewRel, gợi ý augmentation hữu ích hơn khi data distribution khó và mất cân bằng.
  • Tuy vậy paper không báo backward transfer hoặc forgetting score riêng; kết luận giảm forgetting được suy từ accuracy trajectory.

Ablation study

Final accuracy tại trong 5-shot:

Biến thểFewRelDrop so với CPLTACREDDrop so với CPL
CPL64.50-57.39-
Không prompt representation51.09-13.4142.61-14.78
Thay MCL bằng supervised contrastive loss61.78-2.7254.75-2.64
Không generated replay samples63.78-0.7250.63-6.76
Bỏ cả prompt, MCL và generation48.29-16.2138.06-19.33

Kết luận an toàn từ ablation:

  • Prompt representation là component mạnh và ổn định nhất trên cả hai datasets.
  • MCL có contribution dương nhưng nhỏ hơn prompt representation.
  • GPT augmentation phụ thuộc dataset: gần như không thêm nhiều trên FewRel nhưng rất quan trọng trên TACRED.
  • Các components bổ trợ nhau; không nên quy toàn bộ improvement cho ChatGPT.

Sensitivity và qualitative analysis

Prompt format

  • Hybrid prompt tốt nhất trên cả hai datasets.
  • Hard prompt đứng thứ hai nhưng cần manual expert design.
  • Entity marker thấp hơn hybrid đáng kể.
  • Soft-only prompt tệ nhất; paper quy nguyên nhân cho random initialization khó hội tụ trong low-resource setting.

Figure 3 không gắn số trực tiếp trên bars, nên chỉ dùng ranking thay vì ghi số ước lượng như số đo chính thức.

Số generated samples

Figure 5 thử 0, 1, 2, 5, 10 generated samples/relation:

  • FewRel đạt tốt nhất quanh 2 samples; tăng lên 5 hoặc 10 làm accuracy giảm.
  • TACRED tiếp tục tăng đến 5 samples rồi giảm ở 10.
  • Điểm 0 được Table 2 xác nhận là 63.78 trên FewRel và 50.63 trên TACRED.
  • Điểm cấu hình được chọn là 64.50 với 2 samples trên FewRel và 57.39 với 5 samples trên TACRED.

Điều này bác bỏ giả định “càng nhiều synthetic data càng tốt”. Noise, lexical monotony và distribution mismatch có thể lấn át lợi ích augmentation.

Memory size

Figure 6 dùng 10-shot, không data generation, và thay đổi :

  • Accuracy tăng rõ khi lưu nhiều exemplar/relation hơn.
  • tiến gần Joint-training.
  • Kết quả chính dùng để giữ setting tiết kiệm memory và so sánh công bằng với baselines.

Feature visualization

t-SNE cho thấy MCL tạo clusters đều và tách relation gần nghĩa tốt hơn SCL. Đây chỉ là qualitative visualization; t-SNE không phải bằng chứng định lượng cho global geometry hay generalization.

Hạn chế

Hạn chế authors công bố

  1. Time efficiency: số relation, real memory và generated replay samples tích lũy theo task, nên later-task training ngày càng chậm.
  2. Result stability: GPT-3.5 có thể trả output khác nhau với cùng input ngay cả khi temperature bằng 0. Authors average 6 rounds nhưng không loại bỏ hoàn toàn variance.

Hạn chế và assumptions suy ra từ protocol

  • CPL không rehearsal-free: vẫn lưu real examples, nên privacy/storage concern chưa biến mất.
  • Phụ thuộc external GPT-3.5 API, model version, cost, availability và data handling policy.
  • Không có quality filter rõ ràng cho generated samples trước replay.
  • Giả định task boundary, entity spans, head-tail orientation, relation name và relation description đều có sẵn.
  • Relation sets giữa các task disjoint; không xử lý relation tái xuất hiện hoặc label semantics thay đổi.
  • Bỏ no_relation, nên chưa giải quyết unknown/open-set rejection trong production RE.
  • Task đầu có 100 samples/relation; chưa chứng minh robustness khi mọi task đều few-shot.
  • Chỉ thử BERT-base trên hai English sentence-level datasets; chưa có multilingual, document-level RE hoặc noisy upstream NER.
  • Chỉ dùng accuracy; không báo macro-F1, backward transfer, explicit forgetting, confidence interval, statistical significance, latency hoặc API cost.
  • Some baseline results được trích từ prior work trong khi một số khác được re-run.
  • NCM với khiến prototype rất nhạy với exemplar và representation drift.

Discrepancies và evidence caveats

Các điểm cần giữ khi tái lập hoặc trích dẫn

Không nên làm phẳng các điểm dưới đây thành kết luận chắc chắn; chúng là bất nhất hoặc thiếu chi tiết ngay trong paper.

  1. Ablation MCL: prose ghi improvement 2.27% và 2.26%, nhưng Table 2 cho phép tính trực tiếp và accuracy points. Note này ưu tiên số trong bảng.
  2. Dấu của loss: Eq. 4 viết log-ratio chưa có dấu âm; dấu âm chỉ xuất hiện rõ trong batch loss Eq. 7. Khi reproduce nên kiểm tra implementation chính thức.
  3. NCM indexing: Eq. 9 viết tổng từ đến nhưng chia cho , có vẻ là off-by-one notation; diễn giải hợp lý là average đúng exemplars.
  4. Memory size: text nói chứa “all previous samples”, nhưng protocol cho task đầu 100 samples/relation. Cách xử lý task đầu trong phát biểu này không được giải thích đủ.
  5. Randomness: Table 5 chỉ ghi seed: 100, trong khi main text nói average 6 rounds và dùng task-order seeds của prior work. Mapping giữa config seed và sáu rounds không rõ.
  6. Generated-data stability: temperature 0 không đảm bảo deterministic output và API model có thể đổi theo thời gian.
  7. Prompt chart: Figure 3 không in numeric labels trên bars; chỉ nên dùng ranking.
  8. Forgetting claim: accuracy qua task hỗ trợ kết luận nhưng không thay cho một forgetting metric trực tiếp.

Tôi hiểu được gì

  • Giá trị lớn nhất của CPL không nằm ở “dùng ChatGPT”, mà ở việc phối hợp representation, geometry và replay.
  • Hybrid prompt làm relation extraction trông giống task mà BERT đã biết từ pretraining; nó là một dạng task alignment, không chỉ là thêm vài token.
  • MCL và NCM tạo một pipeline metric-learning nhất quán: train để feature space phân biệt, infer bằng khoảng cách trong chính feature space đó.
  • Replay memory giải quyết retention; generated samples chủ yếu làm support set quanh memory exemplar bớt quá hẹp.
  • Data augmentation có giá trị mạnh trên TACRED nhưng chỉ nhẹ trên FewRel, nên phải tune theo dataset và kiểm tra synthetic quality.
  • Một exemplar/relation là lựa chọn rất cực đoan. Kết quả sensitivity cho thấy performance tăng rõ nếu memory budget được nới.

Khi áp dụng

CPL phù hợp khi:

  • relation label space tăng theo thời gian;
  • có entity pair và relation descriptions rõ;
  • mỗi relation mới chỉ có vài labeled samples;
  • được phép giữ một episodic memory nhỏ;
  • có thể dùng external LLM để tạo replay data;
  • inference cần thêm class mới mà không thiết kế lại softmax head.

Cần thận trọng khi:

  • dữ liệu nhạy cảm không được rời hệ thống;
  • relation direction/semantics khó mô tả bằng prompt;
  • có nhiều no_relation hoặc open-world examples;
  • LLM-generated errors không thể được tự động kiểm duyệt;
  • task stream dài khiến replay cost tăng quá nhanh.

Câu hỏi review

  1. CFRE khác static few-shot RE và continual RE thông thường ở đâu?
  2. Vì sao task đầu của protocol không phải few-shot?
  3. CPL bỏ verbalizer bằng cách nào?
  4. [MASK] hidden state đóng vai trò gì?
  5. Tại sao template của CPL được gọi là hybrid prompt?
  6. Vì sao soft-only prompt hoạt động kém trong setting này?
  7. , và khác nhau như thế nào?
  8. MCL khác supervised contrastive loss ở thành phần nào?
  9. Vì sao MCL được dùng cả current-task training lẫn replay?
  10. Khi , K-means exemplar selection thực hiện điều gì?
  11. Demonstration giúp GPT-3.5 tránh lỗi relation như thế nào?
  12. Vì sao thêm nhiều generated samples có thể làm accuracy giảm?
  13. Tại sao NCM phù hợp class-incremental prediction hơn fixed softmax head?
  14. Component nào có ablation impact lớn nhất?
  15. Vì sao augmentation quan trọng hơn trên TACRED so với FewRel?
  16. Kết quả nào cho thấy CPL giảm forgetting, và bằng chứng nào vẫn còn thiếu?
  17. Vì sao Joint-train chỉ là upper bound chứ không phải continual baseline thực tế?
  18. Những assumptions nào khó giữ trong production relation extraction?

Gợi ý trả lời câu hỏi review

  1. CFRE vừa tăng label space theo task, vừa yêu cầu giữ relation cũ, vừa giới hạn relation mới ở vài labeled samples.
  2. Task đầu dùng 100 samples/relation để tạo initial knowledge base; chỉ task 2-8 là 5-shot hoặc 10-shot.
  3. CPL không map relation label sang token; nó học embedding tại [MASK] rồi phân loại bằng distance tới prototype.
  4. [MASK] hidden state là relation representation của head-tail pair trong context.
  5. Template kết hợp entity structure cố định với continuous learnable prompt vectors.
  6. Random soft vectors khó học ổn định từ vài examples nếu không có hard structural prior.
  7. là feature bucket tạm cho contrastive pairs; là real replay memory qua task; là generated replay data.
  8. MCL thêm similarity-dependent relaxation factors và vào contrastive logits.
  9. Lượt đầu tạo geometry cho relation mới; lượt replay củng cố geometry của relation cũ và giảm overfit vào sparse memory.
  10. Một cluster được tạo cho relation và sample thật gần centroid nhất được giữ.
  11. Exemplar chỉ rõ context, head-tail orientation và surface realization của relation; relation name/description một mình có thể mơ hồ.
  12. Synthetic data có thể noisy, lặp lexical pattern hoặc lệch distribution; sau một ngưỡng, lỗi nhiều hơn thông tin mới.
  13. NCM thêm class bằng prototype mới và không phụ thuộc fixed output dimension.
  14. Prompt representation: bỏ nó làm mất 13.41 điểm trên FewRel và 14.78 điểm trên TACRED tại .
  15. TACRED mất cân bằng và khó hơn; generated replay thêm 6.76 điểm, trong khi FewRel chỉ thêm 0.72 điểm.
  16. Accuracy trajectory và final-task gaps hỗ trợ claim; paper thiếu explicit forgetting/BWT metric và uncertainty.
  17. Joint-train giữ toàn bộ old data, vi phạm memory constraint của continual setting.
  18. Task boundaries, known entity spans, disjoint labels, relation descriptions, external API và permission lưu real examples có thể không tồn tại trong production.

Cần đọc tiếp

  • Đối chiếu implementation của MCL với dấu và indexing trong Equations 4-9.
  • Kiểm tra code tạo GPT prompt, parser và cách xử lý generated sample lỗi.
  • Xác định chính xác sáu random seeds/task orders dùng để average kết quả.
  • So sánh CPL với Replay in Continual Learning không dùng external LLM dưới cùng compute/API budget.
  • Đo explicit forgetting, macro-F1, variance, replay latency và token cost.
  • Kiểm tra setting có no_relation, noisy entity spans và multilingual data.

Liên quan đến

Evidence map

EvidenceVị trí trong PDF
Metadata, abstract, CFRE problem, catastrophic forgetting và overfittingPDF tr. 1
Research gap, contributions, code footnote, continual/prompt-learning related workPDF tr. 2
Task formalization, -way -shot, memory, framework overview, prompt templatePDF tr. 3
Figure 2, [MASK] encoding, MCL Equations 3-8, feature bucketPDF tr. 4
Replay, K-means exemplar selection, GPT prompt, two-stage training, NCM Equation 9PDF tr. 5
Table 1, dataset split, evaluation, baselines và implementationPDF tr. 6
Main-result interpretation, Table 2 ablation, Table 3 prompt formatsPDF tr. 7
Figures 3-5, t-SNE, generation sensitivity, demonstration/no-demonstration casePDF tr. 8
Conclusion, declared limitations và result instabilityPDF tr. 9
Bibliographical references, gồm prompt tuning, replay, MCL foundationsPDF tr. 10
Bibliographical và language-resource references cho FewRel/TACREDPDF tr. 11
Appendix dataset details, baseline caveats, hardware và Table 5 hyperparametersPDF tr. 12
Figure 6 memory-size sensitivity, Table 6 10-shot results, generated-data observationsPDF tr. 13
Table 7 generated cases và relation-error examplePDF tr. 14

Trích dẫn đáng giữ

  • Không lưu đoạn trích dài nguyên văn. Ý chính cần giữ bằng lời của tôi: CPL coi prompt alignment, contrastive geometry và replay augmentation là ba mảnh bổ trợ nhau; generated data chỉ hữu ích đến một ngưỡng và không thay thế real exemplar.