2026-08-19 - ConPL - Gemini Notebook Workflow

Ranh giới

Đây là working note đã được scaffold từ paper note/PDF để hỗ trợ đọc với Gemini Notebook. User đã báo đã đọc xong vào 2026-08-27; các phần được điền thêm sau đó là scaffold/handoff từ note và citation sẵn có, không phải bằng chứng reproduction hay kiểm code.

Setup

Từ điển khái niệm nhanh

Khái niệmĐịnh nghĩa ngắn trong paper nàyVì sao quan trọngLink
CREContinual Relation Extraction: học relation mới theo chuỗi task và vẫn phải phân loại được tất cả relation đã thấy.Là khung bài toán nền trước khi paper siết thêm ràng buộc few-shot.Continual Relation Extraction
NK-CREN-way K-shot Continual Relation Extraction: mỗi task có relation mới và mỗi relation chỉ có training samples, kể cả task đầu.Đây là protocol nghiêm ngặt mà ConPL đề xuất để tránh lợi thế base task nhiều dữ liệu.Continual Few-Shot Relation Extraction
ConPLConsistent Prototype Learning: framework dùng prompt encoder, prototype classifier, sample memory, prototype memory và consistent learning.Đây là đóng góp chính của paper để giảm forgetting/prototype distortion.Consistent Prototype Learning for Few-Shot Continual Relation Extraction
PrototypeVector đại diện cho một relation, thường lấy từ mean embedding hoặc exemplar gần class center.Là class anchor cho classifier và cũng là đối tượng có thể bị distortion qua task.Prototype Learning
Prototype distortionHiện tượng prototype/embedding geometry của relation cũ bị lệch sau khi model học task mới.Paper coi đây là cơ chế liên quan trực tiếp đến catastrophic forgetting.Prototype Learning, Catastrophic Forgetting
Sample memory Bộ nhớ lưu raw exemplar đã chọn cho mỗi relation đến task .Cung cấp dữ liệu thật để replay, nhưng vẫn tạo storage/privacy trade-off.Replay in Continual Learning
Prototype memory Bộ nhớ lưu prototype vector cho mỗi relation đã thấy đến task .Giữ class anchors cũ để classifier không phải recompute từ memory quá ít.Prototype Learning
Temporary prototype Prototype tạm của relation mới, tính từ samples trong current task trước khi chọn exemplar chính thức.Dùng trong Stage 1 để học task mới cùng old prototype memory.Prototype Learning
Current all prototypes Tập prototype đang tham gia loss ở task hiện tại: old prototypes cộng prototype của relation mới.Giúp Stage 1/2 phân loại trên toàn bộ label space đã thấy.Prototype Learning
Classification consistency loss: kéo embedding của memory sample về gần prototype đúng đã lưu.Chống encoder drift làm old sample rời khỏi class anchor.Embedding Space Regularization
Distribution consistency loss: giữ quan hệ similarity tương đối giữa memory sample và toàn bộ prototype memory.Bảo vệ geometry toàn cục, không chỉ khoảng cách sample-prototype đúng.Embedding Space Regularization
Loss trên tập target + confusing negative prototypes; paper gọi là focal loss nhưng công thức giống restricted cross-entropy hơn.Đây là thành phần ablation mạnh nhất, tập trung vào relation dễ nhầm.Contrastive Learning
Whole accuracyAccuracy sau task trên test set của tất cả relation đã thấy.Là metric chính trong Table 1, cần phân biệt với accuracy chỉ trên task mới.Continual Few-Shot Relation Extraction
Mean forgettingMetric đo mức giảm hiệu năng trên task cũ sau khi học các task sau.Table 3 dùng nó để bổ sung evidence ngoài final accuracy.Catastrophic Forgetting

Phase 1 — Paper Map

Prompt gửi Gemini

Do not summarize the paper in detail yet. Create a structural map of this paper and identify problem, motivation, gap, contributions, pipeline, components, losses, datasets, baselines, metrics, main experiments, ablations, and limitations. For every item, point to the relevant section, figure, table, or equation. The purpose is to tell me WHERE to read, not to replace my reading.

Paper map — scaffold từ nguồn

  • Problem: Few-shot continual relation extraction: model học relation mới theo chuỗi task nhưng vẫn phải phân loại đúng tất cả relation đã thấy. Đọc Introduction và Section 3. PDF tr. 1, PDF tr. 3
  • Motivation: replay ít exemplar có thể không giữ representation/prototype cũ ổn định; relation gần nghĩa như father/mother dễ bị confusion. PDF tr. 1
  • Gap: protocol CFRL trước đó không strict few-shot cho task đầu; các phương pháp memory trước đó chưa giải quyết đủ prototype distortion và confusing classes. PDF tr. 2
  • Main idea: lưu cả sample memory và prototype memory; dùng prototype classifier, consistency losses và confusing-class classification.
  • Main contributions: NK-CRE setting, ConPL architecture, multi-information memory, ba-stage training, evaluation trên FewRel/TACRED.
  • Important figure: Figure 1 về prototype distortion/forgetting; Figure 2 về distribution của class gần nhau.
  • Important equations: Eq. 1 prompt encoder; Eq. 2 prototype; Eq. 3 classifier; Eq. 5 ; Eq. 7 ; Eq. 8 ; Eq. 9-10 objectives. PDF tr. 4, PDF tr. 5
  • Main result table: Table 1 accuracy theo task. PDF tr. 7
  • Ablation table: Table 2 component ablation; Figure 4 consistency loss analysis. PDF tr. 8, PDF tr. 9
  • Limitations: storage overhead của prototype memory, outlier distortion-forgetting chưa phân tích, domain adaptability để future work. PDF tr. 10

Chỗ cần đọc trước

  • Abstract + Introduction
  • Section 3 NK-CRE
  • Section 4.1-4.4 method và Algorithm 1
  • Table 1-3
  • Limitations + Appendix prototype distortion

Phase 2 — Pass 1 Recall

Closed-book recall của tôi

Problem

  • xử lí continual learning, giảm quên lãng các task và các relation sau

Why does it matter?

  • Khi xuất hiện các quan hệ mới, mô hình vẫn bắt buộc phải được huấn luyện tiếp (continually trained). Ý nghĩa thực sự của Continual Learning là giúp mô hình học thêm kiến thức mới mà không cần phải huấn luyện lại từ đầu (retrain từ scratch) trên toàn bộ dữ liệu của tất cả các lớp cũ (vốn rất tốn kém hoặc dữ liệu cũ đã bị xóa vì lý do bảo mật) và tránh hiện tượng quên lãng thảm họa (catastrophic forgetting)

Research gap

  • Tăng cường phân tách: Khớp phân phối là chưa đủ. Nên kết hợp thêm Supervised Contrastive Learning để đẩy các prototypes của những quan hệ (relations) khác nhau ra xa, tối đa hóa lề (margin) thay vì chỉ co cụm chúng lại.

  • Tham số hóa bộ nhớ (Parameter-Efficient Memory): Hướng đi SOTA hiện tại là từ bỏ hoàn toàn việc lưu trữ mẫu thô (Replay Buffer). Thay vào đó, có thể mã hóa “phân phối” này trực tiếp vào các task-specific soft prompts (Prompt Tuning) hoặc dùng LoRA, giải quyết triệt để bài toán rò rỉ dữ liệu và Overfitting trên memory.

Main idea

  • Mô hình thực sự lưu trữ và sử dụng lại các prototype (véc-tơ đại diện cho lớp quan hệ) đã được tối ưu từ các tác vụ huấn luyện trước đó để giữ vững đặc trưng của chúng

Main contribution

  1. Định nghĩa và thiết lập bài toán N-way-K-shot Continual Relation Extraction (NK-CRE) nghiêm ngặt, sát với thực tế few-shot học liên tục.
  2. Đề xuất phương pháp Consistent Prototype Learning (ConPL) kết hợp học mẫu gợi ý (Prompt Learning) và cấu trúc bộ nhớ kép: Sample Memory (lưu mẫu dữ liệu) và Prototype Memory (lưu véc-tơ prototype cố định của lớp cũ).
  3. Đưa ra các hàm mất mát Consistency Loss (đảm bảo tính nhất quán phân phối) và Focal Loss để mô hình tập trung phân biệt các quan hệ dễ nhầm lẫn

Main result

  1. ConPL vượt trội hơn hẳn so với các mô hình mạnh nhất trước đó trên hai bộ dữ liệu FewRel và TACRED.
  2. Mô hình giảm thiểu đáng kể tỷ lệ quên lãng (forgetting rate), đạt mức rất gần với cận trên lý tưởng là JointTrain (huấn luyện chung trên tất cả dữ liệu gộp lại).
  3. Giảm thiểu tối đa sự biến dạng của prototype theo thời gian (prototype distortion)

Prompt kiểm tra recall

I have completed the first pass of the paper.
 
Here is my understanding:
 
[PASTE MY NOTES]
 
Compare my understanding against the paper. Return what is correct, inaccurate, missing, confusing, and which sections/citations I should revisit. Do not rewrite the entire paper for me.

Phase 3 — Problem / Motivation / Gap

MụcDiễn giải bằng lời của tôiEvidence / citation
General problemContinual relation extraction yêu cầu học relation mới tuần tự và vẫn phân loại được relation cũ.PDF tr. 1
Why it mattersRelation mới xuất hiện liên tục, nhãn ít, và relation gần nghĩa dễ gây nhầm lẫn sau khi model update.PDF tr. 1
What prior work solvesReplay/prototype/prompt/data augmentation giúp giảm forgetting ở CFRE/CRE.PDF tr. 2
What prior work fails to solveMột số protocol không few-shot đồng đều; memory exemplar ít không đủ giữ class geometry; confusing classes chưa được nhấn mạnh đủ.PDF tr. 2
Exact research gapStrict N-way K-shot cho mọi task và giảm forgetting/prototype distortion trong điều kiện memory cực nhỏ.PDF tr. 3
Hypothesis / intuitionGiữ prototype ổn định và ép phân biệt confusing negatives sẽ giảm catastrophic forgetting.PDF tr. 4
Contribution addressing the gapConPL kết hợp prototype memory, sample memory, , và trong training ba stage.PDF tr. 5

Câu hỏi tự kiểm tra

  • NK-CRE khác CFRL ở task đầu như thế nào?

    • CFRL (Continual Few-Shot Relation Learning): Thường sử dụng chiến lược thiết lập dữ liệu bất đối xứng. Ở task đầu tiên (Task 0), mô hình được cung cấp một tập dữ liệu rất lớn chứa nhiều quan hệ và dồi dào mẫu huấn luyện. Mục đích là để học một không gian biểu diễn (Representation Space) và bộ trích xuất đặc trưng nền tảng vững chắc trước khi bước vào các task tiếp theo vốn bị giới hạn dữ liệu (Few-shot).

    • NK-CRE (N-way-K-shot Continual Relation Extraction): Thiết lập sự khắt khe ngay từ vạch xuất phát bằng cách áp dụng Few-shot cho toàn bộ quá trình. Ở task đầu tiên, mô hình không có lợi thế từ dữ liệu lớn mà phải học và khởi tạo các prototype chỉ từ một số lượng mẫu rất nhỏ cho quan hệ. Điều này ép mô hình phải có cơ chế như Prompt Learning hoặc Consistent Prototype Learning để tránh việc khởi tạo biểu diễn bị sai lệch ngay từ đầu.

  • Vì sao một exemplar/relation chưa đủ để giữ representation cũ?

    • Việc chỉ lưu một mẫu (Exemplar) để đại diện cho một quan hệ sẽ gây ra hiệu ứng ngược do các giới hạn về mặt thống kê và học máy:

      • Sự đa dạng ngữ cảnh (Intra-class Variance): Một quan hệ trong ngôn ngữ tự nhiên (ví dụ: Thành lập tại) có thể được biểu đạt bằng hàng trăm cấu trúc cú pháp và từ vựng khác nhau. Một mẫu duy nhất chỉ phản ánh được một mảnh ghép cực nhỏ, làm mất đi tính đa dạng của không gian đặc trưng.

      • Bẫy quá khớp trên bộ nhớ (Overfitting on Memory): Khi sử dụng lại một mẫu duy nhất để củng cố (Replay) qua nhiều epoch, mô hình sẽ có xu hướng “học vẹt” các đặc trưng nhiễu (noise) của câu văn cụ thể đó thay vì bản chất của quan hệ.

      • Sụp đổ phân phối (Distribution Collapse): Các phương pháp như NK-CRE cần tính toán khoảng cách giữa các phân phối để duy trì kiến thức cũ. Một điểm dữ liệu đơn lẻ không thể tạo ra phương sai (variance), làm cho cụm phân phối của quan hệ cũ bị thu hẹp thành một điểm, dễ dàng bị phá vỡ khi mô hình cập nhật trọng số cho task mới.

  • Vì sao confusing negatives quan trọng trong relation extraction?

    “Confusing Negatives” (Các mẫu âm tính gây nhầm lẫn) là những câu có cấu trúc từ vựng hoặc loại thực thể cực kỳ giống với mẫu dương tính nhưng thực chất lại mang một quan hệ khác hoặc không có quan hệ (No_Relation).

    • Ngăn chặn học đường tắt (Shortcut Learning): Nếu không có confusing negatives, mô hình dễ dàng đoán quan hệ chỉ dựa trên loại thực thể (Ví dụ: Thấy thực thể [Người] và [Thành phố] là tự động đoán quan hệ Sinh ra tại). Confusing negatives ép mô hình phải tập trung vào cấu trúc ngữ nghĩa sâu của câu để phân loại.

    • Tinh chỉnh ranh giới quyết định (Decision Boundary Refinement): Trong học đối chiếu (Contrastive Learning), việc đưa các mẫu gây nhầm lẫn vào quá trình huấn luyện sẽ ép mô hình đẩy các class tương đồng ra xa nhau, tạo ra một ranh giới quyết định sắc nét hơn và làm giảm sự ảnh hưởng của các dữ liệu nhiễu (context noise).

    • Tối ưu hóa Gradient: Thay vì để mô hình học qua hàng ngàn mẫu negatives dễ (easy negatives) vốn không cung cấp thêm lượng thông tin hữu ích nào và gây mất cân bằng dữ liệu, tập trung vào confusing negatives giúp quá trình hội tụ nhanh hơn và biểu diễn không gian nhúng có tính phân biệt cao hơn.

Phase 4 — Method / Architecture

Tôi tự vẽ trước

Sentence + head/tail entity
-> discrete prompt với [MASK]
-> BERTBASE
-> [MASK] relation embedding
-> temporary prototypes cho relation mới
-> merge với prototype memory cũ
-> prototype classifier + confusing prototype set
-> Stage 1 train task mới + memory cũ
-> Stage 2 chọn exemplar gần center và refine memory mới
-> Stage 3 memory-only consolidation
-> classify trong toàn bộ relation đã thấy

Component map

ComponentInputOperationOutputPurposeEvidence
Prompt encodersentence, head, tail[CLS], head, [MASK], tail, [SEP], sentence, [SEP] vào BERTrelation embedding tại [MASK]khai thác PLM cho REPDF tr. 4
Prototype classifierembedding + prototypescosine-softmaxrelation probabilityclassify bằng class anchorsPDF tr. 4
Confusing class selectionsample embedding + prototype setchọn nearest negative và negatives trong margin tập trung vào class dễ nhầmPDF tr. 5
Sample memoryselected exemplarlưu một sample/relationreplay datanhắc model bằng input thậtPDF tr. 5
Prototype memoryselected feature/prototypelưu một vector/relationclass anchorgiữ geometry cũPDF tr. 5
Consistent learningmemory samples + prototypes và regularized embedding geometrycân bằng old/new và giữ relative similarityPDF tr. 5

Điều tôi vẫn chưa hiểu

  • , , , khác nhau chính xác ở mỗi stage ra sao?

    Tác giả sử dụng một hệ thống ký hiệu khá dày đặc để phục vụ các mục đích cấp phát bộ nhớ khác nhau trong từng giai đoạn huấn luyện. Dựa vào nội dung bài báo, bản chất của chúng như sau:

    • (Temporary Prototypes): Là nguyên mẫu tạm thời của task thứ . Chúng được khởi tạo ngay ở đầu Stage 1 bằng cách trung bình hóa toàn bộ mẫu huấn luyện của quan hệ mới trong .

    • (Memory Prototypes): Là nguyên mẫu chính thức của task thứ được lưu trữ cố định. Khác với , chỉ được tính toán lại dựa trên các mẫu tiêu biểu (typical samples) đã được chọn lọc để lưu vào Sample Memory ở Stage 2.

    • (Current All Prototypes): Là tập hợp tất cả các prototype đang tham gia vào quá trình tính loss tại task hiện tại. Trong Stage 1, nó là sự kết hợp của kiến thức cũ và nguyên mẫu tạm thời: . Sang Stage 2 và 3, nó được cập nhật bằng nguyên mẫu chính thức: .

    • (Global Prototype Memory): Là kho lưu trữ nguyên mẫu toàn cục của tất cả các task tính đến . Nó chỉ được chốt lại ở cuối quá trình huấn luyện: .

  • Code có triển khai Eq. 7 đúng như paper hay có focal modulation không?

    • Về mặt công thức (Paper): Tác giả khẳng định họ sử dụng “focal loss” để giải quyết sự nhầm lẫn giữa các lớp tương đồng. Tuy nhiên, công thức (Eq. 7) về mặt toán học chỉ là hàm Cross-Entropy Loss tiêu chuẩn. Khác biệt duy nhất là phân phối xác suất không tính trên toàn bộ các lớp, mà chỉ tính softmax trên một tập bị thu hẹp (gồm target prototype và các confusing negative prototypes).

    • Khoảng trống lý thuyết: Công thức này hoàn toàn vắng bóng nhân tử điều biến (modulating factor) – linh hồn của Focal Loss nguyên bản.

    • Đánh giá việc triển khai (Code): Có hai khả năng xảy ra trong mã nguồn thực tế. Một là tác giả đã tự định nghĩa lại khái niệm “focal” theo nghĩa bóng (tức là “focus” việc tính loss vào các hard negatives) và thực sự code hàm Cross-Entropy giới hạn logits. Hai là họ có implement trong code nhưng lại trình bày thiếu trong bài báo. Cách tính toán trong Eq. 6 và 7 mang dáng dấp của Hard Negative Mining hơn là cấu trúc Focal Loss truyền thống.

Phase 5 — Section Recall

Section 4.1 — Prototype-based classification

  • Input: current task samples, old sample memory, old prototype memory.
  • Process: tạo prompt, encode [MASK], tính temporary prototype, phân loại bằng cosine-softmax, thêm và .
  • Output: updated encoder parameters và temporary/current prototype representations.
  • Purpose: học relation mới trong khi vẫn giữ activation của relation cũ qua memory/prototype.
  • Still unclear: vì sao paper gọi Eq. 7 là focal loss dù công thức giống restricted cross-entropy?

Section 4.2-4.3 — Memory-enhanced + Consistent learning

  • Input: selected key samples, sample memory, prototype memory.
  • Process: chọn exemplar gần prototype nhất; lưu sample + prototype; chạy memory-only consolidation với .
  • Output: memory cân bằng cho tất cả relation đã thấy và prototype geometry ổn định hơn.
  • Purpose: giảm lệch old/new relation và hạn chế prototype distortion.

Phase 6 — Equations

Prompt operational equation walkthrough

Walk me through the key equations or formal blocks in this paper.
 
For each equation/block, explain:
1. Input: what variables or objects go into it.
2. Output: what it produces.
3. Where it is used in the training/inference pipeline.
4. What behavior it encourages.
5. What would likely break or become weaker if removed.
6. Which table, figure, ablation, or result supports its usefulness.
 
Do not summarize the whole paper. Focus only on operational understanding of the equations and formal mechanisms.

Cách dùng phần này

Bảng dưới là scaffold từ Gemini output đã lọc lại theo paper note/PDF. Dùng nó để kiểm tra công thức khi đọc lại Section 4, không coi là closed-book recall cá nhân.

Eq/blockDùng để làm gì?Input → OutputDùng ở đâu trong pipelineBehavior được khuyến khíchNếu bỏ/yếu đi thì sao?Evidence / ablationStatus
Eq. 1 — Prompt-based relation representationEncode câu thành relation representation qua prompt clozeInput: câu , head , tail , encoder → Output: hidden state tại [MASK], Bước đầu của train/inference trước khi tính prototype hoặc classifyKhai thác prior knowledge của BERT bằng template [CLS], head, [MASK], tail, [SEP], sentence, [SEP]Nếu dùng pooling thường, boundary ngữ nghĩa giữa relation có thể nhiễu hơn và few-shot sample efficiency kém hơnPrompt encoder: PDF tr. 4; prompt-tuning baselines cải thiện ở Table 1: PDF tr. 7gemini-draft
Eq. 2 + Stage 2 memory updateTính temporary prototype và chọn exemplar/prototype để lưu memoryInput: , embedding , key sample gần class center → Output: , sample memory , prototype memory Stage 1 tính prototype tạm; Stage 2 chọn key sample và tái khởi tạo prototype memoryKhóa class anchor cũ thay vì để prototype cũ bị recompute/trôi theo encoder mớiNếu không có Prototype Memory, class anchor cũ dễ bị prototype distortion khi học task mớiBỏ PM giảm T8 từ 85.77 xuống 82.21 (-3.56): Table 2, PDF tr. 8; distortion/forgetting: Figure 1, PDF tr. 1gemini-draft
Eq. 3-4 — Prototype classifier + Classify bằng cosine-softmax tới prototypes của các relation đã thấyInput: , prototypes , seen relations → Output: và CE lossStage 1/2/3 như core classification signalÉp embedding gần prototype đúng và xa prototype sai trong toàn bộ label space đã thấyNếu thiếu core CE, model không có tín hiệu phân loại relation ổn định; các consistency loss chỉ giữ geometry chứ không thay mục tiêu classifyCông thức classifier/CE: PDF tr. 4gemini-draft
Eq. 5 — classification consistencyGiữ memory sample gần prototype đúng đã lưuInput: old memory samples , prototype đúng , current embedding → Output: khoảng cách L2/scalar penaltyStage 1/2 trong và Stage 3 trong Chống encoder drift làm sample cũ rời khỏi anchor cũNếu bỏ, embedding của old samples có thể trôi khỏi prototype memory và gây misclassification/forgettingBỏ giảm nhẹ trong setting chính; khi tính probability bằng sample memory, tăng 0.73 tại T8: Table 2, PDF tr. 8, Figure 4, PDF tr. 9gemini-draft
Eq. 6-7 — Confusing-class loss Tập trung phân biệt positive prototype với hard/confusing negative prototypesInput: , prototype đúng , nearest negative , negatives qua threshold trong → Output: restricted softmax lossStage 1/2 trong và Stage 3 trong Làm ranh giới giữa relation gần nghĩa sắc hơn, ví dụ các relation dễ nhầm như family relationsNếu bỏ, model dễ merge/overwrite boundary của class gần nhau; đây là ablation rơi mạnh nhấtBỏ giảm T8 từ 85.77 xuống 75.11 (-10.66): Table 2, PDF tr. 8; confusing-class visualization: Figure 3, PDF tr. 8gemini-draft
Eq. 8 — Distribution consistency Giữ cấu trúc khoảng cách tương đối giữa sample embedding và toàn bộ prototype memoryInput: memory samples , target prototype , all prototypes → Output: penalty giữa hai vector similarity/distance distributionsChỉ ở Stage 3 memory-only consolidationGiữ global geometry: không chỉ sample gần prototype đúng, mà còn giữ quan hệ tương đối với các class khácNếu bỏ, memory-only replay dễ overfit vào vài exemplar và làm layout old/new relation mất cân bằngBỏ giảm nhẹ trong setting chính; Figure 4 cho thấy tăng 2.0 điểm khi dùng sample-memory probability: Table 2, PDF tr. 8, Figure 4, PDF tr. 9gemini-draft
Eq. 9-10 — Objectives theo stageGhép các loss thành mục tiêu huấn luyện cho Stage 1/2 và Stage 3Input: cùng các loss tương ứng → Output: hoặc Stage 1/2 dùng ; Stage 3 dùng có thêm Tách học task mới + memory cũ khỏi bước consolidation chỉ trên memoryNếu không có Stage 3/, model thiếu bước cân bằng lại tất cả relation đã thấy sau khi thêm memory mớiObjective và Algorithm 1: PDF tr. 5; bỏ consistent learning module giảm 85.77 → 84.25: Table 2, PDF tr. 8gemini-draft

Điểm cần kiểm tra lại khi đọc công thức

  • Paper gọi Eq. 7 là focal loss, nhưng công thức giống restricted cross-entropy hơn focal loss chuẩn vì không có modulation factor .
  • Phân biệt rõ giữ sample-prototype point alignment, còn giữ relative distribution/geometry với toàn bộ prototype memory.
  • Không lấy claim từ Gemini nếu không trỏ lại được về PDF/Table/Figure; các số ablation chính nên ưu tiên Table 2 và Figure 4.

Phase 7 — Loss Functions

Total training
├── L_ce -> classify current/memory samples by prototype similarity
├── L_cc -> keep memory sample close to its stored prototype
├── L_fc -> focus on confusing negative prototypes
└── L_dc -> preserve relative similarity distribution in memory-only consolidation
LossEquationInputsTrains componentBehaviorWeightAblation
Eq. 4current task + sample memoryencoder/classifier via prototypescorrect relation classificationcore loss, not individually removed
Eq. 5old/current memory samples + prototypesencodersample-prototype consistencysmall individual gain; larger when classifier uses sample memory
Eq. 7restricted confusing prototype setencoder/classifierhard-negative discriminationstrongest: -10.66 when removed
Eq. 8memory samples + prototype memoryencoderrelative distribution consistencysmall individual gain; +2.0 in Figure 4 variant

Phase 8 — Experiments

ExperimentResearch questionDatasetBaselinesMetricTable/FigureMain resultCaveat
Main NK-CRE accuracyConPL có tốt hơn continual baselines trong strict few-shot không?FewRel/TACREDEMAR, RP-CRE, ERDA, PT variantswhole accuracy after each taskTable 1ConPL dẫn đầu đa số T2-T8 và toàn bộ TACREDcác baseline không † có budget task đầu khác
Ablation componentsThành phần nào đóng góp?FewRel 10-way 5-shotConPL variantsT8 accuracyTable 2bỏ giảm mạnh nhất; bỏ PM giảm 3.56chỉ một setting chính
Consistency loss importance/ còn hữu ích khi không dùng prototype memory cho logits?FewRel 10-way 5-shotvariants dùng sample memoryaccuracy curveFigure 4 tăng 2.0, tăng 0.73hyperparameter retuned
ForgettingConPL giảm forgetting đến đâu?FewRel 10-way 5-shotSeqRun, JointTrain, baselinesmean forgettingTable 3ConPL 3.31 gần JointTrain 3.29JointTrain dùng toàn bộ dữ liệu cũ
Distortion-forgettingPrototype distortion có liên hệ forgetting không?FewRel analysis, 50 task sequencesscatter analysisdistortion vs forgettingAppendix/Figurexu hướng distortion cao đi cùng forgetting caokhông báo correlation coefficient

Protocol fingerprint

  • Dataset and split: FewRel 80 public relations, 8 tasks x 10 relations; TACRED bỏ n/a, còn 41 relations.
  • Scenario / label space: N-way K-shot continual relation extraction, evaluation trên tất cả relation đã thấy.
  • Backbone: BERTBASE với discrete prompt.
  • Seeds / number of runs: main experiments dùng 6 random task sequences; distortion analysis dùng 50 task sequences.
  • Metric and averaging: accuracy sau từng task; forgetting metric theo Chaudhry et al.
  • Baseline implementation: PT variants và ConPL dùng cùng seeds/task sequences; một số baseline legacy lấy từ CFRL.
  • External data: ERDA(PT) dùng Wikipedia augmentation; ConPL không dùng LLM augmentation.
  • Memory budget: một raw sample và một prototype vector mỗi relation.
  • Evaluation after each task: yes, T1-T8.

Phase 9 — Claim → Evidence

ClaimWhere claim appearsExperimentEvidenceMy judgmentCaveat
ConPL cải thiện NK-CRE accuracy.Abstract/ResultsTable 1FewRel 10-way 5-shot T8: ConPL 85.77 vs EMAR(PT) 81.34; TACRED 5-shot T8: 76.38 vs 68.67. PDF tr. 7Strong reported evidencechưa reproduced local
Prototype memory hữu ích.Method/AblationTable 2bỏ Prototype Memory giảm 85.77 → 82.21. PDF tr. 8Supportedchỉ FewRel 10-way 5-shot
là thành phần mạnh nhất.AblationTable 2bỏ giảm 85.77 → 75.11. PDF tr. 8Strongtên “focal loss” cần kiểm code/công thức
ConPL giảm forgetting gần JointTrain.Forgetting analysisTable 3mean forgetting ConPL 3.31, JointTrain 3.29. PDF tr. 9InterestingJointTrain có full old data
Prototype distortion liên hệ forgetting.Appendix analysisdistortion scatterpaper quan sát xu hướng qua 50 task sequences. PDF tr. 11Partialkhông causal/correlation coefficient

Phase 10 — Ablation Study

ComponentIntended purposeWith componentWithout componentDifferenceConclusion justifiedNot justified
Prototype Memorygiữ class anchors cũ85.7782.21-3.56PM có ích rõ trong FewRel 5-shotPM luôn đủ cho class đa mode
Consistent Learning Modulememory-only consolidation85.7784.25-1.52consolidation có íchchứng minh mọi consistency term đều quan trọng ngang nhau
sample-prototype consistency85.7785.69-0.08đóng góp nhỏ khi dùng PM logitsloss này vô dụng nói chung
relative distribution consistency85.7785.40-0.37đóng góp nhỏ trong setting chínhkhông cần trong setting khác
confusing-class discrimination85.7775.11-10.66thành phần quan trọng nhất theo ablationfocal loss chuẩn được validate

Phase 11 — Critical Reading

  • Strongest contribution: strict NK-CRE framing + prototype/sample memory với ablation rõ thành phần .
  • Weakest part: Eq. 7 naming và thiếu phân tích sâu vì sao prototype outliers không theo distortion-forgetting trend.
  • Main assumption: task boundary và relation set mới được biết; được phép lưu raw exemplar.
  • Alternative explanation: gains có thể đến nhiều từ prompt + hard-negative discrimination hơn là consistency losses riêng lẻ.
  • Missing experiment: sensitivity cho , memory size, nhiều prototypes/class, macro-F1/calibration.
  • Generalization risk: chỉ BERTBASE, FewRel/TACRED, English relation extraction.
  • Reproducibility risk: chi tiết compute/GPU hours không rõ, code cần kiểm Eq. 7.

Phase 12 — Reproduction Check

ItemStatusDetailMissing detail / risk
Dataset and splitPartially specifiedFewRel/TACRED task setup, public FewRel 80 relationsexact task order files/seeds cần code
PreprocessingPartially specifieddiscrete prompt with entitiesentity markers/tokenization details cần code
Input representationClearly specified[CLS], head, [MASK], tail, [SEP], sentence, [SEP]
Model / backboneClearly specifiedBERTBASEcheckpoint variant cần code
Training procedureClearly specified3 stages, epochs 1/1/3batching details
Sampling procedureClearly specifiedexemplar gần prototype nhấttie cases/multi-mode not discussed
Memory / replay strategyClearly specifiedone sample + one prototype per relationbyte budget not reported
Loss functionsPartially specifiedEq. 4/5/7/8/9/10Eq. 7 naming/code mismatch risk
OptimizerClearly specifiedAdam
Learning rateClearly specifiedschedule unclear
Batch sizeMissingnot in note/PDF scaffoldreproduction risk
EpochsClearly specified1, 1, 3
HyperparametersPartially specified, lambdas=1, clipping=10sensitivity absent
Random seedsPartially specified6 sequences; same seeds for rerunsexact seed values need code
Evaluation protocolClearly specifiedcumulative test set after each task
Inference procedurePartially specifiedprototype classifier over known relationstask identity assumptions should be checked

Phase 13 — Completeness / Oral Exam

  • Giải thích NK-CRE không nhìn paper. NK-CRE là một thiết lập bài toán học liên tục (Continual Learning) cực kỳ nghiêm ngặt. Trong đó, luồng dữ liệu (data stream) được chia thành nhiều task tuần tự. Tại bất kỳ task nào, mô hình cũng chỉ được cung cấp chính xác quan hệ (relations) mới, và mỗi quan hệ chỉ có đúng mẫu dữ liệu (samples) được gán nhãn.

    Bản chất: Nó ép mô hình giải quyết đồng thời hai bài toán khó nhất: Data Sparsity (Dữ liệu thưa thớt - không đủ để hội tụ trọng số) và Catastrophic Forgetting (Quên thảm khốc - mất đi ranh giới quyết định của các quan hệ ở task trước).

  • Phân biệt CFRL vs NK-CRE ở task đầu. CFRL trong các baseline cũ cho task đầu nhiều dữ liệu hơn, nên model có một representation nền khá mạnh trước khi bước vào few-shot continual tasks. NK-CRE nghiêm ngặt hơn: task đầu cũng chỉ có relation và sample/relation, vì vậy không có lợi thế pretraining từ task đầu giàu nhãn.

  • Vẽ ba stage ConPL.

    Task k arrives
    -> Stage 1: train on new task samples + old sample memory with temporary new prototypes and old prototype memory
    -> Stage 2: select center-nearest exemplar for each new relation, update sample/prototype memory, refine with L_class
    -> Stage 3: train only on all memory with L_cons, adding L_dc to rebalance old/new relation geometry
    -> evaluate over all seen relations
  • Giải thích vs . là ràng buộc cục bộ: embedding của memory sample phải ở gần prototype đúng của nó. là ràng buộc hình học toàn cục hơn: quan hệ similarity từ memory sample tới toàn bộ prototype memory phải giống quan hệ similarity từ prototype đúng tới toàn bộ prototype memory.

  • Giải thích vì sao có impact lớn nhất. đánh trực tiếp vào lỗi dễ gây forgetting trong relation extraction: các relation gần nghĩa/cùng kiểu entity bị kéo lẫn vào nhau. Vì loss này thu hẹp softmax vào target và confusing negatives, gradient tập trung vào decision boundary khó; Table 2 cho thấy bỏ làm T8 giảm mạnh nhất, từ 85.77 xuống 75.11.

  • Đọc Table 1-3 và nêu caveat. Table 1 ủng hộ claim ConPL mạnh hơn các baseline trong NK-CRE, nhưng cần so sánh ưu tiên với các baseline được tái chạy/có dấu † và PT variants vì baseline CFRL cũ có budget task đầu khác. Table 2 cho thấy và Prototype Memory là các thành phần rõ nhất. Table 3 cho thấy forgetting của ConPL gần JointTrain, nhưng JointTrain là upper bound dùng toàn bộ dữ liệu cũ.

  • Nêu ít nhất 3 limitation/assumption. ConPL vẫn rehearsal-based vì lưu raw exemplar; giả định task boundary/relation set mới được biết; chỉ dùng một prototype/class nên có thể yếu với class đa mode; metric chính là accuracy, thiếu macro-F1/calibration; chưa có sensitivity analysis cho , memory size hoặc nhiều prototype.

  • So sánh ConPL với CPL/WAVE++ ở mức protocol, không chỉ headline. ConPL tập trung vào strict NK-CRE và giữ class anchors bằng sample memory + prototype memory + hard-negative/confusing-class loss. CPL cùng họ prompt/prototype cho continual few-shot RE nhưng không phải điểm nhấn chính ở dual memory và distribution consistency như ConPL. WAVE++ nhìn vấn đề từ within-task variance/adaptive prompting, nhấn vào variance của task hiện tại và prompt adaptation; vì vậy khi so sánh cần tách protocol, memory budget, external augmentation, prompt design và cách mỗi paper xử lý forgetting.

Prompt oral exam

Act as my PhD advisor. Quiz me on ConPL one question at a time. Start from NK-CRE problem/gap, then method stages, equations/losses, experiments/ablation, assumptions/limitations, and finally ask me to propose improvements. Do not reveal the ideal answer before I attempt it.

Final Paper Note Handoff

Chỉ chuyển sang paper note chính những ý đã tự kiểm tra lại bằng PDF citation.

Ý cần chuyển sang paper note

  • Problem/gap: strict NK-CRE và task đầu few-shot.
  • Method overview: prompt encoder + prototype classifier + dual memory + 3 stages.
  • Important equations: Eq. 2/3/5/7/8/9/10.
  • Protocol fingerprint: FewRel/TACRED, 6 sequences, memory one exemplar + one vector.
  • Main results: Table 1 T8 và Appendix mean/std.
  • Ablation: strongest, PM meaningful, consistency smaller under PM logits.
  • Limitations: rehearsal-based, task boundary, no macro-F1/calibration, no sensitivity.
  • Concepts: Prototype Learning, Embedding Space Regularization, Replay in Continual Learning, Continual Few-Shot Relation Extraction.

Liên kết