Adaptive Prompting for Continual Relation Extraction: A Within-Task Variance Perspective
Tóm tắt một câu
WAVE-CRE giải bài toán Continual Relation Extraction không lưu raw examples bằng ba cơ chế phối hợp: một prompt pool riêng cho mỗi task để tách kiến thức giữa task và thích nghi theo từng input, Gaussian replay trong latent space để giữ shared classifier khỏi quên, và một relation-level task predictor để chọn đúng pool khi inference.
Nguồn
- PDF gốc: Adaptive Prompting for Continual Relation Extraction- A Within-Task Variance Perspective.pdf
- AAAI: Proceedings page
- DOI:
10.1609/aaai.v39i23.34616 - arXiv:
2412.08285v5 [cs.CL], bản PDF ngày 18-01-2025. - Venue: AAAI 2025, volume 39, issue 23, trang 24384-24392.
Ranh giới trạng thái
Note này được tổng hợp từ toàn bộ PDF 9 trang để phục vụ học tập và nghiên cứu.
reading_statusvẫn lànot-startedvì chưa có bằng chứng người dùng đã tự đọc paper.
Bài toán và formulation
Trong Continual Relation Extraction (CRE), model học tuần tự một chuỗi task:
Task có dataset gán nhãn
trong đó là tập relation của task hiện tại. Sau khi học xong task , model phải dự đoán trên toàn bộ relation đã thấy:
Điểm khó là model không chỉ học relation mới mà còn phải giữ decision boundary của relation cũ. Các rehearsal-based methods giải quyết bằng memory buffer, nhưng việc lưu câu gốc tạo chi phí bộ nhớ và lo ngại privacy. PDF, tr. 2
Research gap
Paper chỉ ra bốn failure modes của prompt-based continual learning:
- Shared parameters vẫn quên: shared prompt pool, general prompt hoặc shared MLP classifier tiếp tục bị update theo task mới.
- Sai task/prompt ở inference: training biết task đang học, nhưng test phải tự chọn prompt pool; chọn sai tạo train-test mismatch.
- Cross-task variance chưa đủ: một shared prompt pool có thể khiến samples thuộc các task khác nhau chọn chung expert, làm task-specific knowledge khó tách biệt.
- Within-task variance chưa đủ: một prompt cố định cho cả task không đủ linh hoạt để biểu diễn nhiều context/mode bên trong cùng task.
Hai câu có bề mặt gần giống nhau nhưng biểu diễn relation khác nhau là trường hợp đặc biệt dễ làm shared pool chọn nhầm prompt. PDF, tr. 1
Câu hỏi trung tâm
Có thể xây một hệ CRE không lưu raw examples nhưng vẫn đồng thời chọn đúng prompt pool, biểu diễn được biến thiên bên trong task và giữ shared classifier ổn định qua nhiều task hay không?
Đóng góp chính
- Đề xuất WAVE-CRE (Within-Task Variance Awareness for Continual Relation Extraction).
- Tạo một task-specific prompt pool cho mỗi task; nhiều prompt ngắn cho phép chọn các prefix experts khác nhau theo input.
- Diễn giải Prefix Tuning qua lăng kính Mixture of Experts để giải thích vì sao một prompt có thể xem như thêm experts vào self-attention.
- Fit per-relation Gaussian distributions trong query space và prompted-representation space để replay latent samples mà không lưu instance gốc.
- Train relation-level task predictor và shared relation classifier trên synthetic representations của toàn bộ relation đã thấy. PDF, tr. 2
Mental model
Task mới
-> tạo prompt pool riêng
-> query của mỗi input chọn K prompt/expert phù hợp
-> frozen BERT + prompt tạo relation representation
-> classifier học relation mới
Sau mỗi task
-> fit Gaussian cho query và prompted representation của từng relation
-> sample latent vectors của relation cũ và mới
-> củng cố task predictor + shared classifier
Inference
-> task predictor suy ra relation/task gần nhất
-> chọn đúng task-specific pool
-> query chọn prompt trong pool
-> BERT encode + nối hai entity representations
-> classifier dự đoán relationMental model quan trọng nhất là WAVE-CRE bảo vệ ba tầng khác nhau:
Interference giữa task -> task-specific prompt pools
Đa dạng bên trong một task -> input-dependent prompt selection
Forgetting ở shared classifier -> latent generative replay
Sai pool lúc inference -> relation-level task predictorFramework
1. Prefix tuning như thêm experts vào self-attention
Với input matrix , prefix tuning chia prompt thành key prefix và value prefix , rồi nối chúng vào key/value của attention:
Diễn giải học tập: prefix chen vào attention ở đâu?
Self-attention bình thường lấy query, key và value đều từ input hidden states :
Với scaled dot-product attention:
Nói đơn giản: mỗi token thật dùng query của nó để hỏi các token khác trong cùng input, rồi dùng attention weights để lấy thông tin từ value vectors tương ứng.
Prefix tuning thay đổi đúng phần key/value, không thêm query mới trong công thức này:
Vì vậy công thức có thể viết lại thành:
Dấu ; là nối theo chiều sequence. Nếu input có bốn token và prefix có hai vector , thì key/value attention bây giờ nhìn vào . Token thật vẫn là thứ đặt câu hỏi, nhưng nó được phép lấy thông tin từ cả token thật lẫn các prefix vectors đã học.
Đây là lý do prefix có thể đổi output dù backbone BERT bị freeze: nếu query giống một prefix key , attention score cao, attention weight nghiêng về prefix đó, và output nhận nhiều thông tin từ prefix value . Prefix không nhất thiết là câu tiếng Anh thật; nó là vector học được, giống một hướng nhớ/bias/knowledge direction mà attention có thể gọi tới.
Liên hệ với MoE nằm ở hình thức tính tổng có trọng số:
Nếu là prefix value, có thể diễn giải nó như một lightweight expert, còn giống gating weight. Điểm cần giữ cẩn thận: prefix expert không phải MoE expert đầy đủ dạng neural network . Nó gần với một vector cố định đã học hơn, nên paper gọi nó là offset vector/lightweight expert.
Trong WAVE-CRE, cầu nối tư duy là:
prefix tuning
-> prefix vector như lightweight expert trong self-attention
-> nhiều prefix experts tạo thành prompt pool
-> input khác nhau trong cùng task có thể chọn prefix khác nhau
-> xử lý within-task variance tốt hơn một prompt cố định cho cả taskTheo cách diễn giải paper kế thừa, self-attention có thể xem như nhiều MoE models; mỗi prefix vector đóng vai trò một expert mới phối hợp với các experts có sẵn. Prefix experts chỉ là offset vectors, đơn giản hơn pre-trained experts vốn phụ thuộc tuyến tính vào input. Vì vậy một expert cố định khó phủ hết biến thiên của cả task. PDF, tr. 3
2. Task-specific prompt pool
Mỗi task có cặp key-prompt:
Frozen BERT tạo query . Hệ thống chọn tập gồm keys gần query nhất:
Paper đặt prompt length , nên mỗi prompt chứa đúng một prefix expert, . Mỗi expert có key riêng giúp chọn linh hoạt hơn một prompt dài chứa nhiều experts nhưng buộc chúng dùng chung key. Pool riêng giảm parameter sharing giữa task; chọn prompt theo input tăng khả năng mô hình hóa within-task variation. PDF, tr. 4
3. Sparse-MoE scoring hiệu quả hơn
Nếu chấm điểm mỗi prefix expert riêng cho từng attention position/model, chi phí có thể là score functions. WAVE-CRE dùng cùng auxiliary score cho mọi :
nên chỉ cần scores và dùng cùng tập prefix experts xuyên các attention positions. Query đồng thời được task predictor sử dụng nên không cần một lượt encode phụ chỉ để chọn prompt. PDF, tr. 4
4. Objective học task mới
Với prompted input , frozen encoder và classifier , objective là:
- Term đầu là relation classification loss.
- Term sau buộc prompt keys khớp với query features.
- Chỉ pool hiện tại và classifier được update.
- BERT và các pool cũ bị freeze. PDF, tr. 5
Mơ hồ ký hiệu trong paper
Eq. 13 dùng
argmin, Eq. 15 cũng minimize , nhưng text gọi là cosine similarity. Hai phương trình chỉ nhất quán nếu thực chất là cosine distance hoặc negative similarity; nếu là similarity đúng nghĩa thì phép chọn phải làargmax. Paper không làm rõ dấu này.
5. Generative replay trong latent space
Với mỗi relation , WAVE-CRE fit hai Gaussian.
Prompted-representation distribution:
Query distribution:
Mean và covariance được ước lượng từ representations của relation tương ứng. sinh query để củng cố task predictor; sinh prompted representations để củng cố shared classifier. Đây là generative replay không lưu raw sentences, chứ không phải không replay bất kỳ thông tin quá khứ nào. PDF, tr. 5
6. Task predictor và relation classifier
Task predictor là feed-forward MLP có output dimension bằng số relation đã thấy, . Nó dự đoán relation trên query representation, rồi relation đó xác định task/prompt pool cần dùng. Thiết kế relation-level tránh việc coi mỗi task là một class tùy ý, vốn có meaning phụ thuộc task order.
Task-predictor loss:
Relation-classifier consolidation loss:
Hai loss giải quyết hai shared components khác nhau: giữ khả năng chọn đúng pool; giữ decision boundary của classifier trên relation cũ. PDF, tr. 5
Diễn giải học tập: không cần task ID được cấp, nhưng vẫn cần suy luận task
Điểm dễ lẫn ở Section 3.3 là WAVE-CRE có hai bài toán phân loại khác nhau:
q(x) -- task predictor g_psi --> relation tạm -> task/prompt pool
z -- relation classifier g_phi --> relation cuối cùngTask predictor nhận query representation , tức representation trước khi input được prompt bằng task-specific prompt pool. Output dimension của nó bằng số relation đã thấy , không phải số task. Vì vậy tên “task predictor” hơi gây hiểu nhầm: model dự đoán một relation tạm thời trước, rồi dùng mapping relation-to-task để chọn prompt pool:
Relation classifier thì nhận prompted relation representation và dự đoán nhãn cuối:
Vì vậy WAVE-CRE không cần oracle task ID tại test time, nhưng vẫn cần một bước task identity inference nội bộ để chọn đúng prompt pool. Đây là khác biệt quan trọng với setting task-incremental nơi task ID thật được cung cấp sẵn.
Vì sao task predictor dự đoán relation thay vì task?
Theo paper, HiDe-Prompt gộp mọi relation trong cùng task thành một class khi train task predictor. Cách này tiện nhưng task ID không có semantic meaning ổn định: nếu task order đổi, “Task 1” có thể chứa một nhóm relation hoàn toàn khác. WAVE-CRE chọn relation-level supervision để giữ semantic granularity:
HiDe-Prompt: employee_of, born_in, parent_of -> Task 1
WAVE-CRE: employee_of -> employee_of -> Task mapping
born_in -> born_in -> Task mappingNói cách khác, WAVE-CRE học bài toán mịn hơn:
rồi mới collapse:
Điều này giúp predictor học các lớp có ý nghĩa ngữ nghĩa thật hơn task IDs nhân tạo phụ thuộc vào cách chia stream. PDF, tr. 5
Eq. 18 và Eq. 19 khác nhau ở đâu?
Eq. 18 dùng query distribution để train task predictor:
Eq. 19 dùng prompted-representation distribution để train relation classifier:
Bảng nhớ nhanh:
| Representation | Distribution | Train component | Vai trò |
|---|---|---|---|
| Task predictor | Chọn task/prompt pool | ||
| Relation classifier | Dự đoán relation cuối |
Điểm tinh tế: prompt pools cũ bị freeze chưa đủ để hết forgetting, vì shared classifier vẫn phải mở rộng decision boundary khi relation mới xuất hiện. Vì vậy WAVE-CRE cần generative replay cho cả task predictor lẫn relation classifier: bảo vệ routing, còn bảo vệ final classification.
Inference có hai relation predictions
Khi test một câu mới , WAVE-CRE chạy:
x
-> q(x)
-> task predictor predicts temporary relation r_route
-> map r_route to task t
-> select prompt pool P_t
-> select top-K prompts inside P_t
-> build prompted input x_p
-> BERT encoder
-> z
-> relation classifier predicts final relation yHai relation predictions này không bắt buộc giống nhau. Prediction đầu chỉ là routing signal. Nếu true relation là employee_of, task predictor có thể đoán tạm founder_of; miễn là cả hai thuộc cùng task, prompt pool vẫn được chọn đúng và relation classifier vẫn còn cơ hội dự đoán cuối chính xác.
Limitation rút ra từ Section 3.3
Pipeline vẫn phụ thuộc vào task-defined prompt pools:
Nếu task predictor map sai task:
Vì vậy WAVE-CRE cải thiện cách suy luận task bằng relation semantics, nhưng chưa loại bỏ task khỏi kiến trúc. Đây là tension quan trọng khi đem paper này vào literature review: task labels là cấu trúc nhân tạo của experimental stream, còn relation labels mới là semantic classes tự nhiên hơn. WAVE++ sau đó thay learned task predictor bằng cascade voting, đúng vào failure mode này.
Gaussian replay cũng có assumption riêng
WAVE-CRE lưu:
So với một prototype điểm, Gaussian giữ thêm covariance nên biểu diễn được variance tốt hơn. Nhưng một Gaussian/relation vẫn có thể yếu nếu relation thực sự multimodal vì lexical variation, entity subtype, syntax hoặc context variation. Một cách đọc thận trọng là: WAVE-CRE chuyển memory từ raw examples/prototypes sang distributional representations + prompt pools, nhưng vẫn cần kiểm assumption phân phối và lỗi routing.
7. Luồng train và inference
Algorithm 1 có bốn bước chính:
- Khởi tạo pool cho task mới.
- Train và classifier trên real data của task hiện tại bằng Eq. 15.
- Fit và cho từng relation mới.
- Sample representations của toàn bộ relation trong , rồi train lại task predictor và relation classifier bằng Eq. 18-19.
Khi inference, task predictor chọn pool; query chọn prompt trong pool; prompt được prepend vào input embedding; BERT encode; hai hidden states tại entity positions được concatenate và đưa vào relation classifier. Figure 2, PDF tr. 4 Algorithm 1, PDF tr. 5
Experimental setup
| Thành phần | Thiết lập |
|---|---|
| FewRel | 80 relations, 56.000 samples, chia thành 10 sub-datasets không chồng lấn |
| TACRED | 42 relations, 106.264 samples, chia thành 10 sub-datasets |
| Backbone | BERT frozen |
| Metric | Mean accuracy qua 5 random seeds |
| Rehearsal-free/prompt baselines | L2P, EPI, HiDe-Prompt |
| Rehearsal-based baselines | EA-EMR, RP-CRE, CRL, CRE-DAS, CDec+ACA |
| Compute | Một NVIDIA A100 |
| Parameters | 114M tổng, 3,8M trainable |
| Training time | Khoảng 7 giờ trên FewRel, 3 giờ trên TACRED |
Các prompt baselines vốn được thiết kế cho computer vision và được authors reimplement bằng BERT cho CRE. Hyperparameters của WAVE-CRE được tune bằng random search; prompt-pool size được giữ cố định qua các task. PDF, tr. 6
Main results
Accuracy ở learning stage cuối
| Dataset | WAVE-CRE | Rehearsal-free tốt nhất | Chênh lệch | Rehearsal-based tốt nhất | Chênh lệch |
|---|---|---|---|---|---|
| FewRel, | 85,0 | HiDe-Prompt 67,2 | +17,8 | CDec+ACA 84,8 | +0,2 |
| TACRED, | 78,7 | HiDe-Prompt 72,6 | +6,1 | CRE-DAS 79,1 | -0,4 |
WAVE-CRE vượt rõ các rehearsal-free baselines ở stage cuối và gần ngang rehearsal-based methods dù không giữ raw training instances. Tuy nhiên kết luận nên có nuance:
- WAVE-CRE vượt rehearsal-based tốt nhất ở FewRel chỉ 0,2 điểm.
- Trên TACRED , WAVE-CRE vẫn thấp hơn CRE-DAS 0,4 điểm.
- Claim “consistently outperforms” rehearsal-free methods có ngoại lệ ở FewRel : EPI đạt 98,3 còn WAVE-CRE đạt 97,9. Table 1, PDF tr. 6
Ablations và phân tích chi tiết
Task-specific pool so với một prompt/task
Trong task-incremental TACRED, task identity được cung cấp để loại nhiễu từ task prediction:
| Model | |||
|---|---|---|---|
| WAVE-CRE | 98,4 | 92,7 | 85,2 |
| Không prompt pool | 96,8 | 90,6 | 83,4 |
Prompt pool đem lại +1,8 điểm ở , là evidence trực tiếp nhất cho within-task variation hypothesis. Table 2, PDF tr. 6
Số experts trong mỗi prompt
Authors giữ tổng số selected experts cố định:
Trong đó là số prefix experts nằm trong một prompt, còn là số prompts được chọn cho một input. Vì vậy Table 3 không đơn giản cho cấu hình cuối nhiều capacity hơn; nó giữ tổng số experts được sử dụng tương đương và thay đổi granularity của routing.
| Expert/prompt | Prompt được chọn | TACRED |
|---|---|---|
| 8 | 1 | 84,2 |
| 4 | 2 | 84,1 |
| 2 | 4 | 84,0 |
| 1 | 8 | 85,2 |
Đọc từng hàng:
| Nghĩa là | ||
|---|---|---|
| 8 | 1 | Chọn 1 prompt key, rồi lấy nguyên bundle 8 experts đi cùng nhau. |
| 4 | 2 | Chọn 2 prompt keys, mỗi key kéo theo 4 experts. |
| 2 | 4 | Chọn 4 prompt keys, mỗi key kéo theo 2 experts. |
| 1 | 8 | Chọn 8 prompt keys, mỗi expert có key/routing riêng. |
Với , router chỉ có một quyết định ở mức bundle:
k1 -> [E1 E2 E3 E4 E5 E6 E7 E8]Nếu prompt đó được chọn, cả 8 experts đi cùng nhau. Input không thể tự phối hợp một vài experts từ nhiều bundles khác nhau.
Với , mỗi expert nằm trong một prompt riêng:
k1 -> E1
k2 -> E2
k3 -> E3
k4 -> E4
...Mỗi expert có prompt key riêng, nên query-key mechanism có thể chọn tổ hợp experts mịn hơn cho từng input. Nếu pool thực tế có prompts/experts, chỉ nghĩa là mỗi input chọn Top-8 từ pool, không nghĩa là toàn bộ pool chỉ có 8 experts.
Một cách nhớ:
Kết quả 84.2 -> 84.1 -> 84.0 -> 85.2 ở TACRED ủng hộ giả thuyết của tác giả: lợi ích không chỉ đến từ số experts được dùng, mà từ việc cho phép fine-grained expert routing để thích nghi với within-task variation. Không nên diễn giải mạnh thành “ luôn tốt nhất”; đây là ablation trong task-incremental TACRED của paper, không phải định luật chung cho mọi prompt-pool architecture. Table 3, PDF tr. 7
Task predictor
Trung bình tự tính từ 10 cột của Table 4:
| Dataset | WAVE-CRE | HiDe-Prompt | EPI |
|---|---|---|---|
| FewRel | 86,17 | 80,09 | 62,67 |
| TACRED | 79,31 | 72,01 | 62,53 |
Relation-level predictor cải thiện task inference trung bình, nhưng không thắng mọi task. Trên TACRED, HiDe-Prompt cao hơn WAVE-CRE ở và . Prompt-pool misrouting vì vậy vẫn là failure mode thật, không chỉ là vấn đề đã được giải quyết hoàn toàn. Table 4, PDF tr. 7
Tôi hiểu được gì
- Freeze old prompt pools chỉ bảo vệ task-specific parameters; nó không bảo vệ shared relation classifier. Vì vậy WAVE-CRE vẫn cần latent replay.
- Prompt pool làm hai việc khác nhau: pool riêng tạo separation giữa task; routing theo query tạo specialization bên trong task.
- Task predictor mang tên “task predictor” nhưng thực chất học relation-level logits rồi ánh xạ relation về task. Đây là cách tạo semantic classes ổn định hơn task IDs phụ thuộc thứ tự.
- “Rehearsal-free” ở paper có nghĩa không lưu raw examples. WAVE-CRE vẫn replay synthetic query/prompted representations và vẫn lưu statistics của quá khứ.
- Contribution mạnh nhất không phải một loss đơn lẻ mà là decomposition của forgetting theo nơi nó xuất hiện: pool, router và classifier.
Quan hệ với WAVE++
WAVE++ là phần mở rộng trực tiếp của WAVE-CRE. WAVE++ ghi rõ một phần công trình đã xuất hiện trong paper này, rồi giữ lại task-specific prompt pools và Gaussian latent replay nhưng thay đổi hai mảnh quan trọng. WAVE++ PDF, tr. 15
| Thành phần | WAVE-CRE | WAVE++ |
|---|---|---|
| Prompt pools | Task-specific, query-key routing | Giữ lại, phân tích sâu hơn theo sparse-MoE |
| Semantic anchor | Không dùng label descriptions | Thêm label-description contrastive alignment |
| Task inference | Train relation-level MLP predictor | Cascade voting, không train task predictor riêng |
| Shared classifier | Gaussian latent replay | Giữ lại và ablate sâu hơn |
| Trainable parameters | 3,8M | 3,5M |
| Trade-off | Inference nhanh hơn, predictor có thể drift | Accuracy/task inference tốt hơn nhưng inference chậm hơn |
Ở , WAVE++ tăng từ 85,0 lên 87,7 trên FewRel và từ 78,7 lên 82,5 trên TACRED, tương ứng +2,7 và +3,8 điểm so với WAVE-CRE. Vì vậy nên đọc WAVE-CRE như nền tảng kiến trúc, còn WAVE++ là bản sửa failure mode task inference và representation discrimination. WAVE++ PDF, tr. 16
Hạn chế và giả định
Paper tự nêu
- Retaining past-task knowledge vẫn khó; forgetting xuất hiện khi prompt pools không được sử dụng đúng ở testing.
- Prefix-tuning experts hiện là các offset vectors tương đối đơn giản; capacity còn hạn chế.
- Gaussian được chọn vì gọn, nhưng alternative generative models có thể mô hình hóa distribution tốt hơn. PDF, tr. 5 PDF, tr. 7
Đánh giá từ evidence
- Không phải zero-memory: raw text không được lưu, nhưng mỗi relation vẫn có prompt parameters, mean và covariance matrices. Nếu covariance là full matrix, memory có thể tăng theo ; paper không nói rõ diagonalization hoặc shrinkage.
- Privacy là động cơ, chưa phải kết luận: không có membership-inference test, reconstruction attack hoặc formal privacy guarantee.
- Single-Gaussian assumption: một Gaussian/relation có thể không mô tả tốt representation đa mode; paper không đánh giá distribution fit.
- Task boundary/closed world: training biết task hiện tại và relation sets; inference chỉ xét cumulative known relation set. Chưa phải online/open-world CRE có boundary mơ hồ.
- Evaluation hẹp: chỉ FewRel và TACRED theo một protocol 10-task; chưa kiểm tra domain shift rộng hoặc nhiều task orders.
- Thiếu uncertainty: tables chỉ báo mean của 5 seeds, không có standard deviation, confidence interval hoặc significance test.
- Thiếu ablation module replay: không tách riêng tác dụng của , và relation-level predictor.
- Reproducibility: 9 trang không nêu đầy đủ , , batch size, epochs và random-search space; không thấy code URL.
- Variance chưa được đo trực tiếp: within-task/cross-task variance được lập luận qua kiến trúc và accuracy ablations, không có metric variance riêng.
- Ký hiệu routing mơ hồ:
argmin/cosine similarity ở Eq. 13-15 cần đối chiếu implementation trước khi tái lập.
Câu hỏi review
- CRE khác supervised relation extraction thông thường ở điểm nào?
- Vì sao freeze old prompt pools vẫn chưa đủ ngăn catastrophic forgetting?
- Task-specific prompt pool đồng thời xử lý cross-task và within-task variance như thế nào?
- Prefix tuning được diễn giải như Mixture of Experts ra sao?
- Vì sao paper chọn một expert cho mỗi prompt?
- Tại sao WAVE-CRE cần hai Gaussian và ?
- Task predictor dự đoán task ID trực tiếp hay relation?
- Main results chứng minh điều gì và chưa chứng minh điều gì?
- Ablation nào hỗ trợ trực tiếp nhất cho prompt-pool hypothesis?
- Vì sao gọi WAVE-CRE là rehearsal-free cần thêm điều kiện?
- WAVE++ thay đổi failure mode nào của WAVE-CRE?
Gợi ý trả lời câu hỏi review
- CRE nhận relation sets tuần tự và phải giữ accuracy trên toàn bộ relation cũ sau mỗi task, thay vì train một lần trên dataset cố định.
- Old pools giữ task-specific knowledge, nhưng shared classifier vẫn bị update trên relation mới và có thể dịch decision boundary khỏi relation cũ.
- Pool riêng giảm sharing giữa task; query-key routing chọn experts khác nhau cho các vùng dữ liệu khác nhau trong cùng task.
- Prefix key/value vectors được xem như các experts mới tham gia attention cùng pre-trained experts.
- Mỗi expert có key riêng, route độc lập và không bị buộc đi cùng các experts khác trong một prompt dài.
- củng cố task/pool inference; củng cố shared relation classifier.
- Predictor xuất logits theo relation trong , sau đó relation dự đoán được ánh xạ về task/pool.
- Kết quả cho thấy WAVE-CRE mạnh hơn các rehearsal-free baselines và cạnh tranh với rehearsal-based methods trên hai benchmark; chưa chứng minh privacy, zero-memory hoặc generalization ngoài protocol đó.
- Table 2: task-incremental TACRED tăng từ 83,4 lên 85,2 ở khi dùng prompt pool.
- Method không giữ raw examples nhưng vẫn sinh và replay latent representations từ per-relation Gaussian statistics.
- WAVE++ thêm semantic label descriptions và thay learned task predictor bằng cascade voting; prompt pools và latent replay vẫn là nền tảng kế thừa.
Câu hỏi nghiên cứu tiếp theo
- Full covariance, diagonal covariance và low-rank covariance đánh đổi memory/accuracy thế nào khi số relation tăng?
- Mixture of Gaussians, normalizing flow hoặc diffusion latent generator có giảm replay bias so với một Gaussian/relation không?
- Task-pool routing error đóng góp bao nhiêu vào relation error tổng, và có thể calibrate uncertainty để fallback qua nhiều pools không?
- WAVE-CRE ổn định thế nào dưới nhiều task orders và khi relation distributions drift theo thời gian?
- Latent statistics có cho phép reconstruction hoặc membership inference không?
- Có thể bỏ task boundaries lúc training và phát hiện task/relation mới online không?
- Đóng góp riêng của query replay, prompted-representation replay và relation-level predictor là bao nhiêu?
- Within-task variance có thể được đo trực tiếp bằng representation geometry thay vì chỉ suy ra từ accuracy không?
- Khi backbone được phép thích nghi, cần bảo vệ shared encoder khỏi forgetting bằng cơ chế nào?
Evidence map
| Trang PDF | Evidence chính | Dùng để kết luận |
|---|---|---|
| PDF tr. 1 | Abstract, CRE motivation, bốn hạn chế của prompt-based methods | Problem, gap, đóng góp |
| PDF tr. 2 | Figure 1, CRE formulation, MoE và sparse routing | Objective tổng quát, background |
| PDF tr. 3 | Prefix tuning như experts, ba stage methodology, Eq. 3-12 | MoE interpretation, pool definition |
| PDF tr. 4 | Figure 2, key-query selection, , sparse-MoE score | Data flow, within-task routing, inference |
| PDF tr. 5 | Eq. 15-19, Gaussian replay, task predictor, Algorithm 1 | Losses, training loop, classifier consolidation |
| PDF tr. 6 | Datasets, baselines, compute, Table 1-2 | Protocol, main results, prompt-pool ablation |
| PDF tr. 7 | Table 3-4 và conclusion | Expert-count ablation, task prediction, limitations |
| PDF tr. 8 | References phần đầu | Nguồn nền về CRE, BERT, prompt tuning, MoE |
| PDF tr. 9 | References phần cuối | Nguồn nền về continual learning và prompting |