Adaptive Prompting for Continual Relation Extraction: A Within-Task Variance Perspective

Tóm tắt một câu

WAVE-CRE giải bài toán Continual Relation Extraction không lưu raw examples bằng ba cơ chế phối hợp: một prompt pool riêng cho mỗi task để tách kiến thức giữa task và thích nghi theo từng input, Gaussian replay trong latent space để giữ shared classifier khỏi quên, và một relation-level task predictor để chọn đúng pool khi inference.

Nguồn

Ranh giới trạng thái

Note này được tổng hợp từ toàn bộ PDF 9 trang để phục vụ học tập và nghiên cứu. reading_status vẫn là not-started vì chưa có bằng chứng người dùng đã tự đọc paper.

Bài toán và formulation

Trong Continual Relation Extraction (CRE), model học tuần tự một chuỗi task:

Task có dataset gán nhãn

trong đó là tập relation của task hiện tại. Sau khi học xong task , model phải dự đoán trên toàn bộ relation đã thấy:

Điểm khó là model không chỉ học relation mới mà còn phải giữ decision boundary của relation cũ. Các rehearsal-based methods giải quyết bằng memory buffer, nhưng việc lưu câu gốc tạo chi phí bộ nhớ và lo ngại privacy. PDF, tr. 2

Research gap

Paper chỉ ra bốn failure modes của prompt-based continual learning:

  1. Shared parameters vẫn quên: shared prompt pool, general prompt hoặc shared MLP classifier tiếp tục bị update theo task mới.
  2. Sai task/prompt ở inference: training biết task đang học, nhưng test phải tự chọn prompt pool; chọn sai tạo train-test mismatch.
  3. Cross-task variance chưa đủ: một shared prompt pool có thể khiến samples thuộc các task khác nhau chọn chung expert, làm task-specific knowledge khó tách biệt.
  4. Within-task variance chưa đủ: một prompt cố định cho cả task không đủ linh hoạt để biểu diễn nhiều context/mode bên trong cùng task.

Hai câu có bề mặt gần giống nhau nhưng biểu diễn relation khác nhau là trường hợp đặc biệt dễ làm shared pool chọn nhầm prompt. PDF, tr. 1

Câu hỏi trung tâm

Có thể xây một hệ CRE không lưu raw examples nhưng vẫn đồng thời chọn đúng prompt pool, biểu diễn được biến thiên bên trong task và giữ shared classifier ổn định qua nhiều task hay không?

Đóng góp chính

  • Đề xuất WAVE-CRE (Within-Task Variance Awareness for Continual Relation Extraction).
  • Tạo một task-specific prompt pool cho mỗi task; nhiều prompt ngắn cho phép chọn các prefix experts khác nhau theo input.
  • Diễn giải Prefix Tuning qua lăng kính Mixture of Experts để giải thích vì sao một prompt có thể xem như thêm experts vào self-attention.
  • Fit per-relation Gaussian distributions trong query space và prompted-representation space để replay latent samples mà không lưu instance gốc.
  • Train relation-level task predictor và shared relation classifier trên synthetic representations của toàn bộ relation đã thấy. PDF, tr. 2

Mental model

Task mới
-> tạo prompt pool riêng
-> query của mỗi input chọn K prompt/expert phù hợp
-> frozen BERT + prompt tạo relation representation
-> classifier học relation mới
 
Sau mỗi task
-> fit Gaussian cho query và prompted representation của từng relation
-> sample latent vectors của relation cũ và mới
-> củng cố task predictor + shared classifier
 
Inference
-> task predictor suy ra relation/task gần nhất
-> chọn đúng task-specific pool
-> query chọn prompt trong pool
-> BERT encode + nối hai entity representations
-> classifier dự đoán relation

Mental model quan trọng nhất là WAVE-CRE bảo vệ ba tầng khác nhau:

Interference giữa task        -> task-specific prompt pools
Đa dạng bên trong một task    -> input-dependent prompt selection
Forgetting ở shared classifier -> latent generative replay
Sai pool lúc inference        -> relation-level task predictor

Framework

1. Prefix tuning như thêm experts vào self-attention

Với input matrix , prefix tuning chia prompt thành key prefix và value prefix , rồi nối chúng vào key/value của attention:

Diễn giải học tập: prefix chen vào attention ở đâu?

Self-attention bình thường lấy query, key và value đều từ input hidden states :

Với scaled dot-product attention:

Nói đơn giản: mỗi token thật dùng query của nó để hỏi các token khác trong cùng input, rồi dùng attention weights để lấy thông tin từ value vectors tương ứng.

Prefix tuning thay đổi đúng phần key/value, không thêm query mới trong công thức này:

Vì vậy công thức có thể viết lại thành:

Dấu ; là nối theo chiều sequence. Nếu input có bốn token và prefix có hai vector , thì key/value attention bây giờ nhìn vào . Token thật vẫn là thứ đặt câu hỏi, nhưng nó được phép lấy thông tin từ cả token thật lẫn các prefix vectors đã học.

Đây là lý do prefix có thể đổi output dù backbone BERT bị freeze: nếu query giống một prefix key , attention score cao, attention weight nghiêng về prefix đó, và output nhận nhiều thông tin từ prefix value . Prefix không nhất thiết là câu tiếng Anh thật; nó là vector học được, giống một hướng nhớ/bias/knowledge direction mà attention có thể gọi tới.

Liên hệ với MoE nằm ở hình thức tính tổng có trọng số:

Nếu là prefix value, có thể diễn giải nó như một lightweight expert, còn giống gating weight. Điểm cần giữ cẩn thận: prefix expert không phải MoE expert đầy đủ dạng neural network . Nó gần với một vector cố định đã học hơn, nên paper gọi nó là offset vector/lightweight expert.

Trong WAVE-CRE, cầu nối tư duy là:

prefix tuning
-> prefix vector như lightweight expert trong self-attention
-> nhiều prefix experts tạo thành prompt pool
-> input khác nhau trong cùng task có thể chọn prefix khác nhau
-> xử lý within-task variance tốt hơn một prompt cố định cho cả task

Theo cách diễn giải paper kế thừa, self-attention có thể xem như nhiều MoE models; mỗi prefix vector đóng vai trò một expert mới phối hợp với các experts có sẵn. Prefix experts chỉ là offset vectors, đơn giản hơn pre-trained experts vốn phụ thuộc tuyến tính vào input. Vì vậy một expert cố định khó phủ hết biến thiên của cả task. PDF, tr. 3

2. Task-specific prompt pool

Mỗi task có cặp key-prompt:

Frozen BERT tạo query . Hệ thống chọn tập gồm keys gần query nhất:

Paper đặt prompt length , nên mỗi prompt chứa đúng một prefix expert, . Mỗi expert có key riêng giúp chọn linh hoạt hơn một prompt dài chứa nhiều experts nhưng buộc chúng dùng chung key. Pool riêng giảm parameter sharing giữa task; chọn prompt theo input tăng khả năng mô hình hóa within-task variation. PDF, tr. 4

3. Sparse-MoE scoring hiệu quả hơn

Nếu chấm điểm mỗi prefix expert riêng cho từng attention position/model, chi phí có thể là score functions. WAVE-CRE dùng cùng auxiliary score cho mọi :

nên chỉ cần scores và dùng cùng tập prefix experts xuyên các attention positions. Query đồng thời được task predictor sử dụng nên không cần một lượt encode phụ chỉ để chọn prompt. PDF, tr. 4

4. Objective học task mới

Với prompted input , frozen encoder và classifier , objective là:

  • Term đầu là relation classification loss.
  • Term sau buộc prompt keys khớp với query features.
  • Chỉ pool hiện tại và classifier được update.
  • BERT và các pool cũ bị freeze. PDF, tr. 5

Mơ hồ ký hiệu trong paper

Eq. 13 dùng argmin, Eq. 15 cũng minimize , nhưng text gọi là cosine similarity. Hai phương trình chỉ nhất quán nếu thực chất là cosine distance hoặc negative similarity; nếu là similarity đúng nghĩa thì phép chọn phải là argmax. Paper không làm rõ dấu này.

5. Generative replay trong latent space

Với mỗi relation , WAVE-CRE fit hai Gaussian.

Prompted-representation distribution:

Query distribution:

Mean và covariance được ước lượng từ representations của relation tương ứng. sinh query để củng cố task predictor; sinh prompted representations để củng cố shared classifier. Đây là generative replay không lưu raw sentences, chứ không phải không replay bất kỳ thông tin quá khứ nào. PDF, tr. 5

6. Task predictor và relation classifier

Task predictor là feed-forward MLP có output dimension bằng số relation đã thấy, . Nó dự đoán relation trên query representation, rồi relation đó xác định task/prompt pool cần dùng. Thiết kế relation-level tránh việc coi mỗi task là một class tùy ý, vốn có meaning phụ thuộc task order.

Task-predictor loss:

Relation-classifier consolidation loss:

Hai loss giải quyết hai shared components khác nhau: giữ khả năng chọn đúng pool; giữ decision boundary của classifier trên relation cũ. PDF, tr. 5

Diễn giải học tập: không cần task ID được cấp, nhưng vẫn cần suy luận task

Điểm dễ lẫn ở Section 3.3 là WAVE-CRE có hai bài toán phân loại khác nhau:

q(x) -- task predictor g_psi --> relation tạm -> task/prompt pool
z    -- relation classifier g_phi --> relation cuối cùng

Task predictor nhận query representation , tức representation trước khi input được prompt bằng task-specific prompt pool. Output dimension của nó bằng số relation đã thấy , không phải số task. Vì vậy tên “task predictor” hơi gây hiểu nhầm: model dự đoán một relation tạm thời trước, rồi dùng mapping relation-to-task để chọn prompt pool:

Relation classifier thì nhận prompted relation representation và dự đoán nhãn cuối:

Vì vậy WAVE-CRE không cần oracle task ID tại test time, nhưng vẫn cần một bước task identity inference nội bộ để chọn đúng prompt pool. Đây là khác biệt quan trọng với setting task-incremental nơi task ID thật được cung cấp sẵn.

Vì sao task predictor dự đoán relation thay vì task?

Theo paper, HiDe-Prompt gộp mọi relation trong cùng task thành một class khi train task predictor. Cách này tiện nhưng task ID không có semantic meaning ổn định: nếu task order đổi, “Task 1” có thể chứa một nhóm relation hoàn toàn khác. WAVE-CRE chọn relation-level supervision để giữ semantic granularity:

HiDe-Prompt: employee_of, born_in, parent_of -> Task 1
WAVE-CRE:    employee_of -> employee_of -> Task mapping
             born_in     -> born_in     -> Task mapping

Nói cách khác, WAVE-CRE học bài toán mịn hơn:

rồi mới collapse:

Điều này giúp predictor học các lớp có ý nghĩa ngữ nghĩa thật hơn task IDs nhân tạo phụ thuộc vào cách chia stream. PDF, tr. 5

Eq. 18 và Eq. 19 khác nhau ở đâu?

Eq. 18 dùng query distribution để train task predictor:

Eq. 19 dùng prompted-representation distribution để train relation classifier:

Bảng nhớ nhanh:

RepresentationDistributionTrain componentVai trò
Task predictor Chọn task/prompt pool
Relation classifier Dự đoán relation cuối

Điểm tinh tế: prompt pools cũ bị freeze chưa đủ để hết forgetting, vì shared classifier vẫn phải mở rộng decision boundary khi relation mới xuất hiện. Vì vậy WAVE-CRE cần generative replay cho cả task predictor lẫn relation classifier: bảo vệ routing, còn bảo vệ final classification.

Inference có hai relation predictions

Khi test một câu mới , WAVE-CRE chạy:

x
-> q(x)
-> task predictor predicts temporary relation r_route
-> map r_route to task t
-> select prompt pool P_t
-> select top-K prompts inside P_t
-> build prompted input x_p
-> BERT encoder
-> z
-> relation classifier predicts final relation y

Hai relation predictions này không bắt buộc giống nhau. Prediction đầu chỉ là routing signal. Nếu true relation là employee_of, task predictor có thể đoán tạm founder_of; miễn là cả hai thuộc cùng task, prompt pool vẫn được chọn đúng và relation classifier vẫn còn cơ hội dự đoán cuối chính xác.

Limitation rút ra từ Section 3.3

Pipeline vẫn phụ thuộc vào task-defined prompt pools:

Nếu task predictor map sai task:

Vì vậy WAVE-CRE cải thiện cách suy luận task bằng relation semantics, nhưng chưa loại bỏ task khỏi kiến trúc. Đây là tension quan trọng khi đem paper này vào literature review: task labels là cấu trúc nhân tạo của experimental stream, còn relation labels mới là semantic classes tự nhiên hơn. WAVE++ sau đó thay learned task predictor bằng cascade voting, đúng vào failure mode này.

Gaussian replay cũng có assumption riêng

WAVE-CRE lưu:

So với một prototype điểm, Gaussian giữ thêm covariance nên biểu diễn được variance tốt hơn. Nhưng một Gaussian/relation vẫn có thể yếu nếu relation thực sự multimodal vì lexical variation, entity subtype, syntax hoặc context variation. Một cách đọc thận trọng là: WAVE-CRE chuyển memory từ raw examples/prototypes sang distributional representations + prompt pools, nhưng vẫn cần kiểm assumption phân phối và lỗi routing.

7. Luồng train và inference

Algorithm 1 có bốn bước chính:

  1. Khởi tạo pool cho task mới.
  2. Train và classifier trên real data của task hiện tại bằng Eq. 15.
  3. Fit và cho từng relation mới.
  4. Sample representations của toàn bộ relation trong , rồi train lại task predictor và relation classifier bằng Eq. 18-19.

Khi inference, task predictor chọn pool; query chọn prompt trong pool; prompt được prepend vào input embedding; BERT encode; hai hidden states tại entity positions được concatenate và đưa vào relation classifier. Figure 2, PDF tr. 4 Algorithm 1, PDF tr. 5

Experimental setup

Thành phầnThiết lập
FewRel80 relations, 56.000 samples, chia thành 10 sub-datasets không chồng lấn
TACRED42 relations, 106.264 samples, chia thành 10 sub-datasets
BackboneBERT frozen
MetricMean accuracy qua 5 random seeds
Rehearsal-free/prompt baselinesL2P, EPI, HiDe-Prompt
Rehearsal-based baselinesEA-EMR, RP-CRE, CRL, CRE-DAS, CDec+ACA
ComputeMột NVIDIA A100
Parameters114M tổng, 3,8M trainable
Training timeKhoảng 7 giờ trên FewRel, 3 giờ trên TACRED

Các prompt baselines vốn được thiết kế cho computer vision và được authors reimplement bằng BERT cho CRE. Hyperparameters của WAVE-CRE được tune bằng random search; prompt-pool size được giữ cố định qua các task. PDF, tr. 6

Main results

Accuracy ở learning stage cuối

DatasetWAVE-CRERehearsal-free tốt nhấtChênh lệchRehearsal-based tốt nhấtChênh lệch
FewRel, 85,0HiDe-Prompt 67,2+17,8CDec+ACA 84,8+0,2
TACRED, 78,7HiDe-Prompt 72,6+6,1CRE-DAS 79,1-0,4

WAVE-CRE vượt rõ các rehearsal-free baselines ở stage cuối và gần ngang rehearsal-based methods dù không giữ raw training instances. Tuy nhiên kết luận nên có nuance:

  • WAVE-CRE vượt rehearsal-based tốt nhất ở FewRel chỉ 0,2 điểm.
  • Trên TACRED , WAVE-CRE vẫn thấp hơn CRE-DAS 0,4 điểm.
  • Claim “consistently outperforms” rehearsal-free methods có ngoại lệ ở FewRel : EPI đạt 98,3 còn WAVE-CRE đạt 97,9. Table 1, PDF tr. 6

Ablations và phân tích chi tiết

Task-specific pool so với một prompt/task

Trong task-incremental TACRED, task identity được cung cấp để loại nhiễu từ task prediction:

Model
WAVE-CRE98,492,785,2
Không prompt pool96,890,683,4

Prompt pool đem lại +1,8 điểm ở , là evidence trực tiếp nhất cho within-task variation hypothesis. Table 2, PDF tr. 6

Số experts trong mỗi prompt

Authors giữ tổng số selected experts cố định:

Trong đó là số prefix experts nằm trong một prompt, còn là số prompts được chọn cho một input. Vì vậy Table 3 không đơn giản cho cấu hình cuối nhiều capacity hơn; nó giữ tổng số experts được sử dụng tương đương và thay đổi granularity của routing.

Expert/prompt Prompt được chọn TACRED
8184,2
4284,1
2484,0
1885,2

Đọc từng hàng:

Nghĩa là
81Chọn 1 prompt key, rồi lấy nguyên bundle 8 experts đi cùng nhau.
42Chọn 2 prompt keys, mỗi key kéo theo 4 experts.
24Chọn 4 prompt keys, mỗi key kéo theo 2 experts.
18Chọn 8 prompt keys, mỗi expert có key/routing riêng.

Với , router chỉ có một quyết định ở mức bundle:

k1 -> [E1 E2 E3 E4 E5 E6 E7 E8]

Nếu prompt đó được chọn, cả 8 experts đi cùng nhau. Input không thể tự phối hợp một vài experts từ nhiều bundles khác nhau.

Với , mỗi expert nằm trong một prompt riêng:

k1 -> E1
k2 -> E2
k3 -> E3
k4 -> E4
...

Mỗi expert có prompt key riêng, nên query-key mechanism có thể chọn tổ hợp experts mịn hơn cho từng input. Nếu pool thực tế có prompts/experts, chỉ nghĩa là mỗi input chọn Top-8 từ pool, không nghĩa là toàn bộ pool chỉ có 8 experts.

Một cách nhớ:

Kết quả 84.2 -> 84.1 -> 84.0 -> 85.2 ở TACRED ủng hộ giả thuyết của tác giả: lợi ích không chỉ đến từ số experts được dùng, mà từ việc cho phép fine-grained expert routing để thích nghi với within-task variation. Không nên diễn giải mạnh thành “ luôn tốt nhất”; đây là ablation trong task-incremental TACRED của paper, không phải định luật chung cho mọi prompt-pool architecture. Table 3, PDF tr. 7

Task predictor

Trung bình tự tính từ 10 cột của Table 4:

DatasetWAVE-CREHiDe-PromptEPI
FewRel86,1780,0962,67
TACRED79,3172,0162,53

Relation-level predictor cải thiện task inference trung bình, nhưng không thắng mọi task. Trên TACRED, HiDe-Prompt cao hơn WAVE-CRE ở và . Prompt-pool misrouting vì vậy vẫn là failure mode thật, không chỉ là vấn đề đã được giải quyết hoàn toàn. Table 4, PDF tr. 7

Tôi hiểu được gì

  • Freeze old prompt pools chỉ bảo vệ task-specific parameters; nó không bảo vệ shared relation classifier. Vì vậy WAVE-CRE vẫn cần latent replay.
  • Prompt pool làm hai việc khác nhau: pool riêng tạo separation giữa task; routing theo query tạo specialization bên trong task.
  • Task predictor mang tên “task predictor” nhưng thực chất học relation-level logits rồi ánh xạ relation về task. Đây là cách tạo semantic classes ổn định hơn task IDs phụ thuộc thứ tự.
  • “Rehearsal-free” ở paper có nghĩa không lưu raw examples. WAVE-CRE vẫn replay synthetic query/prompted representations và vẫn lưu statistics của quá khứ.
  • Contribution mạnh nhất không phải một loss đơn lẻ mà là decomposition của forgetting theo nơi nó xuất hiện: pool, router và classifier.

Quan hệ với WAVE++

WAVE++ là phần mở rộng trực tiếp của WAVE-CRE. WAVE++ ghi rõ một phần công trình đã xuất hiện trong paper này, rồi giữ lại task-specific prompt pools và Gaussian latent replay nhưng thay đổi hai mảnh quan trọng. WAVE++ PDF, tr. 15

Thành phầnWAVE-CREWAVE++
Prompt poolsTask-specific, query-key routingGiữ lại, phân tích sâu hơn theo sparse-MoE
Semantic anchorKhông dùng label descriptionsThêm label-description contrastive alignment
Task inferenceTrain relation-level MLP predictorCascade voting, không train task predictor riêng
Shared classifierGaussian latent replayGiữ lại và ablate sâu hơn
Trainable parameters3,8M3,5M
Trade-offInference nhanh hơn, predictor có thể driftAccuracy/task inference tốt hơn nhưng inference chậm hơn

Ở , WAVE++ tăng từ 85,0 lên 87,7 trên FewRel và từ 78,7 lên 82,5 trên TACRED, tương ứng +2,7 và +3,8 điểm so với WAVE-CRE. Vì vậy nên đọc WAVE-CRE như nền tảng kiến trúc, còn WAVE++ là bản sửa failure mode task inference và representation discrimination. WAVE++ PDF, tr. 16

Hạn chế và giả định

Paper tự nêu

  • Retaining past-task knowledge vẫn khó; forgetting xuất hiện khi prompt pools không được sử dụng đúng ở testing.
  • Prefix-tuning experts hiện là các offset vectors tương đối đơn giản; capacity còn hạn chế.
  • Gaussian được chọn vì gọn, nhưng alternative generative models có thể mô hình hóa distribution tốt hơn. PDF, tr. 5 PDF, tr. 7

Đánh giá từ evidence

  • Không phải zero-memory: raw text không được lưu, nhưng mỗi relation vẫn có prompt parameters, mean và covariance matrices. Nếu covariance là full matrix, memory có thể tăng theo ; paper không nói rõ diagonalization hoặc shrinkage.
  • Privacy là động cơ, chưa phải kết luận: không có membership-inference test, reconstruction attack hoặc formal privacy guarantee.
  • Single-Gaussian assumption: một Gaussian/relation có thể không mô tả tốt representation đa mode; paper không đánh giá distribution fit.
  • Task boundary/closed world: training biết task hiện tại và relation sets; inference chỉ xét cumulative known relation set. Chưa phải online/open-world CRE có boundary mơ hồ.
  • Evaluation hẹp: chỉ FewRel và TACRED theo một protocol 10-task; chưa kiểm tra domain shift rộng hoặc nhiều task orders.
  • Thiếu uncertainty: tables chỉ báo mean của 5 seeds, không có standard deviation, confidence interval hoặc significance test.
  • Thiếu ablation module replay: không tách riêng tác dụng của , và relation-level predictor.
  • Reproducibility: 9 trang không nêu đầy đủ , , batch size, epochs và random-search space; không thấy code URL.
  • Variance chưa được đo trực tiếp: within-task/cross-task variance được lập luận qua kiến trúc và accuracy ablations, không có metric variance riêng.
  • Ký hiệu routing mơ hồ: argmin/cosine similarity ở Eq. 13-15 cần đối chiếu implementation trước khi tái lập.

Câu hỏi review

  1. CRE khác supervised relation extraction thông thường ở điểm nào?
  2. Vì sao freeze old prompt pools vẫn chưa đủ ngăn catastrophic forgetting?
  3. Task-specific prompt pool đồng thời xử lý cross-task và within-task variance như thế nào?
  4. Prefix tuning được diễn giải như Mixture of Experts ra sao?
  5. Vì sao paper chọn một expert cho mỗi prompt?
  6. Tại sao WAVE-CRE cần hai Gaussian và ?
  7. Task predictor dự đoán task ID trực tiếp hay relation?
  8. Main results chứng minh điều gì và chưa chứng minh điều gì?
  9. Ablation nào hỗ trợ trực tiếp nhất cho prompt-pool hypothesis?
  10. Vì sao gọi WAVE-CRE là rehearsal-free cần thêm điều kiện?
  11. WAVE++ thay đổi failure mode nào của WAVE-CRE?

Gợi ý trả lời câu hỏi review

  1. CRE nhận relation sets tuần tự và phải giữ accuracy trên toàn bộ relation cũ sau mỗi task, thay vì train một lần trên dataset cố định.
  2. Old pools giữ task-specific knowledge, nhưng shared classifier vẫn bị update trên relation mới và có thể dịch decision boundary khỏi relation cũ.
  3. Pool riêng giảm sharing giữa task; query-key routing chọn experts khác nhau cho các vùng dữ liệu khác nhau trong cùng task.
  4. Prefix key/value vectors được xem như các experts mới tham gia attention cùng pre-trained experts.
  5. Mỗi expert có key riêng, route độc lập và không bị buộc đi cùng các experts khác trong một prompt dài.
  6. củng cố task/pool inference; củng cố shared relation classifier.
  7. Predictor xuất logits theo relation trong , sau đó relation dự đoán được ánh xạ về task/pool.
  8. Kết quả cho thấy WAVE-CRE mạnh hơn các rehearsal-free baselines và cạnh tranh với rehearsal-based methods trên hai benchmark; chưa chứng minh privacy, zero-memory hoặc generalization ngoài protocol đó.
  9. Table 2: task-incremental TACRED tăng từ 83,4 lên 85,2 ở khi dùng prompt pool.
  10. Method không giữ raw examples nhưng vẫn sinh và replay latent representations từ per-relation Gaussian statistics.
  11. WAVE++ thêm semantic label descriptions và thay learned task predictor bằng cascade voting; prompt pools và latent replay vẫn là nền tảng kế thừa.

Câu hỏi nghiên cứu tiếp theo

  • Full covariance, diagonal covariance và low-rank covariance đánh đổi memory/accuracy thế nào khi số relation tăng?
  • Mixture of Gaussians, normalizing flow hoặc diffusion latent generator có giảm replay bias so với một Gaussian/relation không?
  • Task-pool routing error đóng góp bao nhiêu vào relation error tổng, và có thể calibrate uncertainty để fallback qua nhiều pools không?
  • WAVE-CRE ổn định thế nào dưới nhiều task orders và khi relation distributions drift theo thời gian?
  • Latent statistics có cho phép reconstruction hoặc membership inference không?
  • Có thể bỏ task boundaries lúc training và phát hiện task/relation mới online không?
  • Đóng góp riêng của query replay, prompted-representation replay và relation-level predictor là bao nhiêu?
  • Within-task variance có thể được đo trực tiếp bằng representation geometry thay vì chỉ suy ra từ accuracy không?
  • Khi backbone được phép thích nghi, cần bảo vệ shared encoder khỏi forgetting bằng cơ chế nào?

Evidence map

Trang PDFEvidence chínhDùng để kết luận
PDF tr. 1Abstract, CRE motivation, bốn hạn chế của prompt-based methodsProblem, gap, đóng góp
PDF tr. 2Figure 1, CRE formulation, MoE và sparse routingObjective tổng quát, background
PDF tr. 3Prefix tuning như experts, ba stage methodology, Eq. 3-12MoE interpretation, pool definition
PDF tr. 4Figure 2, key-query selection, , sparse-MoE scoreData flow, within-task routing, inference
PDF tr. 5Eq. 15-19, Gaussian replay, task predictor, Algorithm 1Losses, training loop, classifier consolidation
PDF tr. 6Datasets, baselines, compute, Table 1-2Protocol, main results, prompt-pool ablation
PDF tr. 7Table 3-4 và conclusionExpert-count ablation, task prediction, limitations
PDF tr. 8References phần đầuNguồn nền về CRE, BERT, prompt tuning, MoE
PDF tr. 9References phần cuốiNguồn nền về continual learning và prompting

Liên kết