Inference Compute Graph Split

Định nghĩa

Inference Compute Graph Split là kỹ thuật export model thành các phần chạy trên phần cứng khác nhau, ví dụ embedding lookup/feature parsing trên CPU và dense matrix computation trên GPU.

Cách hiểu bằng lời của tôi

Recommendation model có hai dạng chi phí khác nhau: embedding table ăn memory, dense layer ăn compute. Đặt tất cả lên GPU hoặc CPU đều lãng phí. Snap split graph lúc export để mỗi phần chạy ở nơi hợp lý hơn.

Liên kết