Đọc ngày 2026-08-04
Kế hoạch hôm nay
Mục tiêu cần hiểu
- Hiểu quantization giảm độ chính xác số học để tăng tốc và giảm kích thước model.
- Phân biệt dynamic quantization và quantization-aware training ở mức ý tưởng.
- Nắm ONNX Runtime tối ưu inference bằng graph optimization và runtime riêng.
- Biết cách đọc trade-off giữa size, latency và accuracy sau mỗi kỹ thuật tối ưu.
Câu hỏi dẫn đường
- Distillation giảm model bằng cách nào?
- Quantization và ONNX giúp inference ra sao?
- Khi tối ưu production, tôi sẽ chọn kỹ thuật nào trước?
Ghi chú trong khi đọc
Viết lại bằng lời của tôi
Điều chưa rõ
Việc cần làm