Đọc ngày 2026-08-04

Kế hoạch hôm nay

Mục tiêu cần hiểu

  • Hiểu quantization giảm độ chính xác số học để tăng tốc và giảm kích thước model.
  • Phân biệt dynamic quantization và quantization-aware training ở mức ý tưởng.
  • Nắm ONNX Runtime tối ưu inference bằng graph optimization và runtime riêng.
  • Biết cách đọc trade-off giữa size, latency và accuracy sau mỗi kỹ thuật tối ưu.

Câu hỏi dẫn đường

  • Distillation giảm model bằng cách nào?
  • Quantization và ONNX giúp inference ra sao?
  • Khi tối ưu production, tôi sẽ chọn kỹ thuật nào trước?

Ghi chú trong khi đọc

Viết lại bằng lời của tôi

Điều chưa rõ

Việc cần làm