ML Platform and Prediction Serving Patterns

Luận điểm chính

Production ML platform là hệ thống vòng lặp, không phải pipeline một chiều. Feature được tạo và phục vụ ở hai thế giới offline/online, model được train/export/deploy liên tục, prediction được log để tạo training data mới, và annotation/quality feedback giữ ground truth không mục.

Pattern chính

Mental model

events + annotations
-> feature pipelines
-> offline store cho training
-> online store/cache cho serving
-> model training/export/deployment
-> prediction serving
-> prediction logs + outcomes
-> monitoring, drift, retraining, annotation feedback

Trade-off cần nhớ

  • Feature store càng dễ dùng thì càng phải có discovery và metadata để tránh duplication.
  • Serving model lớn không chỉ tốn GPU; feature lookup và serialization có thể là chi phí chính.
  • Managed serving giảm onboarding nhưng cần wrapper để giữ contract và standards nội bộ.
  • Annotation nhanh nhưng thiếu quality metric sẽ tạo annotation debt.

Liên kết