Reliability Operations Loop

Ý chính

Reliability không chỉ là thêm retry, replica hay load balancer. Nó là một vòng lặp vận hành: ước lượng capacity, kiểm chứng bằng load test, triển khai theo pha, dùng error budget để quyết định risk, rồi học từ incident bằng postmortem.

Vòng lặp

[[Capacity Planning]]
-> [[Load Testing]]
-> [[Phased Rollout]]
-> [[Error Budget]] guardrail
-> [[Incident Response]]
-> [[Postmortem]]
-> action items + [[Disaster Recovery]] drills
-> cập nhật giả định capacity

Câu hỏi vận hành

  • Giả định capacity nào nếu sai sẽ tạo incident?
  • Load test có mô phỏng đủ production scale và workflow nhiều bước không?
  • Rollout có điểm dừng dựa trên SLI/SLO không?
  • Error budget còn đủ để chấp nhận thay đổi rủi ro không?
  • Backup/restore và failover đã được diễn tập dưới replication lag chưa?
  • Postmortem có action item specific, owned, measurable không?

Liên kết