Reliability Operations Loop
Ý chính
Reliability không chỉ là thêm retry, replica hay load balancer. Nó là một vòng lặp vận hành: ước lượng capacity, kiểm chứng bằng load test, triển khai theo pha, dùng error budget để quyết định risk, rồi học từ incident bằng postmortem.
Vòng lặp
[[Capacity Planning]]
-> [[Load Testing]]
-> [[Phased Rollout]]
-> [[Error Budget]] guardrail
-> [[Incident Response]]
-> [[Postmortem]]
-> action items + [[Disaster Recovery]] drills
-> cập nhật giả định capacityCâu hỏi vận hành
- Giả định capacity nào nếu sai sẽ tạo incident?
- Load test có mô phỏng đủ production scale và workflow nhiều bước không?
- Rollout có điểm dừng dựa trên SLI/SLO không?
- Error budget còn đủ để chấp nhận thay đổi rủi ro không?
- Backup/restore và failover đã được diễn tập dưới replication lag chưa?
- Postmortem có action item specific, owned, measurable không?