Disaster Recovery
Định nghĩa
Disaster Recovery là tập thiết kế, dữ liệu, quy trình và diễn tập để khôi phục service sau sự cố lớn như region failure, data corruption, dependency outage hoặc rollout hỏng.
Cách hiểu bằng lời của tôi
Backup tồn tại chưa đủ. Câu hỏi thực tế là khôi phục mất bao lâu, dữ liệu mất bao nhiêu, ai có quyền thao tác khi control plane đang hỏng, và failover có làm dữ liệu conflict không. Recovery plan chỉ đáng tin khi đã được diễn tập trong điều kiện giống sự cố thật.
Cần kiểm chứng
- RTO: mất bao lâu để service phục hồi.
- RPO: chấp nhận mất bao nhiêu dữ liệu.
- Backup restore speed, không chỉ backup availability.
- Replication lag trước khi failover.
- Break-glass access khi control plane/identity path lỗi.
- Runbook và owner trong incident.
Bài học từ GitHub
Replication không đồng nghĩa backup. Nếu failover sang region có dữ liệu chưa kịp replicate, hệ thống có thể tạo hai phía ghi conflict và cần reconciliation thủ công. Failover drill phải test cả network drop ngắn, replication lag và restore path.