DR bắt đầu từ RTO/RPO
RTO nói cần phục hồi trong bao lâu; RPO nói được phép mất bao nhiêu dữ liệu. Backup/restore, pilot light, warm standby và multi-site là các điểm khác nhau trên cost/recovery spectrum.
Bài tập
Chọn strategy cho batch, production API và regulated order system. Viết runbook phục hồi và nêu điều gì phải test: restore, data consistency, DNS, secret, permission và application validation.
Bài giảng chuyên sâu
DR là bài toán RTO/RPO và runbook
Backup/restore có cost thấp hơn nhưng RTO dài; pilot light giữ phần lõi sẵn sàng; warm standby giảm thời gian chuyển; multi-site/active-active có RTO thấp nhưng replication và vận hành phức tạp. Không thể chọn strategy trước khi biết downtime và data loss cho phép.
Runbook phải có detect, declare, restore/promote, secrets, permissions, DNS/traffic switch, validation, rollback và owner. Multi-Region còn phải xử lý replication lag, image/config parity và quota. Snapshot tồn tại không chứng minh restore chạy được.
Bài tập: chọn strategy cho batch, production API và regulated order. Failure drill: region chính mất, replica lag và DNS cache chưa hết TTL; ghi expected state, RTO/RPO evidence và test định kỳ.