Case operating loop
Dùng loop impact → hypothesis → evidence → mitigation → verify → root cause → follow-up. Bắt đầu từ user/API impact và dependency path; phân biệt symptom (latency/5xx), control (health check/autoscaler/IAM) và resource (VM/service/database).
Ticket rubric
Mỗi ticket phải có severity, evidence, action owner, rollback và success criteria. Ví dụ backend unhealthy cần health/path/firewall evidence; DB connection issue cần pool/metric/log; log cost surge cần filter/retention/cardinality; bad deploy cần revision/traffic.
Bài tập
Hoàn thành 8 ticket timed, viết timeline và architecture decision record. Pass khi actions an toàn, có evidence đo được, recovery được chứng minh và follow-up không còn ownerless.