Observability theo câu hỏi
Hãy phân biệt metric, log, trace và audit event. Một dashboard không tự trả lời root cause; một log không tự tạo alert.
Bài tập
Tạo signal map cho latency/error/API change/dependency/deploy regression. Với mỗi signal ghi threshold, retention, owner, action và runbook. Sau đó loại bỏ một signal noisy để luyện cost/signal quality.
Bài giảng chuyên sâu
Observability phải trả lời câu hỏi vận hành
Metrics cho trend/threshold, logs cho event/detail, traces cho request path, CloudTrail cho API identity/audit. Alarm cần threshold, window, owner, action và runbook; dashboard không tự tạo response. Giới hạn retention, sampling và cardinality để tránh noise/cost.
Bài tập: tạo signal map cho latency, error, API change, dependency timeout, deploy regression và user impact. Failure drill: alarm không gửi, metric thiếu dimension và log chứa secret; ghi expected evidence, remediation và retention.