Từ signal đến action
Observability tốt bắt đầu từ user impact/SLO: availability, latency, error rate, saturation và dependency. Metric trả lời “bao nhiêu/bao lâu”; log trả lời “event nào”; trace trả lời “request đi qua đâu”. Audit log trả lời “ai thay đổi gì”. Chọn signal theo câu hỏi, không theo số lượng dashboard.
Alert và incident evidence
Alert cần condition, window, severity, owner, notification và runbook. Log structured giúp query nhưng phải loại secret/PII, giới hạn cardinality và đặt retention/sink theo cost. Trong incident ghi timeline, change correlation, evidence, mitigation, rollback và follow-up.
Bài tập
Tạo signal map và drill năm failure scenarios. Inspect policy/log metadata read-only, viết alert/runbook và checklist cleanup. Pass khi người khác có thể dùng evidence để nhận biết impact và hành động mà không cần đoán.