Lộ trình
Microsoft AzureCơ bảnTuần 3: Kiến trúc & bảo mậtBài 20 / 30

Ngày 20: Monitoring cơ bản

Thời lượng: 45 phút
Mục tiêu: 2 nhiệm vụ chính
Tiến độ lộ trình
az-900ngày 20
hoàn thành20 / 30 bài
Bối cảnh bài học

Thiết kế observability cơ bản với Azure Monitor, Log Analytics, Service Health và Advisor; phân biệt telemetry, incident signal và recommendation.

đọc hiểuthực hànhcheckpoint
Bài giảng hôm nay

Học hiểu, rồi mới thực hành

Thiết kế observability cơ bản với Azure Monitor, Log Analytics, Service Health và Advisor; phân biệt telemetry, incident signal và recommendation.

Bắt đầu đọc bài giảng

Nhiệm vụ bài học hôm nay

  • Tìm hiểu Azure Monitor, Log Analytics, Service Health
  • Xem qua Azure Advisor để tối ưu tài nguyên
Instructor walkthrough

Bài giảng chi tiết: từ bài toán đến bằng chứng

Scenario xuyên suốt

API chậm nhưng team chỉ nhìn CPU; một Azure outage ảnh hưởng region nhưng app team không biết; Advisor có recommendation nhưng không ai chịu action. Bài học nối signal với owner, threshold, retention và runbook.

01Đọc bài toán

Xác định actor, workload, constraint và trạng thái cuối cần đạt.

02Vẽ luồng / boundary

Chỉ ra request, dependency, identity và failure domain trước khi chọn công cụ.

03Chọn và thực hành

Thay đổi nhỏ nhất trong lab cô lập; command nào cũng phải nói rõ nó kiểm tra điều gì.

04Kiểm chứng / recovery

Đối chiếu trạng thái thực tế, tạo một failure variant và ghi cách hoàn tác.

Cách nối lý thuyết với thực tế
  • Azure Monitor là umbrella cho metrics/logs/alerts/insights; signal phải gắn với question/action.
  • Log Analytics workspace truy vấn logs bằng KQL; workspace boundary/retention/access/cost cần thiết kế.
  • Service Health báo incident/planned maintenance/health issue liên quan subscription/service/region; khác application telemetry.
  • Azure Advisor đưa recommendation về reliability/security/performance/cost; recommendation không tự chứng minh root cause.

Observability bắt đầu bằng câu hỏi

“API có healthy không?” cần availability/latency/error metric. “Request chậm ở dependency nào?” cần trace/log. “Azure có incident khu vực không?” cần Service Health. “Có tối ưu resource nào không?” có thể xem Advisor. Mỗi signal phải trả lời một câu hỏi và dẫn tới action.

Log Analytics và KQL

Workspace là boundary truy vấn/access/retention/cost. Log cần schema, timestamp, correlation ID, severity và redaction; không log token/password/PII tùy tiện. Query phải có time range và scope để tránh noise/cost.

Alert/runbook

Alert record = signal/query + threshold/window + severity + owner + action + suppression + runbook. Alert quá nhạy tạo fatigue; alert thiếu dependency/health signal tạo blind spot.

Bài tập

Tạo signal map cho API và viết ba alert/runbook. So sánh một Azure Service Health incident, một app error và một Advisor recommendation; ghi evidence, owner và remediation validation.

Terminal reference

Command list và cách dùng

Chạy từng lệnh theo đúng thứ tự. Trước các lệnh có thể tạo hoặc thay đổi tài nguyên, hãy kiểm tra profile, account và region.

Commands · read-only checkpoints
az account show --output table
az account list --output table
az group list --output table
Hands-on lab

Thực hành theo scenario

  1. Tạo signal map cho API: availability, latency, error rate, dependency, deployment regression và cost anomaly.
  2. Viết alert record gồm signal/query, threshold, window, severity, owner, action, suppression và runbook link.
  3. Dùng sample KQL/log schema hoặc portal read-only để tạo query; không gửi PII/secret vào logs.
  4. So sánh incident Service Health với application incident và Advisor recommendation; ghi action/evidence cho từng loại.
Evidence checkpoint

Kiểm chứng kết quả

Không coi lệnh chạy thành công là đủ. Hãy đối chiếu output với trạng thái mong đợi:

  • Chọn metric/log/trace/Service Health/Advisor theo question.
  • Alert có threshold/window/owner/action, không chỉ tên.
  • KQL/query có scope/retention/privacy/cost consideration.
  • Phân biệt provider incident và application incident.
  • Recommendation có validation trước remediation.
Transfer to exam / production

Bẫy thường gặp và trade-off

Azure Monitor là telemetry/alert umbrella; Service Health nói tình trạng Azure liên quan resource/subscription; Advisor đưa guidance. Đừng dùng Advisor/Service Health thay application monitoring.

Checkpoint · 3 phút

Kiểm tra nhanh

Câu hỏi: Cần truy vấn logs tập trung bằng KQL để điều tra error theo correlation ID. Thành phần nào phù hợp nhất?

Kết thúc bài

Checklist trước khi sang Ngày 2