Lộ trình
Cloud Native Computing FoundationAssociateTuần 3: Kiến trúc & bảo mậtBài 17 / 30

Ngày 17: NetworkPolicy

Thời lượng: 45 phút
Mục tiêu: 2 nhiệm vụ chính
Tiến độ lộ trình
ckangày 17
hoàn thành17 / 30 bài
Bối cảnh bài học

Troubleshoot cluster Kubernetes theo triage loop: scope/impact, control-plane/node/workload/network/storage evidence, remediation và rollback.

đọc hiểuthực hànhcheckpoint
Bài giảng hôm nay

Học hiểu, rồi mới thực hành

Troubleshoot cluster Kubernetes theo triage loop: scope/impact, control-plane/node/workload/network/storage evidence, remediation và rollback.

Bắt đầu đọc bài giảng

Nhiệm vụ bài học hôm nay

  • Học cách NetworkPolicy kiểm soát traffic giữa Pod
  • Thực hành chặn traffic giữa 2 namespace
Instructor walkthrough

Bài giảng chi tiết: từ bài toán đến bằng chứng

Scenario xuyên suốt

Một cluster có Pod Pending, node NotReady, Service timeout và PVC Pending cùng lúc; người học sửa từng triệu chứng bằng restart/xóa mà không biết dependency hay ưu tiên. Bài học xây incident method có thể lặp lại trong CKA.

01Đọc bài toán

Xác định actor, workload, constraint và trạng thái cuối cần đạt.

02Vẽ luồng / boundary

Chỉ ra request, dependency, identity và failure domain trước khi chọn công cụ.

03Chọn và thực hành

Thay đổi nhỏ nhất trong lab cô lập; command nào cũng phải nói rõ nó kiểm tra điều gì.

04Kiểm chứng / recovery

Đối chiếu trạng thái thực tế, tạo một failure variant và ghi cách hoàn tác.

Cách nối lý thuyết với thực tế
  • Triage bắt đầu bằng context/impact/scope: toàn cluster, node, namespace, workload hay request path; preserve evidence trước mutation.
  • Control-plane/API, scheduler, kubelet/runtime, CNI/service, storage/provisioner và application có symptom/evidence riêng.
  • Read-only evidence gồm get/describe/events/logs/conditions/version/endpoints/PVC; mutation phải nhỏ, reversible và có expected outcome.
  • Hypothesis tree và timeline tránh random restart; remediation phải xử lý dependency/root cause và kiểm tra side effect.

Triage loop

Dùng context → scope/impact → hypothesis → read-only evidence → minimal remediation → verify → rollback/follow-up. Một Pod Pending và PVC Pending có thể liên quan scheduling/storage, nhưng không được suy luận trước evidence.

Failure matrix

  • API/control plane: cluster-info/version/events.
  • Node/runtime: conditions, describe node, kubelet/runtime signal.
  • Scheduling/workload: describe Pod/events/logs.
  • Network: Service/EndpointSlice/DNS/policy/path.
  • Storage: PVC/PV/StorageClass/events/mount.

Bài tập

Làm sáu drill timed, ghi timeline và incident worksheet. Pass khi chọn được command đầu tiên có giá trị, không dùng destructive reset, và chứng minh recovery bằng state/health evidence.

Terminal reference

Command list và cách dùng

Chạy từng lệnh theo đúng thứ tự. Trước các lệnh có thể tạo hoặc thay đổi tài nguyên, hãy kiểm tra profile, account và region.

Commands · read-only checkpoints
kubectl cluster-info
kubectl get nodes -o wide
kubectl get pods -A -o wide
kubectl get events -A --sort-by=.lastTimestamp
kubectl get svc,endpointslice,pvc -A -o wide
Hands-on lab

Thực hành theo scenario

  1. Tạo troubleshooting worksheet với scope/impact/symptom/hypothesis/evidence/next action/rollback/owner/timestamp.
  2. Làm 6 failure drills: Pending scheduling, CrashLoop, Node NotReady, Service no endpoint, NetworkPolicy deny và PVC Pending; dùng lab/read-only fixtures.
  3. Mỗi drill thu tối thiểu get/describe/events/logs/conditions phù hợp, ghi expected state rồi remediation tối thiểu.
  4. Kết thúc bằng recovery verification, incident timeline và cleanup marker/resources; không restart/delete control-plane production.
Evidence checkpoint

Kiểm chứng kết quả

Không coi lệnh chạy thành công là đủ. Hãy đối chiếu output với trạng thái mong đợi:

  • Scope/impact được xác định trước mutation.
  • 6 failure drills có evidence/root cause.
  • Remediation/rollback có expected outcome.
  • Recovery và side effects được kiểm tra.
  • Timeline/owner/cleanup/follow-up đầy đủ.
Transfer to exam / production

Bẫy thường gặp và trade-off

CKA troubleshooting được chấm bằng state thực tế. Đừng chạy lệnh chữa cháy trước khi đọc events/conditions; xác nhận context và target mỗi lần chuyển namespace/node.

Checkpoint · 3 phút

Kiểm tra nhanh

Câu hỏi: Cluster có nhiều symptom cùng lúc. Bước đầu tiên an toàn nhất là gì?

Kết thúc bài

Checklist trước khi sang Ngày 2