Node troubleshooting theo lớp
Bắt đầu từ API view: node phase/conditions, reason/message, taints, allocatable/capacity và events. Sau đó xem Pod trên node, kube-system, kubelet/runtime/CNI và resource pressure.
| Signal | Hypothesis cần kiểm tra | Evidence |
|---|---|---|
| Ready=False/Unknown | kubelet heartbeat, service, certificate/time | describe node, conditions, kubelet logs |
| Disk/Memory/PIDPressure | filesystem/inode, eviction, capacity | conditions, events, host metrics/logs |
| runtime errors | CRI/socket/image/sandbox | system Pod/events/runtime logs |
| network errors | CNI/route/IPAM/kube-proxy | CNI Pod/logs, Pod events, request path |
Containment và recovery
Cordon trước khi điều tra dài nếu cần ngăn workload mới. Drain chỉ sau khi kiểm tra replicas, PDB, DaemonSet, local data và capacity; không dùng force như cách xóa symptom. Sau remediation: node Ready, không còn pressure, system Pods healthy, workload rescheduled/Available, rồi uncordon và ghi proof.