跳到主要内容

夜莺 Kubernetes 监控

夜莺通常查询由 Prometheus Operator、kube-state-metrics、node exporter 和应用指标提供的 Kubernetes 数据。先确保采集、标签和数据源可靠,再在夜莺中创建 Dashboard 与告警。

1. 监控接入​

数据源使用 Prometheus 或 VictoriaMetrics,指标至少包含 cluster、namespace、workload、pod 和团队标签。不要直接将跨集群、跨环境的同名 Pod 混入同一查询。

2. 分层视图​

Cluster 关注控制面、容量和节点健康;Namespace 关注资源配额与团队消耗;Workload 关注期望/就绪副本、发布和 HPA;Pod 关注重启、Pending、OOM、探针和容器资源。

3. Kubernetes 告警实践​

Node NotReady、磁盘压力、Pod CrashLoop、Deployment 副本不足、PVC 容量风险和 API Server/etcd 异常是常见基线。根因告警优先路由给平台团队,症状告警结合标签分组与抑制,避免故障风暴。

Prometheus 采集与 ServiceMonitor/PodMonitor 见 Prometheus Kubernetes 监控。