跳到主要内容

夜莺告警与通知治理

夜莺告警规则由数据源、表达式、评估频率、持续时间、级别、标签和通知对象组成。先定义用户影响和处置动作,再编写阈值;图表上有波动不等于需要呼叫值班。

1. 告警规则​

# node-exporter 连续不可达的条件
up{job="node-exporter", environment="production"} == 0

规则应设置合理评估周期和持续时间,包含 severity、team、service、cluster、environment 标签,以及运行手册和 Dashboard 链接。错误率规则需考虑最小流量,避免一次失败请求造成误报。

2. 通知渠道​

Email 适合非紧急事件,企业微信/钉钉/飞书适合协作,Webhook/OnCall 平台适合升级。渠道密钥由 Secret 或通知网关管理,不写入规则或 Dashboard。每个渠道定期演练 firing 与恢复通知。

3. 告警治理​

按 Critical、Warning、Info 统一分级。使用持续时间、分组、静默、根因抑制和测试/生产隔离降低噪声。若 Prometheus + Alertmanager 已对同一信号生产通知,夜莺不应重复发送给同一值班渠道。

定期审查长期 firing、频繁静默、无人负责、路由失败和重复规则。告警质量的标准是可行动、可验证、可追溯。