夜莺最佳实践
夜莺的价值来自统一治理,而非把更多告警搬进同一界面。企业实践需要将指标、规则、Dashboard、权限、OnCall、数据源和变更流程建立成可审计的体系。
1. 企业监控体系设计
分层建设基础设施、平台、应用和业务监控;为每层定义数据源、Dashboard、告警、运行手册和责任团队。Prometheus/Grafana/Alertmanager 与夜莺并存时,明确每类信号的唯一生产告警责任方。
2. 指标管理规范
统一 cluster、environment、team、service、namespace 等标签语义,控制高基数。指标命名、单位、Histogram 桶和采集间隔遵循 Prometheus 规范;新增指标和数据源需评审容量与查询成本。
3. 告警治理规范
告警必须有影响说明、负责人、分级、运行手册和测试证据。通过持续时间、最小流量、分组、静默、根因抑制和事件复盘降低噪声。长期 firing、频繁静默、无人负责和重复规则是治理指标。
4. OnCall 流程规范
维护服务归属、值班组、升级路径、响应目标和复盘模板。Critical 告警需要实时通知和升级,Warning 进入团队处理,Info 不打扰值班。定期演练通知、换班、数据源故障和恢复流程。
5. 多团队协作
平台团队维护公共组件、数据源、权限基线和通知网关;应用团队维护服务规则和 Dashboard;业务团队确认业务指标与影响阈值。所有变更通过 Git/审批/审计记录,避免 UI 中不可追溯的长期修改。
6. 生产经验总结
先治理数据质量和责任边界,再增加看板、规则和机器。持续监控夜莺自身、MySQL、Redis、TSDB、Agent 和通知渠道;定期恢复演练、权限审计、容量评估和版本兼容验证,才能让监控在真正故障时仍可信可用。