跳到主要内容

夜莺故障排查

排查夜莺需要区分 UI/API、规则引擎、MySQL、Redis、数据源和通知渠道。页面可访问只说明部分服务正常,不能证明规则评估和通知闭环可用。

1. 服务无法启动​

检查容器或 systemd 日志、配置文件、Secret、端口、数据库/Redis 连通性和迁移状态。组件名称、端口和健康检查以当前版本为准;升级失败时按验证过的版本和数据库回滚方案处理。

2. 数据源无数据​

从夜莺所在网络对数据源执行同一条 PromQL,检查 DNS、TLS、认证、租户参数、NetworkPolicy 和后端查询延迟。再检查采集端、Prometheus Targets、标签过滤和数据保留期。

3. 告警无法触发​

确认表达式返回数据并满足条件,检查规则启用、评估周期、持续时间、数据源与时间窗口。验证规则引擎心跳、标签、通知组和静默/抑制,不要仅修改阈值。

4. 通知发送失败​

检查路由、接收器、Webhook/SMTP/IM 认证、网络超时、通知网关日志和测试环境隔离。验证 firing 和 resolved 两种状态;接收器可用不代表已正确映射到当前值班人。

5. 查询性能与数据库异常​

慢查询先缩小时间范围、标签和变量,检查后端时序库而不是只扩容 Web。MySQL/Redis 异常检查连接、慢查询、复制/主从、磁盘、内存和备份状态。不要在生产中临时改表结构或清空缓存。