跳到主要内容

Grafana 故障排查

排查 Grafana 时先区分前端、Grafana Server、数据库、认证、数据源和插件。页面打不开、面板无数据和用户无权限往往来自不同层,不能只靠重启 Pod 或容器处理。

1. Grafana 无法启动​

检查服务日志、端口占用、配置语法、数据目录权限、数据库连接和插件加载。容器环境先看 docker compose logs grafana 或 Pod 日志;Kubernetes 再检查 Secret、ConfigMap、PVC、探针和资源限制。

2. 数据源连接失败​

在 Grafana 数据源页面执行 Save & test,并从 Grafana 所在网络验证 DNS、TLS、认证和目标端口。确认数据源 URL 不是仅浏览器本机可访问的地址,且数据源服务账号具有最小但足够的查询权限。

3. Dashboard 无数据​

  1. 在 Explore 中执行 Panel 的原始查询。
  2. 检查时间范围、数据源 UID、变量默认值和变量展开结果。
  3. 去掉标签过滤,确认指标名、标签键和值是否变更。
  4. 检查 Prometheus Targets、Loki/Elasticsearch 数据写入与保留期。
  5. 检查用户对 Folder、数据源和环境的访问范围。

4. 查询慢​

使用 Query Inspector 查看实际请求、时间范围与响应耗时。先缩小范围、限制变量、减少首屏 Panel、增加 Recording Rule,再检查数据源自身的慢查询、并发和索引。不要仅通过增加 Grafana 副本掩盖 PromQL 或 LogQL 的高成本问题。

5. 用户无法登录​

检查 root_url、反向代理 Header、TLS、OIDC 回调地址、时间同步、群组映射和 Cookie 域。认证变更应保留受控的紧急管理员恢复路径,并在恢复后审计与轮换凭据。

6. 插件异常​

检查插件版本是否兼容当前 Grafana、镜像是否包含插件、配置是否在所有副本同步、浏览器控制台是否有渲染错误。升级失败时按经过验证的镜像和 Dashboard 回滚,不在生产实例临时替换插件文件。