Grafana 简介
Grafana 是面向指标、日志、追踪与业务数据的可视化和分析平台。它连接多个数据源,提供 Dashboard、Explore、变量、告警、注释和权限管理,让值班与业务团队能从同一入口理解系统状态。
1. Grafana 解决的问题
监控数据通常散落在 Prometheus、Loki、Elasticsearch、数据库和云平台中。Grafana 将查询、可视化和团队协作统一起来,帮助用户快速回答“是否有影响”“影响范围是什么”“从哪里继续排查”。
Grafana 不负责采集或长期存储大规模指标。Prometheus、Loki、Elasticsearch 等数据源仍承担数据采集、保留、查询权限和容量治理;Grafana 是受控查询入口,而不是数据隔离边界。
2. Grafana 在监控体系中的位置
Prometheus / Loki / Elasticsearch / MySQL / Trace Backend
|
v
Grafana
Dashboard / Explore / Alerting
|
值班与业务团队
典型场景包括基础设施趋势、服务 RED 指标、Kubernetes 集群视图、日志关联、业务运营看板和 NOC 大屏。紧急告警应有明确的规则归属,避免 Grafana Alerting 与 Prometheus Rule 重复通知同一故障。
3. Grafana 核心概念
| 概念 | 含义 | 示例 |
|---|---|---|
| Data Source | 查询数据的连接定义 | Prometheus、Loki、Elasticsearch |
| Dashboard | 面向一个场景的一组面板 | Kubernetes 集群概览 |
| Panel | 单个图表、表格或数值组件 | CPU 使用率趋势 |
| Query | Panel 向数据源发送的查询 | PromQL、LogQL、SQL |
| Variable | 用于动态筛选的模板变量 | cluster、namespace |
| Annotation | 在时间轴上标记发布、故障或维护事件 | 发布版本 v1.8.0 |
Dashboard 应服务于明确的读者和处置路径。概览回答影响,服务详情回答范围,排障页提供变量、日志和追踪下钻。
4. Grafana 生态
- Prometheus:指标查询与告警信号,详见 Prometheus 文档。
- Loki:标签化日志查询,适合从异常指标下钻到日志。
- Elasticsearch:日志搜索与聚合,注意索引与查询成本。
- MySQL / PostgreSQL:业务报表与运营数据,可视化前应控制查询权限。
- OpenTelemetry / Tempo / Jaeger:分布式追踪,用于定位单次请求路径。