Metric 指标体系建设:Micrometer + Prometheus + Grafana 从接入到告警
引言 线上又出故障了——接口变慢、内存飙高、GC 频繁。但你的反应是: 接口多慢?不知道,没有 QPS 和响应时间监控 内存为啥飙?不知道,没有 JVM 指标 GC 多频繁?不知道,没有 GC 日志采集 没有指标,排障就是"猜"。 本文从零搭建一套完整的指标体系:Micrometer 采集 → Prometheus 存储 → Grafana 可视化 → AlertManager 告警。全实战,附完整配置和仪表盘 JSON。 一、指标体系全景 1.1 为什么需要指标 问题场景需要的指标 接口慢了QPS、响应时间(P50/P95/P99) 内存溢出堆内存、非堆内存、GC 次数 线程耗尽活跃线程数、线程池队列长度 业务异常错误率、订单量、支付成功率 依赖故障DB 连接数、Redis 响应时间 1.2 技术选型 组件作用选型 采集应用内指标暴露Micrometer(Spring Boot 默认) 存储指标拉取和存储Prometheus 可视化仪表盘展示Grafana 告警规则触发通知AlertManager 1.3 数据流 Spring Boot App (Mic....