Prometheus 内存占用爆炸——metric 标签滥用血案
一、引言 监控系统突然告警:Prometheus 内存占用超过 30GB,还在持续上涨。 排查结果:500 万个活跃时间序列,根因是错误地把 userId、orderId 作为 Prometheus label,导致每个用户/订单产生独立的时间序列。 修复后:内存从 30GB+ 降至 4GB。 二、事件回顾 2.1 告警触发 监控告警: ┌─────────────────────────────────────────────────────┐ │ │ │ 告警名称:Prometheus 内存使用率过高 │ │ 触发时间:2024-01-15 02:30:00 │ │ 当前值:32GB / 64GB (50%) │ │ 阈值:> 80% │ │ 趋势:持续上涨 │ │ │ └─────────────────────────────────────────────────────┘ 2.2 紧急处理 # 查看 Prometheus 状态 curl http://localhost:9090/api/v1/status/config # 查看当前时间序列数 curl http....