告警体系搭建:AlertManager + 钉钉/企微通知 + 告警降噪——拒绝告警疲劳
引言 凌晨 3 点,值班手机第 137 次震动。迷迷糊糊划开一看,还是那条「磁盘使用率超过 80%」——同一块盘,Prometheus 每 30 秒评估一次,没人处理就一直报。 第二天早上复盘,最讽刺的一幕来了:真正的大故障恰恰发生在凌晨 4 点,一条 P0「订单服务全部实例下线」,被 137 条 P2 的重复轰炸彻底淹没。值班同学后来承认:"我把告警群设成免打扰了,反正是磁盘告警。" 这不是个例。我们统计了自己环境的 30 天告警数据,结果触目惊心: 指标数值 日均告警条数24,187 条 单人单夜被通知次数平均 9.2 次 有效告警占比(需要人介入的)2.7% P0 告警平均响应时间11 分钟(且漏报 2 次/月) 97% 的告警是噪音。而噪音的代价不是"烦",是把真正致命的告警稀释掉——这就是告警疲劳(Alert Fatigue)。 这篇文章把我们从 2.4 万条/天优化到 362 条/天的完整方案讲一遍,覆盖四块内容: 告警分级设计:P0(服务挂了)→ P1(P99 > 1s)→ P2(磁盘 > 80%),不同级别不同响应策略 AlertManager....