从 0 搭建可观测性体系:架构总览与工具选型——为什么选 OpenTelemetry + Grafana 全家桶
引言 你是否遇到过这些场景: 线上出了问题,看日志发现关键信息没打,只能加日志重新发版 一个请求经过 5 个微服务,排查时要在 5 个系统的日志之间来回跳 监控大盘倒是有一堆,但没有人说得清哪个指标代表什么意思 团队用了 3 种 APM 工具,每年光 License 费就十几万 这些问题的根源都是同一个:没有统一的可观测性体系。 本系列将带你从 0 开始搭建一套完整的可观测性体系,这是第 1 期,先搞清楚架构和选型。 一、什么是可观测性 1.1 监控 ≠ 可观测性 监控(Monitoring):告诉你系统出了什么问题 可观测性(Observability):让你能搞清楚为什么出问题 监控是"已知未知"——你知道要监控什么(CPU、内存、QPS),设置阈值告警。可观测性是"未知未知"——你不知道问题会在哪里发生,但系统提供足够的信息让你能排查。 1.2 可观测性三支柱 ┌─────────────────────────┐ │ 可观测性 Observability │ └────────────┬────────────┘ ┌────────────────────┼──────....