要建立可靠的监控体系,先定义关键维度:可用性、带宽、并发连接、请求数(RPS)、缓存命中率、边缘延迟、4xx/5xx 错误率和 TLS/握手失败率。采集端采用 Prometheus + Grafana 展示时序指标,日志流用 ELK/ClickHouse 统计,Alertmanager 做告警,外加合成探测(Synthetic)与真实用户监控(RUM)补全体验数据。

优先看播放链路相关指标:首屏时间(startup time)、单片段下载时长、buffer health、播放中断次数与 ABR 切换频率。用 p50/p90/p99 分位分析延迟分布,结合 CDN PoP 时延、丢包率与 BGP/链路异常。对比边缘与回源请求耗时,若边缘正常但回源慢,说明 回源瓶颈;若边缘高延迟或丢包,检查网络与负载均衡。
先查 缓存命中率、回源流量和回源请求数变化曲线,查看是否与配置变更(TTL、Vary、Cache-Control、Cookie、query string)或频繁 清理(purge) 相关。采样边缘日志比对请求路径、请求头与响应头,看是否有不必要的 Cache-Busting 参数。若命中率低但边缘请求高,可能是新内容发布或缓存穿透攻击,需立刻限流/分片回源并优化缓存策略。
建议设定层级化 SLO:可用性(例如 99.9%)、播放可用率、首屏 p90/ p99、重缓/重试率和缓存命中率。告警分为即时高优(突发 5xx 上升、PoP 离线)、趋势中优(连续 30 分钟错误率上升)与低优(缓存命中率缓降)。使用 burn rate 控制 SLO 消耗,加入告警抑制与救援流程,避免告警风暴并确保快速响应路径。
输出结构化日志并保证 request-id 全链路透传,结合采样的分布式追踪(Jaeger/Zipkin)将播放请求在 edge->LB->origin 间串联。通过 trace 找到耗时点(DNS、TCP、TLS、first-byte、segment download),并在日志中聚合异常码和客户端网络信息(ISP、ASN、地理位置)以便快速定位是网络、边缘还是源站问题,最后执行回滚、流量回流或 PoP 隔离作为应急措施。