Visual LabINTERACTIVE LEARNING
06 · SAAS OPERATIONSP115 MIN

Sentry、Trace、Metrics 与 Alert

用错误、日志、链路和指标从外部输出推断线上系统内部状态。

MENTAL MODELOBSERVABILITY
01User Error
02Sentry Event
03Trace Spans
04Metrics Change
05Actionable Alert
Logs 讲具体事件,Metrics 讲总体趋势,Traces 讲一次请求经过哪里,Sentry 聚合异常上下文,Alert 负责叫醒正确的人。
01 · CONCEPTS & BOUNDARIES

先把概念与边界说清楚

定义告诉你它是什么,边界告诉你它不负责什么;企业系统最常见的误解通常发生在两者混用时。

01

Sentry / Error Monitoring

聚合异常、堆栈、版本、用户影响与面包屑,帮助发现和定位错误。

02

Trace ID / Distributed Trace

标识一次请求并连接前端、API、数据库和第三方 span。

03

API Metrics

统计请求量、错误率、延迟、饱和度和业务结果,常按端点与区域分组。

04

Alert

当用户影响或系统风险超过阈值时通知负责人,并附带可行动上下文。

05

Performance Monitoring

持续观察页面体验、API 长尾、数据库与依赖性能。

02 · BLIND BOTS CASE

新版本让 Quote 页面白屏

问题现场

客服先收到投诉,开发无法知道影响版本和浏览器。

  1. 01

    前端 Sentry 绑定 release 与 source maps。

  2. 02

    事件关联 user/tenant 的非敏感标识和 trace_id。

  3. 03

    按错误用户数与版本回归率告警。

得到什么

几分钟内定位到特定版本的解析错误并回滚,而不是等待更多截图。

03 · PRACTICE

马上动手

  1. 为 create order 设计 RED 指标。
  2. 写一个有阈值、窗口和负责人告警。
04 · PITFALLS

常见坑

  • 日志、Trace、Metrics 各自无共同 ID
  • Alert 只说 error rate high
  • 把客户邮箱作为 metrics label
05 · KNOWLEDGE CHECK如何定位线上 Bug?查看答案⌄
答案

先确认影响版本、用户和时间,再从错误聚合进入关联 Trace、结构化日志和指标,对照发布变化,复现并用修复后指标验证。