06 · SAAS OPERATIONSP115 MIN
Sentry、Trace、Metrics 与 Alert
用错误、日志、链路和指标从外部输出推断线上系统内部状态。
MENTAL MODELOBSERVABILITY
01User Error
→02Sentry Event
→03Trace Spans
→04Metrics Change
→05Actionable Alert
先把概念与边界说清楚
定义告诉你它是什么,边界告诉你它不负责什么;企业系统最常见的误解通常发生在两者混用时。
Sentry / Error Monitoring
聚合异常、堆栈、版本、用户影响与面包屑,帮助发现和定位错误。
Trace ID / Distributed Trace
标识一次请求并连接前端、API、数据库和第三方 span。
API Metrics
统计请求量、错误率、延迟、饱和度和业务结果,常按端点与区域分组。
Alert
当用户影响或系统风险超过阈值时通知负责人,并附带可行动上下文。
Performance Monitoring
持续观察页面体验、API 长尾、数据库与依赖性能。
新版本让 Quote 页面白屏
客服先收到投诉,开发无法知道影响版本和浏览器。
- 01
前端 Sentry 绑定 release 与 source maps。
- 02
事件关联 user/tenant 的非敏感标识和 trace_id。
- 03
按错误用户数与版本回归率告警。
几分钟内定位到特定版本的解析错误并回滚,而不是等待更多截图。
马上动手
- 为 create order 设计 RED 指标。
- 写一个有阈值、窗口和负责人告警。
常见坑
- 日志、Trace、Metrics 各自无共同 ID
- Alert 只说 error rate high
- 把客户邮箱作为 metrics label
05 · KNOWLEDGE CHECK如何定位线上 Bug?查看答案⌄
答案
先确认影响版本、用户和时间,再从错误聚合进入关联 Trace、结构化日志和指标,对照发布变化,复现并用修复后指标验证。