← 返回文章列表
更新日志 3 分钟阅读 炬鲸团队

炬鲸 OBSERVE v2.4 发布:告警静默窗口与追踪采样增强

v2.4 带来告警静默窗口与抑制规则、尾采样和按规则采样、日志检索性能优化三大更新。本文说明新功能用法与升级步骤,并提醒尾采样对写入量的影响。

v2.4 主要带来三块更新:告警静默窗口与抑制规则、追踪采样策略增强、日志检索性能优化。这版主要回应了两个高频反馈——发版期间告警太吵、长尾错误链路总被采样漏掉。下面是详细说明。

告警静默窗口

以前每到发版窗口,值班同事都要手动关闭一批告警,发完再手动恢复,漏开漏关是常事。v2.4 新增静默窗口(Silence Window),支持按时间范围、按标签批量静默:

silence:
  - name: "每周发版窗口"
    schedule: "0 2 * * 4"     # 每周四 02:00
    duration: 2h
    matchers:
      - env: "staging"
      - severity: "warning"

静默窗口支持 cron 式排期和标签匹配,既能覆盖"每周四发版",也能覆盖"所有 env=staging 的告警",不用逐条改告警规则。配合抑制规则(Inhibition),同一根因的告警只发第一条,下游告警自动抑制,值班页终于清爽了。

追踪采样增强

  • 尾采样:默认头采样会漏掉"延迟高、最终报错"的长尾请求。v2.4 支持尾采样,在 span 结束后根据耗时和错误决定是否保留,长尾错误一个不漏。
  • 按规则采样:支持按服务、按 API 路径单独配置采样率,核心接口 100%、边缘接口 1%,兼顾覆盖与成本。
  • 采样决策可视化:链路详情页显示每跳是否被采样、因何规则保留,排查"为什么这条链路不见了"不再靠猜。

日志检索性能优化

高频 GROUP BY 查询的响应时间整体下降约 40%。改动包括:为大时间范围聚合引入预聚合缓存、对高基数字段(如 uri、user_id)使用倒排索引分片、以及冷热查询自动路由——热数据走内存、冷数据走对象存储,用户无感知。如果你的检索一直偏慢,升级后建议重建一次索引让优化生效。

升级说明

升级前先备份元数据,再执行:

./bin/observe migrate --from=2.3.x --to=2.4.0
./bin/observe start

迁移对 2.3.x 数据向后兼容,建议先在预发环境验证再上生产。注意:尾采样开启后存储写入量会上升,建议先在单个服务上灰度观察一周,再逐步放量。完整变更见官方文档的 Release Notes。