← 返回文章列表
更新日志 4 分钟阅读 炬鲸团队

v1.5.0 更新:告警聚合降噪、日志上下文与指标下钻

炬鲸 OBSERVE v1.5.0 发布:告警引擎支持聚合、抑制与静默;日志检索新增上下文跳转与 trace_id 反查;指标面板支持下钻到日志与链路;链路追踪加入可配置采样。附升级说明与兼容性提醒。

这次更新主要解决两件一直被吐槽的事:告警太吵,以及排查时要在日志、指标、链路三个页面之间来回切。告警引擎重写后,同类告警默认合并、根因告警自动压住下游噪声;日志上下文和指标下钻则把"看到异常"到"找到原因"的距离缩短到一次点击。下面的改动都是围绕这两点展开的。

告警引擎:聚合、抑制、静默

v1.5.0 重写了告警引擎的通知链路。新增三项能力:

  • 聚合:按 group_by 维度把同源告警合并为一条通知,附带聚合计数,30 秒窗口内同类告警只触发一次;
  • 抑制:配置源告警与目标告警的抑制关系,根因告警触发后自动压住下游连锁告警,支持级联;
  • 静默:支持按时间窗、按标签静默,计划维护期间不再误报,支持设置到期时间。

老版本已有的告警规则无需改动,升级后聚合逻辑自动生效。抑制和静默的配置建议在采集端同步到最新版后再启用,否则不会下发到边缘节点。通知里会带上聚合计数和受影响服务的链接,值班员一眼就能判断严重程度。

日志上下文跳转

排查时经常要顺着一条日志找前后文。v1.5.0 在日志详情页加了"上下文"按钮,一键展开该条日志前后 50 条;同时支持按 trace_id 反查同链路日志、按 host 反查同主机前后日志。配合类 SQL 检索,定位到异常日志后能立刻还原现场,不用再手动翻页猜时间。上下文窗口大小可配,trace_id 和 host 反查复用检索的同一种语法,没有额外学习成本。

指标下钻

监控面板的图表现在可以下钻:在指标曲线上框选异常时间段,直接跳到对应时间窗口的日志列表,或进入链路追踪页查看该时段的调用。以前"指标异常 → 手动切到日志页翻时间"的几步操作,现在一次点击完成。下钻会保留你框选的时间范围,落到日志页的正是异常时段的日志,不用再重新收窄查询。

链路采样

为了控制高流量下的存储成本,链路追踪新增可配置采样:默认按 10% 概率采样,支持按服务、按错误强制保留——出错的全量保留,正常的按比例抽样。采样规则改动会实时生效,不需要重启服务。还可以把健康检查类端点排除在采样之外,避免合成流量污染链路视图。

其他修复与改进

  • 修复日志检索在超大时间范围下的内存占用问题,查询稳定性明显提升;
  • 采集端优化断线重连,网络抖动时不再丢数据,本地缓存上限可配;
  • 新增一批开箱即用的告警规则模板(CPU、内存、磁盘、慢查询),新租户可以一键套用;
  • 修复达梦数据库慢 SQL 视图在部分版本下字段映射错误的问题。
  • 优化控制台首页加载速度,大租户下打开更快;
  • 告警通知支持附跳转链接,点击直达对应的图表或日志页。

下一步计划

v1.6 的重点是告警根因分析:在告警通知里直接带上关联的日志和链路入口,把"发生了什么"和"为什么发生"合并到一条通知里。同时会补齐静默跨午夜的时区修复,并增加更多国产数据库的指标采集,覆盖人大金仓、GBase 等。

升级与兼容性

  • 升级方式:单二进制替换 + 重启即可,数据格式向下兼容,无需迁移;
  • 依赖变化:采集端建议同步升级到 v1.5.0,否则抑制/静默/采样配置不会下发到边缘节点;
  • 已知问题:静默窗口跨午夜时,UTC 时区的租户需要手动偏移,下一版修复;
  • 弃用提醒:旧的 alert.group 字段将在 v1.7 移除,请改用 group_by

完整变更列表见官网文档。升级过程中遇到问题,可以在控制台提交工单,附上版本号和 trace_id,方便快速定位。