炬鲸 OBSERVE v1.5.0 发布:告警引擎支持聚合、抑制与静默;日志检索新增上下文跳转与 trace_id 反查;指标面板支持下钻到日志与链路;链路追踪加入可配置采样。附升级说明与兼容性提醒。
这次更新主要解决两件一直被吐槽的事:告警太吵,以及排查时要在日志、指标、链路三个页面之间来回切。告警引擎重写后,同类告警默认合并、根因告警自动压住下游噪声;日志上下文和指标下钻则把"看到异常"到"找到原因"的距离缩短到一次点击。下面的改动都是围绕这两点展开的。
v1.5.0 重写了告警引擎的通知链路。新增三项能力:
group_by 维度把同源告警合并为一条通知,附带聚合计数,30 秒窗口内同类告警只触发一次;老版本已有的告警规则无需改动,升级后聚合逻辑自动生效。抑制和静默的配置建议在采集端同步到最新版后再启用,否则不会下发到边缘节点。通知里会带上聚合计数和受影响服务的链接,值班员一眼就能判断严重程度。
排查时经常要顺着一条日志找前后文。v1.5.0 在日志详情页加了"上下文"按钮,一键展开该条日志前后 50 条;同时支持按 trace_id 反查同链路日志、按 host 反查同主机前后日志。配合类 SQL 检索,定位到异常日志后能立刻还原现场,不用再手动翻页猜时间。上下文窗口大小可配,trace_id 和 host 反查复用检索的同一种语法,没有额外学习成本。
监控面板的图表现在可以下钻:在指标曲线上框选异常时间段,直接跳到对应时间窗口的日志列表,或进入链路追踪页查看该时段的调用。以前"指标异常 → 手动切到日志页翻时间"的几步操作,现在一次点击完成。下钻会保留你框选的时间范围,落到日志页的正是异常时段的日志,不用再重新收窄查询。
为了控制高流量下的存储成本,链路追踪新增可配置采样:默认按 10% 概率采样,支持按服务、按错误强制保留——出错的全量保留,正常的按比例抽样。采样规则改动会实时生效,不需要重启服务。还可以把健康检查类端点排除在采样之外,避免合成流量污染链路视图。
v1.6 的重点是告警根因分析:在告警通知里直接带上关联的日志和链路入口,把"发生了什么"和"为什么发生"合并到一条通知里。同时会补齐静默跨午夜的时区修复,并增加更多国产数据库的指标采集,覆盖人大金仓、GBase 等。
alert.group 字段将在 v1.7 移除,请改用 group_by。完整变更列表见官网文档。升级过程中遇到问题,可以在控制台提交工单,附上版本号和 trace_id,方便快速定位。