v2.4 正式发布,新增告警静默窗口与分组抑制、按服务配置的链路采样策略,并补充南大通用 GBase、统信 UOS、麒麟 V10 SP3 等信创组件适配,含升级说明。
炬鲸 OBSERVE v2.4 正式发布。本版本聚焦三个方向:告警的降噪能力、链路追踪的采样控制,以及信创组件的适配补充。以下是核心变更。
告警风暴是运维最头疼的问题之一。一个核心节点抖动,可能瞬间触发上百条告警,把真正重要的信息淹没。v2.4 新增两个能力:
静默窗口:为告警规则配置定时静默,比如每天凌晨 3 点到 4 点是批量任务时间,这段时间的 CPU 告警自动降级为记录、不通知。配置在规则详情页,支持 Cron 表达式:
silence:
cron: "0 3 * * *"
duration: 1h
action: log
action 支持 log(只记录不通知)和 drop(完全不产生告警事件)两种,建议先用 log 观察一段时间再决定是否 drop。
分组抑制:同一故障源引发的多条告警自动合并为一条。系统按"服务 + 错误类型"对告警分组,首条告警正常通知,后续同类告警折叠为增量计数,故障恢复时汇总通知一次。这对"一个数据库挂了导致几十个接口同时告警"的场景特别有效。
之前的采样是 head-based 100%,低流量服务还好,高流量服务会产生大量无用数据、抬高存储成本。v2.4 支持按服务配置采样策略:
sampling:
service: order-service
strategy: parentbased_traceidratio
ratio: 0.1
rules:
- match: "http.route == /pay/**"
ratio: 1.0
上面的配置对 /pay/** 的支付链路保留 100% 采样,其余流量按 10% 采样。采样规则支持基于 span 属性的条件匹配,规则按顺序匹配、先命中先生效,能满足"关键路径全采、普通路径抽采"的需求。
采样策略在采集端生效,改配置后不需要重启服务,Agent 会在下一个采样周期自动拉取。
v2.4 在信创方向补齐了三项:
除了三大方向,本版本还有一批小的改进:
修复方面,本版本解决了 12 个已知问题,其中一个检索大时间范围时偶发的查询超时建议尽快升级修复,另一个是达梦后端下告警历史查询变慢的问题。
升级方式不变,停机窗口约 10 分钟:
./bin/observe-server upgrade v2.4.0.tar.gz
两个兼容性提醒:一是告警规则导出格式有调整,旧版导出的规则 JSON 需用迁移工具转换一次(工具在安装包的 tools/ 目录);二是 v2.3 的客户端 SDK 仍可正常上报,无需强制升级,但采样新特性只在 v2.4 的 Agent 上生效。
完整变更清单见版本发布页,欢迎在社区反馈问题。