v2.4 版本上线:日志检索全面 SQL 化、告警支持按维度聚合收敛、链路追踪新增尾采样、信创环境新增龙芯与达梦 DM8 适配。本文列出新增、改进、修复与升级注意事项。
炬鲸 OBSERVE v2.4 正式发布。这版重点是日志检索 SQL 化转正、告警聚合收敛,以及信创适配的进一步扩展。
SQL 化日志检索(正式版)
日志检索从关键词模式升级为完整 SQL:支持 SELECT / WHERE / GROUP BY / ORDER BY / LIMIT,字段聚合、多条件过滤、时间窗口分析都能直接在检索页写出来,并支持把查询存为视图、另存为告警。聚合函数新增 PERCENTILE(分位数)与 DATE_FORMAT,方便做长尾耗时分析与时间归组。从关键词切到 SQL 有学习成本,所以我们保留了原关键词搜索入口,两者并存,可以逐步过渡。
告警聚合收敛
高频告警最容易“炸群”。现在告警规则支持按维度(如 host、region、error_code)聚合,同一维度的事件合并成一条,带计数与首末次时间,通知一次到位。比如一次数据库故障会让 20 台机器同时报连接超时,聚合后只发一条告警,附上涉及的 20 台机器清单。聚合窗口与合并策略可在规则里单独配置。
链路追踪尾采样
新增基于策略的尾采样:按 error 标记、耗时阈值、指定服务三种策略,把“带错误或超时的 trace”全量保留,正常请求按比例采样。既控制存储成本,又不错过关键慢链路。尾采样在 Collector 端完成,对业务进程零改动,只需在控制台开启策略。采样策略可在服务维度覆盖,不必全局统一。
信创适配扩展
新增龙芯 3A5000 / LoongArch 架构支持,元数据存储新增达梦 DM8 适配,麒麟 V10 LoongArch 版与统信 UOS 1060 全量通过验证。本次还补齐了龙芯平台的 Agent 二进制与容器镜像,信创用户可以一键拉取。
GROUP BY 聚合 P95 从 2.8 秒降到 2.1 秒。GROUP BY 时间字段在跨天查询时归组错位的问题。PERCENTILE 聚合在数据量极大时精度有轻微偏差,建议暂时用 APPROX_PERCENTILE。完整变更见官网文档「版本历史」,升级过程中的问题可提交工单,我们按影响级别响应。
v2.5 已在开发中,重点是指标异常检测与全新的瀑布图(waterfall)链路视图。如果你对 v2.4——尤其是新的 SQL 检索——有反馈,欢迎提交工单或在社区里提,我们会按“生产环境实际使用频率”来排优先级。