← 返回文章列表
更新日志 3 分钟阅读 炬鲸团队

炬鲸 OBSERVE v2.5 更新:日志聚类异常检测、指标预测告警与联邦查询

v2.5 带来日志聚类与异常检测、基于历史基线的指标预测告警、跨集群联邦查询,并对中文分词检索和告警通知做了优化,修复若干已知问题。

新增:日志聚类与异常检测

海量日志里,真正值得看的往往是被淹没的「新模式」。v2.5 对错误日志做实时聚类,把高度相似的日志归成一组,按出现频次排序。某类报错从每小时几十条突然涨到几千条,聚类结果会把它顶到最前,而不是散落在几十万条日志里。

cluster:
  enabled: true
  source: error_logs
  similarity: 0.85
  window: 5m

聚类只做展示和提示,不丢弃原始日志;点进任意一组,仍能展开看每一条原始内容。对日志量大的团队,这是排查「未知故障」最快的入口。相似度阈值 similarity 建议从 0.85 起步,聚得太碎就调低,聚得太粗就调高。

新增:指标预测告警

固定阈值告警的毛病是:白天和夜间的流量基线不同,同一阈值要么白天误报、要么夜间漏报。v2.5 支持基于历史数据的预测告警——系统按过去数周同一时段的指标分布,自动学习上下界,当实际值显著偏离预测区间时触发。

alert:
  name: order-qps-anomaly
  type: forecast
  metric: order_qps
  sensitivity: 3
  lookback: 4w

sensitivity 控制偏离多少倍标准差才算异常,越大越不敏感。预测告警适合流量有明显周期性(按天、按周)的业务指标;对平稳指标,传统阈值仍然更直接,两者可以并存,不必二选一。

新增:跨集群联邦查询

多个机房、多个信创环境各跑一套可观测平台时,以前要切平台看数据。v2.5 支持把子集群注册到中心平台,在中心发起跨集群查询,按集群聚合、下钻到单集群详情。数据仍留在各自集群,不集中存储,适合集团或多机房场景。

优化与修复

  • 中文分词检索:支持自定义词典,日志里的业务专有名词检索命中率提升
  • 告警通知:企业微信 / 钉钉支持消息模板变量,通知里直接带上指标值和趋势链接
  • 修复尾采样在跨天边界偶发漏采的问题
  • 修复大时间范围 trace 水合偶发超时
  • 修复 Token 轮换后部分采集端 401 的问题

升级说明

本次向后兼容,配置文件无需改动。日志聚类和预测告警为可选功能,升级后默认关闭,在控制台按需开启。建议先在测试环境跑一轮回归,再滚动升级生产节点。