v2.5 带来日志聚类与异常检测、基于历史基线的指标预测告警、跨集群联邦查询,并对中文分词检索和告警通知做了优化,修复若干已知问题。
海量日志里,真正值得看的往往是被淹没的「新模式」。v2.5 对错误日志做实时聚类,把高度相似的日志归成一组,按出现频次排序。某类报错从每小时几十条突然涨到几千条,聚类结果会把它顶到最前,而不是散落在几十万条日志里。
cluster:
enabled: true
source: error_logs
similarity: 0.85
window: 5m
聚类只做展示和提示,不丢弃原始日志;点进任意一组,仍能展开看每一条原始内容。对日志量大的团队,这是排查「未知故障」最快的入口。相似度阈值 similarity 建议从 0.85 起步,聚得太碎就调低,聚得太粗就调高。
固定阈值告警的毛病是:白天和夜间的流量基线不同,同一阈值要么白天误报、要么夜间漏报。v2.5 支持基于历史数据的预测告警——系统按过去数周同一时段的指标分布,自动学习上下界,当实际值显著偏离预测区间时触发。
alert:
name: order-qps-anomaly
type: forecast
metric: order_qps
sensitivity: 3
lookback: 4w
sensitivity 控制偏离多少倍标准差才算异常,越大越不敏感。预测告警适合流量有明显周期性(按天、按周)的业务指标;对平稳指标,传统阈值仍然更直接,两者可以并存,不必二选一。
多个机房、多个信创环境各跑一套可观测平台时,以前要切平台看数据。v2.5 支持把子集群注册到中心平台,在中心发起跨集群查询,按集群聚合、下钻到单集群详情。数据仍留在各自集群,不集中存储,适合集团或多机房场景。
本次向后兼容,配置文件无需改动。日志聚类和预测告警为可选功能,升级后默认关闭,在控制台按需开启。建议先在测试环境跑一轮回归,再滚动升级生产节点。