← 返回文章列表
更新日志 3 分钟阅读 炬鲸团队

炬鲸 OBSERVE v2.5 发布:动态阈值、敏感数据脱敏与采集性能优化

v2.5 带来基于历史基线的动态阈值、日志敏感数据自动脱敏、采集 Agent 资源占用下降与查询引擎优化,附升级步骤和向后兼容说明。

动态阈值:告别“CPU 90% 就报警”

固定阈值最大的问题是不知道业务“正常”长什么样。凌晨跑批 CPU 到 90% 是正常的,白天 90% 就是异常。v2.5 新增动态阈值:基于过去 7 天同时段的历史数据自动计算基线,指标偏离基线一定幅度才告警。

配置上多一个 baseline 选项:

rules:
  - name: cpu-anomaly
    expr: cpu_usage{service="billing"}
    baseline: weekly      # 按过去 7 天同时段计算
    deviation: 2.0        # 偏离基线 2 倍触发

动态阈值对“有明显周期”的指标效果最好(白天高晚上低、工作日高周末低)。冷启动期(新服务上线前两周)历史数据不足,建议先跑固定阈值,积累两周数据后再切动态。

敏感数据自动脱敏

日志里最常见的数据泄漏源:手机号、身份证、银行卡号、token。之前要靠采集端写正则,v2.5 把脱敏下沉到采集管线,内置常见敏感类型识别,开箱即用:

masking:
  enabled: true
  rules:
    - type: phone       # 手机号
    - type: id_card     # 身份证
    - type: bank_card   # 银行卡
    - type: token       # JWT / token

脱敏在写入前完成,落库的就是 138****1234 这样的形式,原始数据不落盘。支持自定义正则补充业务特有的敏感字段(比如内部工号)。已经在跑的生产日志不受影响,脱敏只对新增配置生效。

采集性能优化

Agent 的 CPU 占用平均下降约 30%,主要来自三处:正则解析改用了编译缓存、批量压缩减少了系统调用、元数据注入去掉了重复的对象创建。在单节点 2 万条/秒的写入场景下,Agent CPU 从 1.2 核降到 0.8 核,内存占用也有下降。对低配信创服务器(飞腾/鲲鹏的入门型号)尤其友好。

查询与存储改进

  • 列式存储增加 ZSTD 压缩,日志存储成本平均下降 35%;
  • 跨天、跨周的大时间范围查询性能提升约 50%;
  • 看板新增导出 PDF/图片,值班报告直接导出。

升级说明

本次向后兼容,支持从 2.4 原地升级,数据格式不变。升级顺序:storage → ingester → querier → gateway → agent。动态阈值和脱敏为可选功能,升级后默认关闭,按需开启。升级前备份元数据,升级后跑一遍 ob-compat-check.sh。飞腾 + UOS + 金仓组合的镜像已同步到 2.5。