← 返回文章列表
更新日志 4 分钟阅读 炬鲸团队

炬鲸 OBSERVE v2.4.0:采集代理、告警静默窗口与检索性能优化

v2.4.0 带来轻量采集代理、告警静默窗口与值班轮换、日志检索性能提升与导出优化,并修复了若干已知问题。附升级步骤、兼容性说明、性能实测数据与下版本预告。

v2.4.0 的改动集中在三个方向:把接入做得更省心、把告警做得更可控、把检索做得更快。急着升级的可以直接跳到末尾看升级步骤和兼容性说明,其余部分按功能逐个说明。

新增:轻量采集代理

这次发布了一个单二进制采集代理(约 20MB),可直接部署在应用主机上采集日志文件和系统指标,替代手工配置的 Logstash / Filebeat。支持 JSON 解析、多行堆栈合并、按正则过滤,配置与平台端联动,改采集规则不用 SSH 到每台机器。

curl -fsSL https://dl.jjhub.cn/agent/install.sh | bash
jjhub-agent --token <token> --endpoint https://ob.example.com

代理设计上默认做本地缓冲:平台短暂不可用时日志先落盘排队,恢复后自动补传,避免采集端丢数据。这一点对生产环境尤其重要——网络抖动不该成为丢日志的理由。

新增:告警静默窗口与值班轮换

  • 静默窗口:按服务、主机、时间段配置,发布或压测期间一键静默,到期自动恢复,并支持与变更管理联动自动开关
  • 值班轮换:支持周/月排班,交接自动切换告警接收人,告警不再打到全员
  • 告警分组:同一波抖动归并成一条聚合事件,减少刷屏

这三个能力组合起来,解决的是同一个老问题:告警太多导致没人看。具体配置和用法见《告警风暴治理》一文。

优化:检索与导出

  • 日志检索:大时间范围查询性能提升约 40%,索引冷热分层后冷数据查询不再拖慢热数据
  • 链路追踪:长链路水合(hydration)更流畅,万级 span 的 trace 也能秒开
  • 导出:支持按查询结果导出 CSV / JSON,单次上限从 1 万条提高到 10 万条
  • 新增「收藏查询」:常用检索语句可保存为模板,团队共享

性能实测数据

本轮性能优化在内部基准上测了一组数据(16 核 / 64G 内存、1 亿条日志):

  • 大时间范围查询(30 天):P99 延迟从 3.2s 降到 1.9s,约 40%
  • 万级 span 的 trace 打开时间:从 2.8s 降到 0.9s
  • 采集代理内存占用:稳态约 40MB,压测峰值 120MB

数据因环境和数据分布而异,以上仅供参考,建议在你们自己的数据集上跑一遍再下结论。

修复

  • 修复短信模块与工具函数命名冲突导致的编译失败
  • 修复部分场景下告警规则不触发的问题
  • 修复麒麟环境下文件监听器偶发漏读日志尾部的问题
  • 修复达梦数据库下分页检索返回重复记录的问题
  • 修复审计日志在高并发下偶发写入丢失的问题

升级步骤与兼容性

  1. 备份当前数据目录与配置
  2. 用新二进制替换旧版本,重启服务(配置向后兼容,无需改动)
  3. 升级后到「版本信息」页确认版本号为 v2.4.0,并跑一遍采集与告警自检

兼容性说明:v2.4.0 对 API、数据库表结构、采集 Token 均向后兼容,老版本采集端无需同步升级。生产环境建议在低峰期升级,先灰度一台,观察一小时再全量;如遇异常,回滚二进制并恢复备份即可,数据层无破坏性变更。

下个版本预告

v2.5 目前规划的重点:

  • 采集代理支持 Windows 与更多国产化系统
  • 告警升级(escalation):P0 无人响应时自动升级到上级
  • 检索增加正则与模糊匹配
  • 信创环境的一键部署脚本

以上为规划方向,不承诺发布时间,以正式发布说明为准。