← 返回文章列表
更新日志 3 分钟阅读 炬鲸团队

炬鲸 OBSERVE v2.6 发布:Trace 日志关联、采样策略与查询加速

v2.6 打通 Trace 与日志关联(一个 trace_id 两边看)、采样策略收拢到控制台中心化配置、日志稀疏索引与查询下推带来显著提速,附升级步骤和向后兼容说明。

Trace 与日志关联:一个 trace_id 两边看

v2.5 之前,Trace 和日志是两套系统,查一条慢请求要先把 trace 里的时间窗抄下来,再到日志里按时间过滤,来回切换。v2.6 把两者打通:在 Trace 详情页直接展示这个 Span 时间窗内的关联日志,反向也成立——看到一条报错日志,点一下就能跳到它所属的 Trace。

实现上不复杂:采集端把 trace_id 作为日志的一个字段打进去,查询引擎按 trace_id + 时间窗做关联。对已有数据,只要日志里带了 trace_id,升级后自动生效,不用重新采集。

采样策略中心化

之前采样率散落在每个 Agent 的配置里,改一个服务要登录对应机器改配置。v2.6 把采样策略收拢到控制台,按服务、按命名空间统一配置,支持:

  • 固定比例采样(如 10%);
  • 尾采样:慢请求、出错请求 100% 保留;
  • 按路由/接口粒度的采样,比如只对 /pay 全量采样。

策略变更分钟级生效,Agent 自动拉取,不用重启。这对大促前"临时把核心链路采样率调到 100%"这种操作特别友好——以前要改几十台机器,现在控制台点一下。

查询加速与存储成本

  • 日志检索引入稀疏索引,按常用字段(service、level、trace_id)建索引,点查从分钟级降到秒级;
  • 时序查询增加下推,聚合下推到存储节点,减少数据传输;
  • 冷数据段合并策略优化,长期存储成本平均下降 20%。

实测:1 亿条日志的库,按 service + 关键词点查从 40 秒降到 3 秒;跨 30 天的时间序列聚合从 18 秒降到 5 秒。

其他更新

  • 告警通知支持按值班表自动轮换,不用手工改接收人;
  • 看板新增 Trace 火焰图视图,慢函数一眼定位;
  • 采集 Agent 支持 Prometheus remote_write 兼容的指标上报,老监控系统可以平滑迁移。

升级说明

v2.6 向后兼容 v2.5,数据格式不变,支持原地升级。升级顺序:storage → ingester → querier → gateway → agent。采样策略中心化后,老的 Agent 本地采样配置会被控制台策略覆盖,升级前记得把散落的本地配置导出存档。飞腾 + UOS + 金仓、鲲鹏 + 麒麟 + 达梦、龙芯 + 麒麟 + openGauss 三套信创镜像已同步到 2.6。