← 返回文章列表
产品动态 3 分钟阅读 炬鲸团队

炬鲸 OBSERVE 产品能力全景:日志、指标、链路一平台打通

介绍炬鲸 OBSERVE 日志管理、监控告警、链路追踪三大模块各自能力,以及通过 trace_id、span_id、host 三字段串起三者的协同机制,并给出从日志起步、逐步接入指标和链路的落地路径。

炬鲸 OBSERVE 产品能力全景:日志、指标、链路一平台打通

炬鲸 OBSERVE 把日志管理、监控告警、链路追踪放进同一个平台,数据互通、统一查询。本文讲清楚三个模块各自解决什么问题、怎么配合,帮你判断该从哪里起步。

日志管理:从采集到检索一条链路

日志模块回答的问题是"故障现场在哪里"。采集端 Agent 支持 Filebeat 风格的通配路径、多行合并(Java 异常堆栈)、时间戳解析,并按 Pod/Namespace 自动打标签。日志进入索引层后,支持按字段过滤、全文搜索,以及 Grok 字段提取。

查询语法接近 SQL,例如:

level:ERROR AND service:order-svc AND time:[now-1h TO now]

常见的第一个收益,是把一堆非结构化的应用日志变成可按字段检索的记录。建议先把 level、service、trace_id 三个字段提取出来,后续的告警和链路关联都建立在这三个字段之上。字段提取按日志源分别配置,写一条 Grok 规则或对 JSON 日志直接打上标记即可。索引层面按天滚动、按项目隔离,冷数据可以归档到对象存储,既保查询又控成本。

监控告警:指标采集与分级通知

指标模块对接 Prometheus,支持 Remote Write 直写,也支持主动拉取 exporter,现有的 Prometheus exporter 无需改动即可复用。告警规则用 PromQL 编写,通知渠道覆盖邮件、企业微信、钉钉、Webhook。

我们按 P0-P3 四级告警配合值班表:P0 立即电话通知人,P3 进入工作时段处理的队列。这一层分级是我们见过最有效的防告警风暴手段——把无害的噪音告警挡在外面,让真正重要的告警不被淹没。

链路追踪:OpenTelemetry 原生

链路模块以 OpenTelemetry 为唯一标准,兼容 Jaeger/Zipkin 协议。Trace 与日志通过 trace_id 关联,从一次慢请求可以直接下钻到对应日志和指标,不用在多个系统之间来回切换。

三者如何协同

日志、指标、链路不是三套孤立系统。我们通过 trace_id、span_id、host 三个字段把三者串在一张表里。定位一次线上故障的标准路径是:告警触发 → 打开关联 Trace → 找到慢 span → 下钻该 host 的日志。

落地建议:先从日志模块起步,跑通采集和检索;再逐步接入指标和链路;最后做三者关联。每一步都有独立价值,不必一次到位。