← 返回文章列表
产品动态 4 分钟阅读 炬鲸团队

炬鲸 OBSERVE 产品能力全景:日志、监控、链路一体化

介绍炬鲸 OBSERVE 如何把日志、指标、链路三类数据统一到一个平台:类 SQL 查询、冷热分层存储、告警降噪、OpenTelemetry 原生支持,以及一体化带来的排查效率提升。

炬鲸 OBSERVE 产品能力全景:日志、监控、链路一体化

三类数据,一套查询语言

炬鲸 OBSERVE 把日志(Logs)、指标(Metrics)、链路(Traces)统一到同一个平台。日志不再是"出了问题才去翻的文件",指标不再是图表上孤立的曲线,链路也不再是单独的一张调用图——三者通过 traceId、service、host 等字段天然打通,任何一次请求都能在日志、指标、链路之间来回跳转,全程不需要切换工具。

查询层采用类 SQL 语法,运维和开发不用再学一套新的 DSL。想查某个服务最近 10 分钟里状态码为 500 的请求日志,直接写:

SELECT * FROM logs
WHERE service = 'order-service' AND status = 500
  AND ts > now() - interval '10 minute'
ORDER BY ts DESC LIMIT 100;

全文检索、字段级过滤、正则、聚合统计全部支持,任意一条查询都可以一键转成告警规则,避免"查询写一遍、告警再写一遍"。

日志管理:采集到归档的闭环

采集端支持 Agent、Filebeat、Syslog、Kubernetes 容器日志等多种接入方式,内置解析规则自动识别 JSON、Nginx 访问日志、Java 异常堆栈等常见格式,字段自动结构化,检索时可以直接按字段过滤。存储层按冷热分层:热数据落 SSD 保证秒级检索,冷数据自动归档到对象存储降低成本。日志保留周期可按租户、按应用分别设置,满足不同业务的合规要求。

监控告警:先降噪再通知

指标采集兼容 Prometheus 生态,PromQL 直接可用,已有的 Exporter 无需改造就能接入。告警引擎支持多维聚合、滑动窗口、静默期和告警分组——同一台宿主机上 100 个容器同时 OOM,只会合并成一条告警发给值班人员,而不是 100 条轰炸。通知渠道覆盖企业微信、钉钉、飞书、邮件和 Webhook,支持按告警级别路由到不同群组,P0 走电话/短信,P3 只进群。

链路追踪:让慢请求现出原形

链路模块原生支持 OpenTelemetry 协议,接入后自动生成服务拓扑,实时展示 P99 延迟、错误率、吞吐量。点击任意一段 Span,能直接看到它关联的日志和宿主机指标,省掉"先看监控、再翻日志、最后猜代码"的排查流程。慢请求可以直接定位到具体的方法调用,而不是停在服务这一层。

一体化的价值

三类数据统一之后,最直接的收益是排查路径变短:告警触发时,从告警详情点进关联的 Trace,再顺着 Span 打开对应日志,一条线索串到底。平台按团队划分租户和项目,权限、配额、数据保留互相隔离,几十个团队共用一套实例也不会互相干扰,既省了重复部署的运维成本,也避免了数据串味。