← 返回文章列表
更新日志 4 分钟阅读 炬鲸团队

v1.4.0 更新:原生 OTLP 接入、Kubernetes 采集与告警静默

v1.4.0 上线原生 OTLP/HTTP 接入、Kubernetes 日志指标采集模板、告警静默与分组,并修复若干链路追踪与检索问题。

v1.4.0 是这个季度最大的一次更新,重点是把 OpenTelemetry 从「兼容」做到「原生」,并补上 Kubernetes 采集和告警体验。下面是完整的更新说明和升级注意事项,升级前请务必看完最后一段。

新增功能

这一版直接支持 OTLP/HTTP 协议,任何发 OTLP 数据的 SDK 或 Collector 都能无缝接入,不用再走中间适配层,兼容 OpenTelemetry 1.x SDK 的 traces、metrics、logs 三类信号。已有 OTel 埋点的团队改一个 endpoint 就能上报;还没埋点的,可以用我们提供的 Java/Go 自动埋点 Agent,把 HTTP、RPC、数据库调用自动串成 trace,无需改代码。Java Agent 目前支持 Spring Boot、Dubbo、gRPC 和主流 JDBC 驱动,Go Agent 覆盖 net/http、gRPC 和常用 ORM。如果你之前因为「给每个服务埋点像个大工程」而迟迟没上链路追踪,这一版把借口拿掉了。

同时新增 Kubernetes 采集:内置配置模板,控制台一键下发 DaemonSet,自动采集容器日志和 cAdvisor 指标,日志自动附带 Pod、命名空间、标签等元数据,支持 Helm 安装,适配 containerd 和 Docker 两种运行时,省去手写 Collector 配置的时间。

告警升级:静默与分组

告警规则支持静默窗口(维护期免打扰)和按服务/告警类型分组,避免一次故障刷屏几百条通知。新增告警触发历史页,能看到每条告警的触发与恢复时间线,方便复盘,也留下故障持续时长的记录。规则里新增 for 持续时长字段,减少瞬时抖动造成的误报——误报正是让人开始忽视告警的元凶。

优化与修复

  • 链路追踪查询性能提升 35%,大 Trace 水合更流畅
  • 修复 trace_id 未注入到部分中间件日志的问题
  • 修复类 SQL 检索中 LIKE 通配符转义错误
  • 修复达梦数据库下分页查询结果错乱的问题
  • 修复采样率动态调整后 Collector 未及时生效的问题
  • 修复告警静默窗口跨天时边界计算错误的问题

升级须知

本次升级包含存储层索引结构变更,升级后后台会自动重建索引,期间检索可能短暂变慢,建议在业务低峰期执行。升级前请备份数据库,升级完成后核对告警规则是否全部恢复。v1.3 的旧版自定义 Collector 配置继续兼容,但建议迁移到新的内置模板,旧模板将在 v1.5 弃用。已知问题:极端情况下超大 Trace(超过 5000 个 span)水合仍有延迟,将在 v1.4.1 处理。升级过程中遇到问题,可在控制台右上角「帮助」提交反馈,附上版本号和错误日志能显著加快处理。

本次更新共合并了 40 多个 PR,感谢所有参与内测的用户。下一版 v1.4.1 会重点处理超大 Trace 水合延迟,并为告警规则增加更多聚合算子。