v1.4.0 上线原生 OTLP/HTTP 接入、Kubernetes 日志指标采集模板、告警静默与分组,并修复若干链路追踪与检索问题。
v1.4.0 是这个季度最大的一次更新,重点是把 OpenTelemetry 从「兼容」做到「原生」,并补上 Kubernetes 采集和告警体验。下面是完整的更新说明和升级注意事项,升级前请务必看完最后一段。
这一版直接支持 OTLP/HTTP 协议,任何发 OTLP 数据的 SDK 或 Collector 都能无缝接入,不用再走中间适配层,兼容 OpenTelemetry 1.x SDK 的 traces、metrics、logs 三类信号。已有 OTel 埋点的团队改一个 endpoint 就能上报;还没埋点的,可以用我们提供的 Java/Go 自动埋点 Agent,把 HTTP、RPC、数据库调用自动串成 trace,无需改代码。Java Agent 目前支持 Spring Boot、Dubbo、gRPC 和主流 JDBC 驱动,Go Agent 覆盖 net/http、gRPC 和常用 ORM。如果你之前因为「给每个服务埋点像个大工程」而迟迟没上链路追踪,这一版把借口拿掉了。
同时新增 Kubernetes 采集:内置配置模板,控制台一键下发 DaemonSet,自动采集容器日志和 cAdvisor 指标,日志自动附带 Pod、命名空间、标签等元数据,支持 Helm 安装,适配 containerd 和 Docker 两种运行时,省去手写 Collector 配置的时间。
告警规则支持静默窗口(维护期免打扰)和按服务/告警类型分组,避免一次故障刷屏几百条通知。新增告警触发历史页,能看到每条告警的触发与恢复时间线,方便复盘,也留下故障持续时长的记录。规则里新增 for 持续时长字段,减少瞬时抖动造成的误报——误报正是让人开始忽视告警的元凶。
LIKE 通配符转义错误本次升级包含存储层索引结构变更,升级后后台会自动重建索引,期间检索可能短暂变慢,建议在业务低峰期执行。升级前请备份数据库,升级完成后核对告警规则是否全部恢复。v1.3 的旧版自定义 Collector 配置继续兼容,但建议迁移到新的内置模板,旧模板将在 v1.5 弃用。已知问题:极端情况下超大 Trace(超过 5000 个 span)水合仍有延迟,将在 v1.4.1 处理。升级过程中遇到问题,可在控制台右上角「帮助」提交反馈,附上版本号和错误日志能显著加快处理。
本次更新共合并了 40 多个 PR,感谢所有参与内测的用户。下一版 v1.4.1 会重点处理超大 Trace 水合延迟,并为告警规则增加更多聚合算子。