← 返回文章列表
解决方案 3 分钟阅读 炬鲸团队

金融核心系统可观测性落地:从告警风暴到精准定位

金融核心系统的可观测性不能照搬互联网做法。本文给出告警分级 + 降噪 + 闭环的监控体系设计、跨系统链路追踪的交易号透传方案,以及脱敏、留存、审计三项合规落地要点。

金融场景的痛点

金融系统的可观测性有几个和互联网公司不同的约束:

  • 交易链路长:从网关、风控、账务到清算,一笔交易横跨十几个系统,出问题定位慢
  • 告警多且杂:阈值告警设置不合理,一次抖动能刷屏几百条,值班人员根本看不过来
  • 监管要求:日志必须留存、可审计、脱敏,出了问题要能回溯
  • 变更窗口少:核心系统只能凌晨变更,白天不能动,排查手段受限

这些约束决定了金融可观测性不能照搬互联网"采集全量、事后分析"的做法,要更强调告警质量、链路完整性和数据合规。

监控告警体系设计

我们给某城商行做落地的核心思路是"告警分级 + 降噪 + 值班闭环":

  1. 告警分级:P0(资金类,如对账不平)、P1(可用性,如接口超时率突增)、P2(性能,如 P99 上升)、P3(容量预警)
  2. 降噪:同源告警 5 分钟内聚合,只发一条;用环比/同比替代固定阈值,减少节假日、发版引起的误报
  3. 闭环:每条告警关联 runbook 链接,值班人员点开就能看到排查步骤和上次处理记录

关键指标建议:交易成功率、单笔耗时 P99、对账差异笔数、超时率。这些指标按交易类型、渠道、机构三个维度下钻。大屏按这个结构组织:顶部一行是交易成功率和资金类 P0 告警,中间是渠道维度的时间序列,底部是机构维度的对账差异排行,值班人员扫一眼就能判断是全局故障还是单机构问题。

链路追踪落地

金融链路追踪最大的难点是跨系统传递交易号。建议:

  • 统一用 trace_id 承载全局交易号,gateway 生成后向下透传
  • 用 baggage 传递机构号、渠道、业务单号,别塞进 span 属性(会有敏感信息泄露风险)
  • 采样策略按金额分级:大额交易 100% 采样,小额按比例
  • 关键节点(风控、账务扣款)打强制采样标记,保证任何异常都能回溯到完整链路

有一个细节值得强调:span 属性会随数据上报、可能被导出,敏感字段放 baggage 更可控,因为 baggage 可以单独配置是否跨系统传播、是否脱敏。实测这套方案把一笔交易的故障定位时间从小时级压到分钟级。

合规与数据安全

金融对数据的要求是硬性的,落地时三件事必须做:

  1. 脱敏:卡号、身份证、手机号在采集端就做掩码,平台侧只存脱敏后数据
  2. 留存:日志按监管要求留存(通常 3 年以上),冷数据转对象存储,成本可控
  3. 审计:谁在什么时间查了哪条日志、导出了什么,全部留痕,支持监管现场检查

数据不出域是底线,建议平台私有化部署,日志、链路、指标三套数据都在行内机房闭环。脱敏规则要可配置、可追溯,最好支持按字段白名单和正则两种方式,并且脱敏动作发生在采集器侧,而不是存到平台之后再处理——后一种方式等于把敏感数据先落了一次盘。