医院 HIS/LIS 高峰期卡顿,往往牵涉数据库、接口、消息队列多个环节。本文给出面向医院信息科的可观测落地路径:先接日志与链路,再用业务维度对齐,并兼顾数据安全,把定位时间从天压到分钟。
医院信息系统(HIS/LIS)有两个特点让可观测格外难做:一是"停不起",挂号、缴费、取药一旦卡住,排队的人立刻堵到窗口,故障的社会影响不是一条 SLA 能描述的;二是链路长,一次挂号从自助机、HIS、支付网关到医保结算平台,横跨多个系统甚至多家厂商,出问题谁都不认账。信息科最需要的,是一个能把这条链路完整串起来的工具,让"谁的问题"变成"哪一步的问题"。
第一步不是上大屏,是把散在各处的数据收起来:
炬鲸 OBSERVE 支持多租户,把门诊、住院、检验、体检拆成不同租户,各科室只能看自己的数据,信息科统一运维,兼顾隔离与集中管理。
技术排查最容易卡在"和业务对不上"。做法是约定一个贯穿全程的业务标识——挂号流水号或就诊卡号,在所有日志和 Span 里都打上。故障时,输入流水号就能看到:自助机发起挂号 → HIS 建号 → 支付网关扣款 → 医保结算返回,每一步的耗时和报错。比如一次"医保结算超时"投诉,过去要问自助机厂商、问支付网关、问 HIS 开发,来回半天;现在按流水号一查,直接看到是医保平台那一步等了 20 秒超时,责任和原因都清楚了。不用再问"你那台机器几点报的错",定位从"找谁"变成"看哪一步"。
医院数据高度敏感,接入可观测时要同步做好几件事:日志里的身份证号、手机号、诊断信息在采集端就做脱敏,患者 ID 这类必要标识可以保留但要有权限控制;查询日志和导出行为要留审计,谁在什么时候查了谁的记录可追溯;数据只存内网、私有化部署,不出院。合规不是上线后再补的事,而是接入方案的一部分,否则信息科会被安全评审卡住。这些动作不会拖慢接入,脱敏和权限都在采集端完成,面板查询速度不受影响。
门诊高峰在上午 8-10 点,缴费高峰在就诊后。提前给关键指标设阈值:挂号接口 P99 延迟、支付成功率、自助机在线率。告警按"业务影响"分级——支付成功率跌 1% 属于 P1,单台自助机离线属于 P3,避免高峰时段被次要告警淹没。还可以用异常检测对"工作日 vs 周末"建立不同的基线,避免周末低流量被误判成暴跌。
不要一上来全接。先挑一条最高频、最痛的链路(通常是挂号)跑通,信息科能在一个高峰周期内看到效果,再推广到缴费、取药、检验。落地时优先保证两件事:业务标识(流水号)在改造的第一批就统一,避免返工;告警分级在接数据的当天就定下来,避免上线第一天就被噪声淹没。还有一个容易被忽略的点:给信息科配一个值班视图,把门诊、住院、支付几条核心链路的健康状态集中到一页,高峰时段盯这一页就够了,不用在几十个面板里找。可观测在医院是"保运行"的基础设施,评判标准只有一个:下一次高峰卡顿,能不能在 5 分钟内定位到是哪个环节。