慢病管理的第一步不是建模型,是把同一个人的五条记录认成同一个人。
一、第一道坎是认人
一个糖尿病患者,三甲医院系统里写着ICD编码E11.9,社区中心病历是扫描PDF,家里血压计走蓝牙传云端,药房记录用的是药品编码,微信里跟家庭医生说了一句"这两天头晕"。五条记录散在五个库,互不相认。
第一步是身份解析,说人话就是怎么知道这是同一个人。病历号、身份证号、手机号、微信OpenID,每个系统存的键不一样。硬匹配先跑,拿身份证号和手机号对齐。剩下的对不上,用概率匹配,算姓名相似度和生日相近度的综合分。
阈值设多少是个要命的问题。太高漏掉真实匹配,太低把两个人合成一个。我认为宁可漏不可错。漏了让患者再录一次,错了把两个人的病史搅在一起,不可逆。
二、格式翻译是体力活
认完人,第二件事是翻译。HL7是医院的老协议,CSV带中文表头,JSON没字段说明,PDF要先做文字识别。
两种思路:先定好数据结构再填,或者先存原始数据等用的时候再解析。前者干净但每接新数据源都要改表结构。后者快,原始数据先落盘,用的时候临时解析,但数据会越来越脏。大多数团队选后者,原因实际:数据先进来才有事可做。脏数据慢慢清,没数据什么都没有。
一项关于远程患者监测生态的研究指出,监测应用之间的数据互通存在持续断层,能用的小范围闭环和跨系统的数据断裂长期共存。这是整个生态的系统性缺口。
三、时间戳对不上才是致命的
3月5日抽了血,3月8日才出报告。3月6日系统已经自动跑了一次风险评估,用的是旧数据。3月8日新数据到了,已经算完的评估要不要推翻重来。
每份迟到数据都触发重算,系统会瘫痪。不触发,评估就是过期的。常见做法是按指标分档:高风险指标比如肌酐和糖化血红蛋白的迟到数据,触发重算。低风险的比如常规血压读数,攒一批一起处理。不是最优,是妥协。
那个糖尿病患者的五条记录,如果第一步认人就卡住了,后面的风险评估、个性化方案、随访提醒全是空转。数据融合不是做不做的问题,是先做什么、牺牲什么的架构决策。
免责声明
智慧医疗网转载其他网站内容,出于传递更多信息而非盈利之目的,内容仅供参考。版权归原作者所有,若有侵权,请联系我们删除。
本平台所发布信息的内容和准确性由提供消息的原单位或组织独立承担完全责任!
凡来源注明智慧医疗网的内容为智慧医疗网原创,转载需获授权。