[发明专利]一种多源异构医疗数据的标准化方法及装置有效
申请号: | 202110176998.0 | 申请日: | 2021-02-07 |
公开(公告)号: | CN112883157B | 公开(公告)日: | 2023-04-07 |
发明(设计)人: | 李红良;秦娟娟;张晓晶 | 申请(专利权)人: | 武汉大学 |
主分类号: | G06F16/33 | 分类号: | G06F16/33;G06F16/35;G06F18/22;G16H70/00 |
代理公司: | 湖北武汉永嘉专利代理有限公司 42102 | 代理人: | 张宇 |
地址: | 430072 湖*** | 国省代码: | 湖北;42 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 一种 多源异构 医疗 数据 标准化 方法 装置 | ||
本发明公开了一种多源异构医疗数据的标准化方法及装置,属于数据治理技术领域,其中,方法的实现包括:基于原始医疗数据构建多源异构医学数据映射文本,再基于标准术语集合和待映射文本集合生成标准化模型;根据映射结果人工标注,不断优化迭代升级标准化模型;构建成功多源医疗数据自动标准化模型及术语体系,其中,术语体系包括基础术语模块和疾病术语库。通过本发明可实现不同医疗机构,不同业务流程,不同存储方式的信息联通融合,本发明可大幅改善人工标准化效率低,准确度差等弊端,标准化术语的数据可大幅度降低数据治理的难度,有利于人工智能的方法实现多源医疗数据的整合,有助于医疗信息共享的问题。
技术领域
本发明属于数据治理技术领域,更具体地,涉及一种多源异构医疗数据的标准化方法及装置。
背景技术
医学术语是涵盖医学领域包括疾病名称、检查检验、治疗处置、手术护理操作等名称的综合。其数量庞大,构词复杂化及表达多样性等特点已经成为制约领域内信息共享和数据有意义使用的关键因素。目前国际上或国内均拥有多套在粒度和制定思路上不统一的医学术语标准体系,且繁重的医疗实际工作环境下产生的不规范的医疗记录使得目前多源异构数据难以整合。为实现卫生信息化的深入及健康大数据的应用,建立统一的医学术语体系及自动化数据标准化模型是迫切需要的。
现有技术中多是针对单种类医疗术语如药品名称及疾病诊断名称的统一术语体系,尚缺乏集合多种类医学术语的术语体系。现有对医学名词术语进行归一化的标准化技术中有两种,一是人工标注方法,其效率低且成本高。二是流行的人工智能深度学习方法,即通过海量数据训练自动化匹配模型,但是所依赖的大样本医疗标注数据极其难以获得,所以准确度和效率尚不能满足医疗数据的标准化要求。
发明内容
针对现有技术的以上缺陷或改进需求,本发明提出了一种多源异构医疗数据的标准化方法及装置,可以包容多源机构,多样业务流程的术语结构,可大幅改善人工标准化效率低,准确度差等弊端,有利于人工智能的方法实现多源医疗数据的整合,有助于医疗信息共享的问题。
为实现上述目的,按照本发明的一个方面,提供了一种多源异构医疗数据的标准化方法,包括:
(1)针对原始医疗数据中的原始指标名称进行预处理得到目标指标,并根据目标指标名称和内容预判断目标指标名称所在术语体系的父级分类名称;
(2)将各所述目标指标与标准术语表中的术语进行比对,从所述标准术语表中找出与各所述目标指标最相似的术语作为映射结果,并记录相似度;
(3)对于未在所述标准术语表中找出最相似术语的剩余目标指标,将各所述剩余目标指标与其父级分类名称下的标准术语进行相似性比对,若相似度值不大于第一阈值,则与隶属于所推荐父级分类名称下标准术语对应的既往积累的既往术语进行相似性比较,得到匹配结果。
在一些可选的实施方案中,步骤(2)包括:
将各所述目标指标作为标准化模型的输入文件,利用自然语言处理技术,生成词向量并将词向量与标准术语表中的术语进行比对,找出最相似的术语作为映射结果,生成映射结果及相似度,其中,相似度计算原则为名称字符一致性,通过所述标准化模型的输出结果包含数据来源、原始指标名称、预处理后的指标名称、指标分类、推荐匹配术语及匹配度。
在一些可选的实施方案中,步骤(3)包括:
(3.1)对于未在所述标准术语表中找出最相似术语的剩余目标指标,将该剩余目标指标与其父级分类名称下的标准术语进行相似性比对;
(3.2)取比对过程中的第一最大相似度值,若第一最大相似度值大于第一阈值,则输出匹配的标准术语,若第一最大相似度值不大于第一阈值则该剩余目标指标与隶属于所推荐父级分类名称下的标准术语对应的既往积累的既往术语进行相似性比较,得到第二最大相似度值;
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于武汉大学,未经武汉大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/202110176998.0/2.html,转载请声明来源钻瓜专利网。
- 数据显示系统、数据中继设备、数据中继方法、数据系统、接收设备和数据读取方法
- 数据记录方法、数据记录装置、数据记录媒体、数据重播方法和数据重播装置
- 数据发送方法、数据发送系统、数据发送装置以及数据结构
- 数据显示系统、数据中继设备、数据中继方法及数据系统
- 数据嵌入装置、数据嵌入方法、数据提取装置及数据提取方法
- 数据管理装置、数据编辑装置、数据阅览装置、数据管理方法、数据编辑方法以及数据阅览方法
- 数据发送和数据接收设备、数据发送和数据接收方法
- 数据发送装置、数据接收装置、数据收发系统、数据发送方法、数据接收方法和数据收发方法
- 数据发送方法、数据再现方法、数据发送装置及数据再现装置
- 数据发送方法、数据再现方法、数据发送装置及数据再现装置