[发明专利]一种基于加权融合的Loc2vec模型的重复数据检测方法在审
申请号: | 202110824753.4 | 申请日: | 2021-07-21 |
公开(公告)号: | CN113591474A | 公开(公告)日: | 2021-11-02 |
发明(设计)人: | 郑江滨;曹宏业;王寅隆 | 申请(专利权)人: | 西北工业大学 |
主分类号: | G06F40/289 | 分类号: | G06F40/289;G06F40/30;G06K9/62;G06N3/04;G06N3/08 |
代理公司: | 西北工业大学专利中心 61204 | 代理人: | 金凤 |
地址: | 710072 *** | 国省代码: | 陕西;61 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | 本发明公开了一种基于加权融合的Loc2vec模型的重复数据检测方法,首先,在数据处理层,将语料文件进行分词处理,将其用于Doc2vec模型的训练,同时对待检测的源数据进行分词处理,用于下一阶段的重复数据检测;随后在编码分析层,构建出训练后的Doc2vec模型,将该模型与LCS算法加权融合,得到用于核心字段重复性检测的加权相似度计算模型Loc2vec模型,使用Loc2vec模型对分词后的待检测数据进行相似度计算;最后,对数据相似度计算结果进行分析,相似度大于80%认定为重复数据,从而实现重复性数据项的检测。本发明使用大规模语料库对深度神经网络模型doc2vec进行无监督训练,可以充分使用语料库内的语义信息,大大减少了人工标记的工作量,提升了重复数据检测的效率与准确率。 | ||
搜索关键词: | 一种 基于 加权 融合 loc2vec 模型 重复 数据 检测 方法 | ||
【主权项】:
暂无信息
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于西北工业大学,未经西北工业大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/patent/202110824753.4/,转载请声明来源钻瓜专利网。