[发明专利]一种大规模文档相似性检测方法有效

专利信息
申请号: 201810251626.8 申请日: 2018-03-26
公开(公告)号: CN108595517B 公开(公告)日: 2021-03-09
发明(设计)人: 王诚;王宇成 申请(专利权)人: 南京邮电大学
主分类号: G06F16/33 分类号: G06F16/33
代理公司: 南京苏科专利代理有限责任公司 32102 代理人: 姚姣阳
地址: 210003 *** 国省代码: 江苏;32
权利要求书: 查看更多 说明书: 查看更多
摘要: 发明提出了一种大规模文档相似性检测方法,包括:S1、计算文档集中文档其他信息的相似度;S2、每篇文档内容对应一个签名S和一个f维向量V;S3、对文档内容进行分词处理;S4、特征词x的权重综合计算;S5、将特征词用哈希函数映射为签名h,遍历h的每一位,对V进行调整;S6、遍历V,对于签名S进行调整,最终生成签名S为文档内容对应的签名值;S7、将文档内容对应的签名值分为n块,使用哈希函数,映射到桶,并判断是否二次哈希;S8、同一个桶的文档作为候选对,计算相似度;S9、判断是否为相似文档。本发明检测的准确率高,执行效率高。可广泛用于互联网大规模数据挖掘中。
搜索关键词: 一种 大规模 文档 相似性 检测 方法
【主权项】:
1.一种大规模文档相似性检测方法,其特征在于,包括如下步骤:S1、输入文档集,计算文档集中文档其他信息的相似度;S2、文档集中每一篇文档内容对应一个初始化为0、长度为f的签名S,和一个初始化为0的f维向量V;S3、通过NLPIR分词系统对文档内容进行分词处理,过滤掉语气词、助词,并去掉干扰符号后将文档内容转换为一组特征词;S4、特征词x的权重综合使用TF‑IDF技术和单词的主题相关性计算,将中文术语长度函数作为特征词x的主题相关性函数,中文术语长度函数为其中,x表示特征词的长度,特征词x的权重计算公式为其中,tfx,j×idfx表示关键词x在文档j的TF‑IDF值,len(x)为单词x的主题相关性函数;S5、将所有特征词使用相同的哈希函数映射为长度为f的签名h,遍历h的每一位,若h的第i位为1,i介于1到f之间,V的第i位加上该特征词的权重,否则减去;S6、遍历V,如果V的第i位大于0,签名S的第i位设为1,否则设为0,最终生成的签名S就是文档内容对应的Simhash签名值;S7、将文档内容对应的Simhash签名值分为n块,对同块的签名值使用相同的哈希函数,映射到桶,检查每一个桶中的元素,判断元素数量有没超过(1+μ1)×AVEn,其中AVEn为桶中元素的平均值,μ1为权重,桶中元素数量超过的话进行二次哈希;S8、同一个桶的文档作为候选对,先使用文档内容对应的Simhash签名值进行海明距离的计算,然后使用第一步文档其它信息的相似度综合计算文档间的相似度,文档间的相似度的计算公式为其中Haming(A,B)表示A,B两篇文档内容的海明距离,minHash(A,B)表示A,B两篇文档其它信息的相似度,μ2的取值为0.8~0.9;S9、判断同一个桶中文档之间的相似度是否小于m值,若同一个桶中文档之间的相似度小于m值,即输出为相似文档,若同一个桶中文档之间的相似度不小于m值,即输出为非相似文档。
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。

该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于南京邮电大学,未经南京邮电大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服

本文链接:http://www.vipzhuanli.com/patent/201810251626.8/,转载请声明来源钻瓜专利网。

×

专利文献下载

说明:

1、专利原文基于中国国家知识产权局专利说明书;

2、支持发明专利 、实用新型专利、外观设计专利(升级中);

3、专利数据每周两次同步更新,支持Adobe PDF格式;

4、内容包括专利技术的结构示意图流程工艺图技术构造图

5、已全新升级为极速版,下载速度显著提升!欢迎使用!

请您登陆后,进行下载,点击【登陆】 【注册】

关于我们 寻求报道 投稿须知 广告合作 版权声明 网站地图 友情链接 企业标识 联系我们

钻瓜专利网在线咨询

周一至周五 9:00-18:00

咨询在线客服咨询在线客服
tel code back_top