[发明专利]文档处理方法和系统有效
申请号: | 200910203108.X | 申请日: | 2009-05-27 |
公开(公告)号: | CN101901235A | 公开(公告)日: | 2010-12-01 |
发明(设计)人: | 崔洁;包胜华;张俐;苏辉;苏中 | 申请(专利权)人: | 国际商业机器公司 |
主分类号: | G06F17/30 | 分类号: | G06F17/30 |
代理公司: | 北京市金杜律师事务所 11256 | 代理人: | 王茂华;李辉 |
地址: | 美国纽*** | 国省代码: | 美国;US |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 文档 处理 方法 系统 | ||
1.一种对种子文档集中的种子文档进行扩展的方法,其中所述种子文档集包括至少一篇种子文档,所述方法包括:
识别所述种子文档的一个或多个实体词,所述实体词是表示所述种子文档所关注的实体的词;
依据所识别的每个实体词,识别该实体词所在的种子文档的一个或多个与所依据的该实体词相关的主题词;
将所识别的每个主题词,以及识别所述每个主题词时所依据的实体词组成实体词-主题词对;以及
将每个所述实体词-主题词对中的实体词和主题词同时作为关键词,通过网络获得一篇或多篇扩展文档,所述扩展文档既包含所述每个实体词-主题词对中的实体词,也包含所述每个实体词-主题词对中的主题词。
2.如权利要求1所述的方法,其中依据所识别的每个实体词,识别该实体词所在的种子文档的一个或多个与所依据的该实体词相关的主题词,包括依据该种子文档所包含的除了所述一个或多个实体词之外的其它词与所依据的实体词之间的距离,识别该实体词所在的种子文档的一个或多个与所依据的该实体词相关的主题词。
3.如权利要求1所述的方法,其中依据所识别的每个实体词,识别该实体词所在的种子文档的一个或多个与所依据的该实体词相关的主题词,包括依据该种子文档所包含的除了所述一个或多个实体词之外的其它词与所依据的实体词同时在该种子文档中的同一句话中出现的频率,识别该实体词所在的种子文档的一个或多个与所依据的该实体词相关的主题词。
4.如权利要求1所述的方法,还包括接收被推荐的种子文档,以形成所述种子文档集。
5.如权利要求1-4任一所述的方法,其中利用焦点实体词识别技术FNER来识别所述种子文档的一个或多个实体词。
6.如权利要求1-5任一所述的方法,其中利用焦点主题词识别技术FTD来识别所述种子文档的一个或多个主题词。
7.一种对候选文档集中的候选文档进行过滤的方法,所述候选文档集包括至少一篇候选文档,所述方法包括:
接收给定的一个或多个实体词-主题词对,每个所述给定的实体词-主题词对由一个实体词和一个主题词组成,所述实体词-主题词对中的所有实体词组成实体词集合,并且每个实体词所在的实体词-主题词对中的所有主题词组成对应于该实体词的主题词集合;以及
识别所述候选文档的一个或多个实体词,所述实体词是表示所述候选文档所关注的实体的词;
依据所识别的每个实体词,识别该实体词所在的候选文档的一个或多个与所依据的该实体词相关的主题词;
利用所述给定的实体词-主题词对中的实体词和主题词以及所述候选文档被识别的实体词和主题词,判断是否将所述候选文档加入过滤文档集,响应于判断结果为是,将所述候选文档加入过滤文档集。
8.如权利要求7所述的方法,其中依据所识别的每个实体词,识别所述候选文档的一个或多个与所依据的实体词相关的主题词,包括依据该候选文档所包含的除了所述一个或多个实体词之外的其它词与所依据的实体词之间的距离,识别该候选文档的一个或多个与所依据的实体词相关的主题词。
9.如权利要求7所述的方法,其中依据所识别的每个实体词,识别所述候选文档的一个或多个与所依据的实体词相关的主题词,包括依据所述候选文档所包含的除了所述一个或多个实体词之外的其它词与所依据的实体词同时在所述候选文档中的同一句话中出现的频率,识别所述候选文档的一个或多个与所依据的实体词相关的主题词。
10.如权利要求7-9任一所述的方法,其中利用所述给定的实体词-主题词对中的实体词和主题词、以及所述候选文档被识别的实体词和主题词,判断是否将所述候选文档加入过滤文档集进一步包括对所述候选文档执行下列操作:
响应于所述候选文档的实体词与所述实体词集合中的任一实体词均不同,判断不将所述候选文档加入所述过滤文档集。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于国际商业机器公司,未经国际商业机器公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/200910203108.X/1.html,转载请声明来源钻瓜专利网。